
AI Agent 的能力和模型的能力到底哪个更重要一个常见的争论AI 系统的上限到底由什么决定——是底层大模型有多聪明还是包在外面的 Agent 工程有多精巧本文试图给出一个不回避、但比都重要更有信息量的答案。一、先把概念说清楚这场争论之所以常常鸡同鸭讲是因为双方说的能力不是一回事。模型能力指的是大模型本身的智力水平推理、知识、代码生成、长上下文理解、指令遵循。这是权重里的东西由预训练和后训练决定各种榜单和 benchmark 试图度量的就是它。到今天旗舰模型的迭代节奏已经快到 GPT-5.6、Claude Fable 5、Gemini 3.1 Pro、Grok 4.6、Kimi K3 轮番登顶、月度易主的程度。Agent 能力指的是把模型变成能干活的人所需的整套系统业界现在普遍称之为Harness马具/脚手架工具定义与调用、上下文管理、记忆、规划与拆解、错误重试、权限与沙箱、多智能体编排、可观测性。业界流传着一个公式Agent Model Harness。你不是模型你就是脚手架。裸模型不是 Agent。它只是在给定 prompt 时吐出文本的网络。是 Harness 给了它手工具、记忆状态、反馈回路和约束它才变成能在真实世界里执行多步任务的系统。二、Agent 工程的论据同一个模型天壤之别的分数支持Agent 能力更重要的一方手里有相当硬的数据。最著名的是 SWE-bench 上的现象同一个底层模型在不同的 Agent 脚手架下得分可以差出几十个百分点。业界实测记录过同一旗舰模型在一套脚手架下拿 80 分上下、换一套条件掉到 46 分——模型没变Harness 变了三十多分的差距完全来自脚手架。研究者们把这叫做“脚手架溢价”scaffolding premium。仅更换脚手架同一模型的分数波动 10 到 15 个百分点是常态极端案例甚至测出数倍的差距。另一个经典案例来自更早的模型时代在法律合同结构化提取任务上精心设计的切分与分层摘要脚手架让上一代的便宜模型在准确率上反超了裸用的旗舰模型——而成本只是零头。这个规律在今天依然成立。逻辑上这也说得通模型只能处理 Harness 喂给它的东西。上下文组装得差、工具定义得烂、错误没人兜底再强的模型也只能产出烂结果。Databricks 对此有句总结“强大的 Harness 让平庸的模型变得有用糟糕的 Harness 浪费最好的模型。”而且模型正在商品化——Anthropic、OpenAI、Google、Moonshot、xAI 彼此之间的能力差距以月为单位收敛换模型只是改一行配置而 Harness 是定制的、难复制的、针对具体 workload 的。像 Claude Code 这样的顶级 Agent 产品真正与模型交互的代码只占其工程总量的很小一部分大头全是脚手架。模型在 demo 里拿功劳Harness 在生产环境背锅。三、模型派的反击护城河正在消失而且速度惊人但Agent 能力更重要这个结论有一个致命的时效性问题你精心打磨的脚手架可能在下一代模型发布时变成负资产。中文开发者圈里做 Agent 越久越悲观的焦虑正在于此Prompt 设计、工具调用、Skills 编排这些中间层工程正在被基座模型的后训练快速消化——你今天调通的工程方案下一版模型直接内置了。中间层红利天然短周期这是结构性问题。这催生了一个新概念——Harness 债harness debtAgent 脚手架里编码了大量模型自己做不到的假设你为绕过模型缺陷加的每个组件在缺陷消失的那一刻就从资产变成负债而且它不是无害地闲置而是主动压低模型的实际表现。很多团队发现自己的 Agent 跑同样的任务还不如裸模型——不是模型不行是脚手架在挡路。更根本的是模型能力是 Agent 能力的上限和前提。推理能力不存在规划就是空谈指令遵循不存在再精巧的编排也会被模型跑偏。2026 年基础模型厂商的竞争焦点本身就是智能体能力——以 DeepSeek 为例其最新一代模型用上千个环境、数万条复杂指令的强化学习任务专门训练模型的 Agent 能力。这说明最有实力的玩家选择的路线是把 Agent 能力训进模型里而不是在模型外面糊脚手架。四、我的判断这不是静态的二选一而是一条动态曲线把两派观点放在一起真正的答案浮现出来两者的重要性之比随模型代际不断移动而且方向是确定的。可以用一个简单的框架来想实际表现 模型能力上限 × Harness 兑现率。在模型能力还很弱的早期上限很低Harness 的兑现率再怎么优化也撑不起复杂任务——那时模型更重要。在模型能力够用但未兑现的阶段大致是现在上限已高瓶颈在兑现率——Harness 差异造成巨大的表现方差Agent 工程的边际回报最高。随着模型持续吸收脚手架的最佳实践通用性的 Harness 技巧规划、重试、工具调用的通用模式会被一代代内化进模型这部分 Agent 工程的价值持续衰减。所以更精确的说法是模型决定上限Agent 决定兑现。短中期内同一个模型在不同团队手里表现天差地别Harness 是最大的杠杆点。通用脚手架会贬值只有扎根于模型训不到的东西的 Agent 工程才有持久价值私有数据与业务上下文、权限与合规体系、领域工具链、与真实系统的集成、评测与审计机制。金融等垂直行业的实践也印证了这一点——Agentic 基础模型和治理基础设施是两个轮子缺一不可单纯的模型能力或单纯的工程都不足以支撑生产环境的规模化运行。对个人和团队的启示押注调脚手架的手艺是短半衰期技能押注理解业务、设计系统、判断对错是长半衰期技能。2026 年模型半年一迭代等你攒够工程技巧模型已经把技巧吃掉了——赢面在于构建可以随时换模型而不塌掉的架构。五、结论如果一定要给哪个更重要一个回答问系统的天花板在哪——模型能力更重要。它是所有可能性的边界且 Agent 能力正在系统性地被它吸收。问你手里的系统现在能发挥几成——Agent 能力更重要。在任何一个给定的时间截面上Harness 质量造成的差距常常大于模型代际之间的差距46 分对 80 分的分差就摆在那里。问该把赌注押在哪——押在交界处不容易被吞噬的那部分。模型会继续变强通用脚手架会继续贬值而真正持久的价值在于把模型能力接到真实业务上去的、包含数据、权限、治理和领域 know-how 的那一层系统能力。争论哪个更重要本身就有一点过时。2026 年更诚实的问题是你做的这部分 Agent 工程是在给模型补短板还是在建模型永远长不出来的东西前者是临时工后者才是护城河。