首页
看点啥
插画图片
首页 看点啥 AI 进化的秘密,在模型还是在harness

AI 进化的秘密,在模型还是在harness

2026-08-04 0

AI表现天差地别?关键不在模型本身,而在运行环境harness。harness易进化,是决定AI价值的核心变量。
核心内容:
1. harness的定义与作用:AI模型的运行环境,决定其思考、工具调用等核心能力
2. 为什么harness比模型更重要:迭代快、成本低,直接影响AI实际应用效果
3. harness的自我进化机制:通过组件调整实现持续优化,避免模型固化

有个现象你可能注意到了,

同样是 Deepseek v4 Flash 0731,有的产品用起来行云流水,有的磕磕绊绊。套在 Claude Code 里是神器,换个壳子就像换了个人。

不是模型不一样,是模型外面那层东西不一样。

这层东西有个专业名字,叫 harness。直译是「马具」或者「线束」,但用在 AI 里,指的是环绕基座模型外面的那套系统,它决定模型怎么思考、怎么调工具、怎么管理上下文、怎么存储产物、怎么评估自己的结果。

简单说,harness 是模型的运行环境。

我想到一个类比,

模型是电,harness 是把电变成光和动力的那套装置。

同样的电,接进灯泡就是光,接进马达就是动力,接进冰箱就能保鲜。不是电不一样,是接进去的装置不一样。Claude Code、Cursor、各种 AI 助手背后可能用的是同一个模型,但 harness 不同,产出天差地别。

更关键的是,这层 harness,比模型本身更容易进化,也更应该进化。

而且它有一套自己长出来的机制。


说到为什么 harness 比模型更重要,Lilian Weng(OpenAI 的 Head of Safety Systems)最近写了篇文章,开头就说了一句让我印象很深的话,

夹在原始模型和真实世界之间的那一层,似乎和模型的原始智能同等重要。

什么意思?

大家习惯用「模型多聪明」来衡量 AI,GPT-4 比 GPT-3 强,Opus 5 比 Opus 4 强。但这只是故事的一半。

预训练刚结束时的裸模型跑 eval 拿了多少分,那是原始智能。但这份智能能不能兑现成真实世界里有用的东西,取决于 harness 这一层。

类比一下,一个人智商再高,如果没有合适的工具、没有记录的习惯、不会复盘总结,他的智商也发挥不出来。模型和 harness 的关系就是这样。

模型是大脑,harness 是手、眼、记事本和复盘会。

你不必让大脑自己变强,可以先把手脚、记忆和复盘机制做强。这就是为什么 Claude Code 能用同一个模型底座,但通过精心设计的 harness,产出质量吊打其他产品。

而且,harness 有个模型没有的优势,它是活的。

模型权重一旦训练完就冻结了,要改得等下一个版本发布。但 harness 不一样,它由可读、可改、可版本化的组件构成,context、workflow、记忆、评估、工具这些东西,每一个都能随时调整。

改 harness 不需要重新训练,成本低、迭代快、可回滚。

这也呼应一个更朴素的判断,可自我进化的系统,永远打败固化的系统。


说到这里你可能会想,harness 到底怎么自己变聪明?

很多人第一反应想到的是那种科幻画面,AI 自己改写自己的代码,越来越聪明,最后失控。

但实际发生的事情更实际,也更有意思。

harness 的自我迭代,不是靠什么黑科技,而是靠观察自己在什么情况下出错,然后针对性地打补丁。

改进从哪件事上被触发?答案是六类信号。

第一类,失败和报错。

这是最强的信号。任务失败、工具报错、测试不通过、用户说「不对重来」,这些都是最直接的反馈。

把每次失败归档成 case,做根因分析。是 prompt 没说清?工具缺失?上下文丢了?反复出现的同类失败,就沉淀成一条新规则、一个新工具、或一段新的 workflow。

这是从错误里长出来的迭代。

为什么失败是最强的信号?因为它能归因、能复现、能沉淀。做对了一件事,你可能不知道为什么对;但做错了,你能追踪到具体哪个环节出了问题。

第二类,用户反馈与纠正。

用户的显式纠正、偏好表达、追加约束(「以后都这样做」),这些都是金子。

把反馈提炼成可复用的记忆,带上 why 和 how-to-apply,下次自动加载。一次纠正,永久改变行为。

第三类,重复模式。

同一串操作反复出现、同一段 context 反复手动拼装,这时候系统要能识别「我又在做同样的事」。

把高频操作序列固化成 workflow,把高频上下文固化成模板。识别重复是自动化的起点。我们所谓的”自动生成skill“就是如此。

第四类,评估结果下降或停滞。

离线 eval 分数、任务完成率、耗时成本等指标变差或不动了,说明该优化了。但这个前提是你得先有可量化的评估回路,指标退化触发针对性优化,且每次改动都要能被同一套 eval 验证。

第五类,新工具、新能力出现。

有了新模型、新 API、新 MCP 工具,harness 要主动探测并接入新能力,重新编排 workflow。环境变了,活的系统要跟着变。

第六类,主动自省。

没有外部信号的时候,定期让系统回看自己的历史轨迹,审视自己的 context、workflow、记忆,提出「哪里可以更好」的假设,小步试验、验证、保留有效的。

这是最接近递归自我改进原意的一环,用当前智能改进产生智能的机器。

六类触发点背后,有两条铁律贯穿始终。

铁律一,必须有评估闭环。没有 eval,「改进」就是碰运气。任何一次自我修改,都要能被同一套评估验证是变好还是变坏。

铁律二,必须可回滚、留痕。harness 的改动要版本化、可撤销。活的系统不等于失控的系统。


再往深聊一层,模型和 harness 之间还有一个很精彩的关系,两种时钟。

模型和 harness,走的是两种完全不同的时钟。

模型是离散时钟,几个月发一次版,一次跳一大步,版本之间是冻结的。你今天用的 GPT-5.6,跟昨天的一模一样,跟明天的也一模一样,直到 OpenAI 发下一个版本。

harness 是连续时钟,每天都能改,贴着现实需求实时演进。你今天用 Claude Code 遇到一个问题反馈给 Anthropic,他们明天就能改 harness、更新部署,后天你再用,体验就不一样了。不需要等模型发新版。

这两种时钟之间,有一条传送带。

harness 在两次模型发版之间,充当现实需求的缓冲区和试验场。它先用工程手段顶上模型还做不到的部分,等模型下一版把这部分学会了,harness 就把这块卸载给模型,自己腾出手去顶下一个前沿。

所以 harness 永远在做同一件事,站在模型能力的边缘之外那一寸。

模型能力边界往外扩,harness 就往外挪一寸。它的位置是相对的,永远在前沿。

最反直觉的一点是,内化反而让 harness 更重要。所谓内化,就是harness的一些特性会被大模型吸收。

模型弱的时候,harness 大量精力花在补丁上,各种 if-else、启发式规则、防止模型犯蠢。模型强了之后,这些补丁不需要了,harness 转去做更高阶的编排,多 agent 协作、长周期自主研究、自我评估回路。

内化不是把 harness 掏空,而是把它从保姆解放成架构师。

低价值的活被模型吸走,harness 得以专注高价值的活。这跟「AI 填满 How 之后,判断力才是护城河」是同一个结构,只是主体从人换成了 harness。


回到我们自己,这一切对普通人有什么影响?

我自己最大的感受是,我们总是在担心被 AI 替代,但其实真正的问题不是「会不会被替代」,而是「该站在哪一层」。

模型会越来越强,会把越来越多的 how 内化进去。prompt 花招、咒语、具体 workflow 的巧劲,这些都会褪色。

会被内化的,是所有「怎么做」,因为 how 可以从数据里学。

永远不会消失的,是所有「做什么」,目标、约束、上下文、评估标准,因为这些是外部世界注入的信息,模型再聪明也无法凭空知道你要什么、你的现实约束是什么、什么算成功。

这是一条硬边界。模型能内化方法,但无法内化你的意图和你的现实。

所以对我们来说,值得投资的能力是什么?

不是 prompt 花招,而是把目标定义清楚的能力。不是 workflow 的巧劲,而是设计评估标准的能力。不是手工调参,而是判断「什么算好」的品味。

这解释了一个现象,为什么好的 prompt engineer 没失业,反而升级成了 context engineer、agent 架构师。他们投资的从来不是咒语,而是「说清需求 + 立好评估」的底层能力。

这个能力跨越模型代际,永远保值。


谢谢你看我的文章,我们,下次再见。

登录查看剩余 70% 内容

喜欢(0)

上一篇

潜云品牌闭门分享会:深挖产品详情页价值,赋能全域内容布局

潜云品牌闭门分享会:深挖产品详情页价值,赋能全域内容布局

下一篇

从此汇报不再犯难,“kimi+讯飞”帮你全自动生成ppt

从此汇报不再犯难,“kimi+讯飞”帮你全自动生成ppt
猜你喜欢