首页
看点啥
插画图片
首页 看点啥 谷歌最新白皮书:搞定2026 Agent生产力 吃透Context Skills与Harness

谷歌最新白皮书:搞定2026 Agent生产力 吃透Context Skills与Harness

2026-07-20 0

在计算历史的绝大部分时间里,编程的本质是一项翻译工作:开发者需要在人类理解的维度上剖析问题,设计抽象方案,随后将其转译为机器能够执行的语法。当前的软件工程领域正在经历自高级编程语言问世以来最为显著的变化。开发者与机器交互的首要界面,正在从繁琐的语法(大括号、分号、类型注解)向“意图(Intent)”过渡。

谷歌在这份发布于2026年5月的白皮书《伴随“氛围编程”的新一代软件开发生命周期 (The New SDLC With Vibe Coding)》中指出,截至2026年初,已有85%的专业开发者定期使用AI编程智能体,51%的开发者每天使用,预估所有新代码中有41%是由AI生成的。

谷歌最新白皮书:搞定2026 Agent生产力,吃透Context、Skills与Harness

这一技术演进包含五个明确的历史阶段:自动补全 (Autocomplete, 约2021年)、内联代码建议 (Inline Code Suggestions, 约2022年)基于聊天的生成 (Chat-Based Generation, 约2023年)编程智能体 (Coding Agents, 约2024-2025年)自主智能体 (Autonomous Agents, 约2025-2026年)

谷歌最新白皮书:搞定2026 Agent生产力,吃透Context、Skills与Harness

在2026年,还想继续用AI提效就必须换掉旧的干活方式。本文将全面拆解谷歌这份51页的白皮书,带你从战略视角看透2026年的Agent生产力如何被定义,以及Context Engineering、Skills与Harness三大基建的核心概念与作用。

氛围编程本质是碰运气,真业务需要智能体工程

2025年2月,Andrej Karpathy提出了“氛围编程 (Vibe Coding)”的概念,描述了一种开发者完全依赖自然语言描述需求,接受AI输出,并在出错时直接将错误信息复制回提示词以求修复的开发模式。该词汇在工程界引发了广泛共鸣,但也造成了术语定义的模糊。

研究者认为,不应将“氛围编程”与严谨的开发模式对立,而应将其视为一条连续光谱的两端。区分这条光谱位置的核心指标,是围绕AI输出所建立的结构、验证机制以及人类判断的介入程度。

光谱的三个基准点特征如下:

谷歌最新白皮书:搞定2026 Agent生产力,吃透Context、Skills与Harness

这两端的单一最大差异在于输出的验证方式。在智能体工程中,验证由两部分组成:测试(Tests)用于验证确定性系统(输入A产生输出B);评估(Evals)用于验证非确定性部分(智能体是否采取了正确的步骤轨迹、调用了正确的工具并达到了质量标准)。若缺失这两种验证机制,无论提示词多么复杂,该流程在工程定义上仍属于氛围编程。

现在决定AI输出质量的是清晰的上下文管理

随着大语言模型的工程化应用深入,提示词工程的边际效益正在递减。研究者指出,AI生成代码的质量不再取决于你用了多么巧妙的提示词,而是取决于你为AI提供了多少丰富、结构化的代码库信息和意图,这就引出了上下文工程 (Context Engineering)。

为了让模型产生确定性的输出,开发者必须在系统中构建和维护六类上下文:

谷歌最新白皮书:搞定2026 Agent生产力,吃透Context、Skills与Harness

在架构设计中,最大的技术挑战是如何在令牌 (Token) 预算限制下分配这些上下文。研究者将其划分为静态上下文与动态上下文:

为了解决长文本带来的“上下文腐烂”问题,行业内目前广泛采用的架构模式是“智能体技能 (Agent Skills)”。这种模式允许智能体保持为一个轻量级的通用路由节点,仅在任务匹配时,才将特定的程序化知识加载进上下文。通过这种渐进式披露 (Progressive disclosure) 机制,一个智能体可以挂载数十种专业能力,而每次仅消耗当前执行所需的令牌费用。

SDLC的重构:需求定义和质量验证变慢了

传统的迭代式SDLC(如敏捷开发)将部署变成了持续的过程,但反馈循环仍受限于人类的编码速度。研究者指出,AI驱动的SDLC极大地压缩了开发周期(从数周缩短至几分钟到几小时),但各阶段的瓶颈发生了重分配。

谷歌最新白皮书:搞定2026 Agent生产力,吃透Context、Skills与Harness

LLM只占10%,剩下90%是外壳测试与护栏兜底

为了适应新的SDLC,研究者提出了“工厂模型 (The Factory Model)”的系统抽象。在这个模型中,人类开发者的直接产出物不再是代码文件,而是“能够生产代码的系统”。开发者充当工厂经理,负责设计流水线并制定验收标准,智能体则作为流水线上的机器进行生产。

这台“机器”的内部构造是什么?研究者抛出了一个关键的技术论断:基础大模型 (Model) 仅仅是工厂底板上的裸擎,它本身并不是一个智能体。将其转化为具备生产力的智能体的,是环绕在模型周围的代码和基础设施,即“外壳 (Harness)”。

一个生产级智能体的构成公式是:智能体 = 模型 (约占10%) + 外壳 (约占90%)

谷歌最新白皮书:搞定2026 Agent生产力,吃透Context、Skills与Harness

外壳 (Harness) 具体包含以下六个技术维度的物理实现:

外壳配置的质量直接决定了系统的性能基线。研究者引用了公开基准测试的工程案例:在Terminal Bench 2.0评测中,一支工程团队在完全不更换底层基础模型的前提下,仅仅通过重构智能体的外壳代码,就将系统的排名从30名开外提升至前5名。另一项LangChain的研究显示,仅优化固定模型周围的中间件、工具定义和系统提示词,就能使系统评分跃升13.7分。当一个系统出现输出故障时,根本原因通常不是模型不够聪明,而是外壳缺少某个关键API、规则定义冲突或者上下文窗口被过量噪音数据阻断。

人的角色就两种:指挥家和编排者

谷歌最新白皮书:搞定2026 Agent生产力,吃透Context、Skills与Harness

两种模式的存在是为了应对AI辅助开发中长期存在的“80% 难题 (The 80% problem)”。当前阶段的语言模型能够以极高的速度输出某项功能80% 的主体代码,但剩余的20%(边缘用例、错误处理、复杂集成点和微妙的正确性要求)需要深度的业务上下文,这是当前模型难以处理的。这类概念性错误具有隐蔽性,因为代码往往“看起来正确”且能通过基础测试。高效的开发者会将AI用于处理良好定义的高速实现,而将自身的注意力集中在应对这20% 的架构权衡和正确性验证上。

生产经济学:CapEx与OpEx的核心概念

在评估技术引入的商业影响时,总拥有成本(TCO)比单纯的开发速度更具决定性。

谷歌最新白皮书:搞定2026 Agent生产力,吃透Context、Skills与Harness

在此经济模型中,上下文工程成为一项直接的财务杠杆。通过提供高信息密度的载荷(如精确的AGENTS.md文件),可以避免因提示词噪音导致的反复试错成本。进一步地,研究者建议采用“智能模型路由 (Intelligent Model Routing)”策略:将高复杂度的架构和初始实现任务分配给庞大、昂贵的前沿模型;而将确定性、低复杂度的任务(如测试生成、代码审查)自动路由至体积更小、速度更快、成本更低的模型,从而系统性地压低运营Token成本。

个人、团队和企业如何立刻落地

对于希望将该框架落地的从业者,研究者提供了以下切实的行动建议。

对于一线个人开发者:

对于工程团队领导者:

对于组织机构的技术决策者:

结语

在当前的工程语境下,代码生成的难题已被实质性攻克。软件工程的核心技艺正在从具体的实施编写,向上层转移至验证、判断与方向指引。组织必须认识到,结构化的工程纪律具备规模化能力,而松散的“氛围”则不具备。AI工具将客观地放大您团队现有的工程文化,它既能放大纪律带来的优势,也会无情地放大流程缺失造成的混乱。

喜欢(0)

上一篇

今天10分钟搓了一个小创意: 5分钟发布到小红书小工具

今天10分钟搓了一个小创意: 5分钟发布到小红书小工具

下一篇

Flova定义的Agent视频范式:好像成了一个标杆

Flova定义的Agent视频范式:好像成了一个标杆
猜你喜欢