首页
看点啥
插画图片
首页 科技看点 Agent Skill 如何自动进化?SkillOpt 训练流程解析

Agent Skill 如何自动进化?SkillOpt 训练流程解析

2026-07-24 0

Agent Skill 的“自动进化”很容易被误解成让模型读完失败记录,再自由发挥写一版新提示词。SkillOpt 走的是另一条路:模型权重不动,Skill 文档成为唯一被训练的状态;每次改动有预算、有记录,还要经过独立验证。它更像训练循环,而不是一次灵感式润色。

一轮训练先制造证据,再谈修改

当前 Skill 先交给目标模型执行一批任务。每个任务留下消息、工具调用、验证反馈、元数据和最终得分,这一步相当于 forward pass。没有可评分轨迹,后面的优化器就只能猜哪里需要修改,所以“多收集几段聊天”并不等于已经具备训练条件。

SkillOpt 官方训练循环文档,列出 rollout、reflect、aggregate、select、update 和 gate 六个阶段

失败样本负责纠错,成功样本负责守住已有能力

轨迹被拆成 minibatch 后,优化模型分别分析失败与成功。失败告诉它哪些步骤反复漏掉,成功则提醒它哪些策略已经有效,不能被大改覆盖。随后产生的不是整篇新 Skill,而是有结构的 add、delete、replace 编辑。

相近编辑先聚合去重,再按相关性排序。配置里的 optimizer.learning_rate 不是浮点梯度,而是每一步最多应用多少条文字编辑。预算太大,Skill 容易语义跳跃;预算太小,可能长期修不到关键问题。cosine、linear、constant 三种调度决定训练后期是否逐渐收紧修改幅度。

候选写得再顺,也可能当场被拒绝

选中的编辑应用到当前 Skill,形成 candidate_skill.md。系统随后在 selection split 上重新评分:默认 gate 开启时,候选得分必须严格高于当前版本才被接受。没有提升,当前 Skill 原样保留,失败修改进入 rejected-edit buffer。验证集在这里不是报告用附件,而是防止“越改越差”的刹车。

SkillOpt 官方实验曲线,展示不同训练轮次中的技能得分变化

跨过一个 epoch,还要回头看遗忘

从第二个 epoch 开始,slow update 会拿上一个 epoch 与当前 Skill 在同一批样本上的表现做纵向比较,把结果分成 improved、regressed、persistent-fail 和 stable-success,再生成高层指导。它要解决的不是某一道题,而是多轮修改后逐渐忘掉旧能力的问题。

meta skill 则保存优化器自己的策略记忆:哪些编辑曾经有效,哪些方向失败,剩下的错误模式是什么。它不会塞进最终部署 Skill,而是在后续反思阶段继续约束优化器。这让训练历史有用,却不必把线上 Skill 膨胀成日志仓库。

best_skill.md 只是终点文件,不是终点判断

运行目录会同时保存版本化 Skill、每步候选、轨迹摘要、慢更新和 meta skill。best_skill.md 指向验证表现最好的部署产物,线上 Agent 只需读取它,不增加额外优化模型调用。真正上线前仍应在锁定测试集上单独评估,并查看能力提升是否伴随别的回归。

所以,Agent Skill 的自动进化并不是“让 Agent 自己改自己”。更准确的说法是:用可评分任务制造训练信号,用受限文字编辑控制步幅,再让独立验证集决定哪次变化有资格留下。缺少其中任何一环,自动化都可能只是在更快地积累规则。

喜欢(0)

上一篇

电视剧非典型少年第一季剧情介绍

电视剧非典型少年第一季剧情介绍

下一篇

王者荣耀挑战觉悟玩法在哪

王者荣耀挑战觉悟玩法在哪
猜你喜欢