SkillOpt翻译站点

3周前发布 191 0 0

微软开源框架,不微调模型,像训练神经网络一样自动优化Agent技能文档,实现能力稳定提升与跨环境迁移。

语言:
en
收录时间:
2026-06-25
SkillOptSkillOpt

SkillOpt是什么?

SkillOpt‌ 是微软(联合上海交大、复旦、同济)开源的文本空间优化器(Text-Space Optimizer)‌,核心定位是:

‌把 Agent 的技能文档(skill.md)当作可训练的”外部参数”,像训练神经网络一样,通过轨迹驱动的编辑 + 验证门控更新,自动迭代出最优技能文档(best_skill.md),且无需修改任何模型权重。‌

一句话概括:‌不改模型,只改”说明书”,让 Agent 越用越聪明。‌

它于2026年5月26日发布arXiv预印本论文,5月22日开源代码,在 ‌6大基准 × 7款模型 × 3种执行环境 = 52个测试单元中全部取得第一或并列第一‌,被业界称为”Agent技能开发从手工作坊迈向工业化生产”的里程碑。


SkillOpt‌的主要功能

  • 自动化迭代优化‌:告别手动反复修改 Prompt 的痛苦循环。只需提供带有标准答案的训练集和验证集,SkillOpt 就能自动执行任务、分析失败原因,并精准修改技能文档。
  • 严格的验证门控机制‌:每次对技能文档的修改,都必须在独立的验证集上通过测试,分数有提升才会被保留,否则会回滚到上一个版本。这确保了技能只会越变越好,不会越改越差。
  • 简易部署与可视化‌:训练完成后,你将得到一个紧凑的 best_skill.md 文件,部署时只需将其作为系统提示词注入即可。它还提供了 WebUI 面板,可以实时监控迭代进度、修改记录和效果对比。
  • 多模型与多后端支持‌:支持 OpenAI、Anthropic、Qwen、MiniMax 等多种主流模型的 API,也能在不同的执行环境(如直接对话、Codex CLI、Claude Code CLI)下工作。

SkillOpt‌的核心技术

SkillOpt 的核心在于将深度学习训练理念引入文本空间,构建了一个双模型分工的闭环迭代系统。

  • 双模型协作‌:
    • 执行模型‌:负责用当前的技能文档去执行任务,并记录完整的执行轨迹和结果。
    • 优化模型‌:复盘执行轨迹,分析成功与失败案例,以结构化的增、删、改操作精准修改技能文档。
  • 类深度学习的训练循环‌:整个优化过程遵循一个严谨的循环:‌Rollout(执行任务)→ Reflect(反思分析)→ Aggregate/Select(聚合筛选修改建议)→ Update(更新技能)→ Validate(验证效果)‌。
  • 文本学习率与编辑预算‌:为控制修改的幅度,避免一次改得太多而破坏原有有效规则,SkillOpt 引入了“文本学习率”或“编辑预算”的概念,每次只允许进行有限步数的修改。
  • 拒绝编辑缓冲区‌:被验证阶段否决的修改建议会被存入一个缓冲区,作为负面反馈,防止后续优化重复踩坑。
  • 慢速/元更新‌:在每轮迭代结束后,会进行全局复盘,确保技能文档逻辑连贯、简洁高效,并捕捉更长期的规律。

SkillOpt的使用场景

场景 具体案例 效果
 ‌复杂搜索问答 SearchQA:准确率从 77.7% → ‌87.3%‌(+9.6%)
表格/电子表格任务 SpreadsheetBench:‌暴涨近40个百分点‌(+39分) ✅✅
交互式决策 ALFWorld 室内文本游戏
文档问答 OfficeQA:准确率提升 ‌39% ✅✅
数学推理 数学题求解
跨项目任务迁移 知识库管理、API调用、Webhook处理等需要项目经验的任务 显著提升稳定性
Coding Agent 技能优化 配合 Cursor / Claude Code / Copilot 使用

SkillOpt的项目地址

  • 项目官网:https://microsoft.github.io/SkillOpt/
  • GitHub仓库:https://github.com/microsoft/SkillOpt

同类产品对比

与传统的手动优化或现有方法相比,SkillOpt 的优势在于系统性和可靠性。

优化方式 特点 与 SkillOpt 对比
人工手写/调优 依赖个人经验,反复试错,一旦提示词变长就容易互相矛盾,效果不稳定。 SkillOpt 通过任务驱动的自动化迭代,效果可量化、可复现,将开发者从“猜测游戏”中解放出来。
一次性LLM生成 让一个强大的LLM直接生成技能文档,但生成结果不可控,质量随机。 SkillOpt 是闭环优化,会基于反馈持续改进,生成物经过验证,效果远优于一次性生成。
其他自动优化方法 如 TextGrad、GEPA、EvoSkill 等,通过松散控制的自我修订来改进。 SkillOpt 在52组不同模型、基准和框架的评测中,表现优于所有同类竞品,实现了稳定且显著的提升。
模型微调 修改模型权重,成本高、技术门槛高,且可能影响模型通用能力。 SkillOpt 不改模型参数,只优化外部技能文档,成本极低,部署简单,且完全避免了知识遗忘的问题。

SkillOpt 训练出的技能还具备很好的‌迁移性‌,在一个模型或框架上优化好的技能,换到另一个模型或框架上使用,往往也能带来不错的性能提升,无需重新训练。

数据统计

相关导航

暂无评论

none
暂无评论...