MarkTechPost(RSS) · 2026/8/6

SkillOpt:跨模型与工具链迁移的文本空间优化器,实现技能可移植

微软、上海交大、同济大学和复旦的研究团队发布了 SkillOpt,一种文本空间优化器。它在冻结目标模型的情况下训练单个自然语言技能文档,通过优化器模型提出有界编辑来提升性能。实验表明,在 Codex 上训练的 SpreadsheetBench 技能迁移到 Claude Code 后得分 81.8,甚至超过了后者自身 80.4 的领域内结果,证明了程序性技能在不同工具链间的可移植性。

SkillOpt 是由来自微软、上海交通大学、同济大学和复旦大学的研究团队开发的一种文本空间优化器。SkillOpt 在目标模型保持冻结的状态下,训练单个自然语言技能文档。一个优化器模型读取带评分的执行结果,并提出有界的添加/删除/替换编辑建议。一个留出的选择集仅在分数严格提高时才接受编辑。导出的产物是一个文件,即 best_skill.md。

迁移表格报告了三列数据。基线是目标模型无技能时的分数。直接(Direct)是 SkillOpt 在特定目标上使用领域内数据训练的结果。迁移(Transferred)是应用在其他地方训练的技能,且没有进一步优化。有用的比较不是迁移与直接对比,而是领域内收益在迁移后保留了多少。

**跨模型迁移:家族内,保留程度不一** 技能在 GPT-5.4 上训练,并部署在较小的变体上。

| 基准 | 目标模型 | 基线 | 直接 | 迁移 | 收益 | 领域内收益占比 | |---|---|---|---|---|---|---| | SpreadsheetBench | GPT-5.4-mini | 36.1 | 47.5 | 45.5 | +9.4 | 82% | | SpreadsheetBench | GPT-5.4-nano | 23.5 | 42.5 | 26.5 | +3.0 | 16% | | LiveMath | GPT-5.4-mini | 14.7 | 32.8 | 19.2 | +4.5 | 25% | | LiveMath | GPT-5.4-nano | 23.2 | 27.2 | 28.8 | +5.6 | 140% |

有两行值得注意。SpreadsheetBench 在 GPT-5.4-mini 上保留了 82% 的领域内收益,这几乎等同于免费复用。LiveMath 在 GPT-5.4-nano 上的结果则更奇怪:迁移技能得分为 28.8,而领域内 SkillOpt 的结果为 27.2。论文将此解读为,某些学习到的程序是与目标模型无关的证据。GPT-5.4-nano 的 SpreadsheetBench 行是较弱的,只有 16%。收益保留并不均匀,论文也没有声称它是均匀的。它声明的界限更窄:没有一行的分数低于目标模型的无技能基线。注意其范围,所有四行都停留在同一个 GPT 家族内。跨家族迁移,例如从 GPT 到 Qwen,并未测试。

**跨工具链迁移:最强的结果** 这是对部署最重要的部分。所有行都使用 GPT-5.5。

| 基准 | 来源 → 目标 | 基线 | 直接 | 迁移 | 收益 | 领域内收益占比 | |---|---|---|---|---|---|---| | SpreadsheetBench | Codex → Claude Code | 22.1 | 80.4 | 81.8 | +59.7 | 102% | | SpreadsheetBench | Claude Code → Codex | 27.5 | 85.0 | 71.1 | +43.6 | 76% | | LiveMath | Claude Code → Codex | 35.2 | 78.4 | 48.0 | +12.8 | 30% | | LiveMath | Codex → Claude Code | 40.8 | 56.5 | 42.4 | +1.6 | 10% |

第一行是头条新闻。在 Codex 中优化的技能将 Claude Code 的分数从 22.1 提升到了 81.8。这略微超过了 Claude Code 通过从头训练自己的技能所达到的 80.4 分。这两个工具链暴露了不同的工具和文件 API,以及不同的命令界面。一个能在这种转变中存活下来的技能,其编码的不是命令配方。研究论文将 SpreadsheetBench 的可移植性归因于工作簿级别的程序:结构优先检查、公式感知验证和静态值物化。这些方法无论哪个 CLI 运行 Python 都适用。LiveMath 则讲述了相反的故事。Codex → Claude Code 仅保留了 10% 的领域内收益。这种不对称性值得深思。程序性技能——如何检查、验证和格式化——似乎是可移植的一类。而推理密集型技能似乎与其训练环境联系更紧密。

**跨基准迁移:真实但微小** | 来源 → 目标 | 模型 | 基线 | 迁移 | 收益 | |---|---|---|---|---| | OlympiadBench → Omni-MATH | GPT-5.4 | 56.6 | 60.3 | +3.7 | | OlympiadBench → Omni-MATH | GPT-5.4-mini | 34.8 | 36.6 | +1.8 | | OlympiadBench → Omni-MATH | GPT-5.4-nano | 38.8 | 40.1 | +1.3 |

这里没有“直接”列。没有报告在 Omni-MATH 上进行的领域内 SkillOpt 运行,因此仅与无技能基线进行比较。在所有三个模型规模上,收益都是正的,但很小。研究论文的解读是,在测试实例和答案格式约定都改变后,该技能保留了可复用的数学程序。

**为什么产物能够迁移** 研究论文中明确说明了其机制。所有三种执行模式:直接聊天、Codex、Claude Code——都使用相同的 best_skill.md 文件格式。正是这个共享契约使得跨工具链实验成为可能。Codex 工具链将当前技能渲染为每个任务的 SKILL.md 文件,与任务文件放在一起,然后读回一个紧凑的执行轨迹。Claude Code 工具链通过 claude CLI 镜像了相同的工作区契约。两个工具链都没有获得定制的技能格式。

产物的形态也支持可移植性。最终技能在六个基准上的长度为 379 到 1,995 个 token,中位数接近 920。它们由 1 到 4 个被接受的编辑组合而成。论文的图 4 抽样了每个基准的一个学习规则,所有规则都是程序性的,而非特定于实例的。SpreadsheetBench 的规则原文如下:检查工作簿结构和公式,然后在整个请求的目标范围内写入计算好的静态值,而不是依赖 Excel 重新计算。

**这对可移植性意味着什么** 训练成本只支付一次,离线进行,并且是可衡量的。研究论文报告,根据基准不同,每个绝对测试点的训练 token 数在 0.6M 到 46.4M 之间。SpreadsheetBench 每个点需要 0.6M;DocVQA 需要 46.4M。优化器模型仅在训练期间运行,在部署时增加零推理时间调用。如果一个在某个工具链中训练的技能在另一个工具链中也能保持性能,那么这笔一次性成本就可以分摊到多个环境中。Codex → Claude Code 的 SpreadsheetBench 结果就是存在性证明。这也意味着,你可以在工具最便宜的地方进行优化,并在产品所在的地方进行部署。

审计角度是独立的,且被低估了。部署的产物是一个文本文件,领域从业者可以在几分钟内阅读。对其所做的每一次更改都是可追溯的:每一步都记录了一个 edit_apply_report.json,其中包含每个编辑的接受和跳过状态。可移植性加上可检查性,是一种不同于发布微调权重的运营姿态。

**关键要点** 证据涵盖一个 GPT 家族和每个轴的两个基准,因此可移植性是被证明了,但尚未被普遍化。一个 Codex 训练的 SpreadsheetBench 技能在 Claude Code 中得分 81.8,高于该工具链自身的 80.4 分领域内结果。所有 4 个跨模型、4 个跨工具链和 3 个跨基准的迁移行都高于目标的无技能基线。迁移强度与任务类型相关:程序性电子表格技能迁移良好,数学推理技能迁移较弱。可移植的单元是一个 379 到 1,995 个 token 的 best_skill.md 文件,由 1 到 4 个被接受的编辑构建而成。

**资源**:论文、GitHub、项目页面、文档、PyPI 和演示视频。

**引用的基线**:GEPA、TextGrad、EvoSkill 和 Trace2Skill。

**引用的基准**:SearchQA、SpreadsheetBench、DocVQA、LiveMathematicianBench 和 ALFWorld。

Asif Razzaq 是 Marktechpost Media Inc. 的首席执行官。作为一名有远见的企业家和工程师,Asif 致力于利用人工智能的潜力造福社会。他最近的努力是推出了人工智能媒体平台 Marktechpost,该平台以其对机器学习和深度学习新闻的深入报道而著称,这些新闻在技术上严谨,同时又易于广大读者理解。该平台每月浏览量超过 200 万次,说明了它在受众中的受欢迎程度。

FDE 判断

SkillOpt 对 FDE 工作有直接影响。它提供了一种可审计、可移植的技能优化方法,使 FDE 能在一种工具链(如 Codex)中优化技能,然后部署到客户环境(如 Claude Code),无需重新训练。其产物是文本文件,便于领域专家审查和追踪每次更改,降低了交付风险。但需注意,其可移植性在程序性任务上表现强,在推理密集型任务上较弱。