给 Codex 做了个自动选模型的 Skill,顺手加了并发调度

8 月 3 日
 oranjeruud

Codex 更新 gpt5.6 以来,我一直在手动切模型,每次都自己判断挺烦的。而且 Codex 官方的 Ultra 虽然可以并发,但必须使用 Sol XHigh 。问题是 Sol XHigh 本身就很慢,四只脚一起猛蹬甚至不如合适强度的模型串行……

当然也可以直接对话让 Codex 选择模型和并发,但我发现它又会偏好 Luna low 和 Terra medium ,从真实测评和社区反馈来看,都不是很好的选择。特别是现在 Luna 疯狂降价的情况下,Terra 真的两头不靠。

所以我就做了个 skill $codex-auto-model-router,1. 在更低的模型和推理强度上也能智能调度并发,2. 每个子任务根据难度,按照真实测评表现单独选择模型。

它会先分析任务之间的依赖。能安全拆开的部分就并发,涉及共享文件、Git index 、项目配置这些容易打架的资源就串行;每个子任务再单独选择 Luna 、Terra 或 Sol ,而不是全部一起上 Sol XHigh 。

任务依赖图
├─ 独立任务 A ─┐
├─ 独立任务 B ─┼─→ 验证并汇总
└─ A 完成后执行 C ─┘

共享文件或资源 → 串行执行

模型选择大概是这样:

任务
└─ 评估范围、歧义、风险和时延
   ├─ 重复、普通或确定性任务 → Luna ─┐
   ├─ 时延敏感任务 → Terra ──────────┼─→ 执行 → 验证
   └─ 复杂、高歧义或高风险任务 → Sol ─┘

一开始我其实挺低估 Luna 的,只敢用 Luna Low 跑一些完全机械任务。结果 Low 还是经常出错,或者还没做完就停了,搞得我一直觉得 Luna 不太聪明。

后来认真看了一下 CursorBench 3.2 ,才发现问题可能不是 Luna ,而是我一直在用 Low:

从 Low 到 High ,正确率直接涨了 19.2 个百分点。Luna Max 甚至略高于 Sol Medium ,但成本只有大约五分之一。

当然 Luna Max 用的 Token 和步骤也多很多,并不是以后所有任务都无脑 Max 。对我来说更实际的结论是:机械任务不需要为了省那一点继续用 Low ,普通任务可以更多交给 Luna High ,只有真正复杂、模糊或者高风险的任务再上 Sol 。

目前的默认逻辑是,但是调用 Skill 的时候可以人工指令覆盖:

机械、重复                    → Luna Medium
普通有界、常规扫描            → Luna High
大型扫描或审查                → Luna XHigh
大型确定性深度任务            → Luna Max
明确强调低延迟                → Terra High
有界复杂任务                  → Sol Medium
高歧义、高耦合或高后果        → Sol High
复杂任务推理或验证失败        → Sol XHigh

GitHub:

https://github.com/orange-the-weak/codex-auto-model-router

目前还在继续调整路由规则。基本每天都在用真实项目测试。欢迎试用,也欢迎帮我看看现在的模型分配有没有什么离谱的地方。

测评数据来源:CursorBench 3.2

1432 次点击
所在节点    分享创造
0 条回复

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://v2ex.ih06.com/t/1231691

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX