GPT-Load 接入 Jev:模型及思考强度的自动挡功能

9 月 21 日
 tbphp

项目地址: https://github.com/tbphp/gpt-load

最近折腾了一下 Jev ,感觉没有 X 上吹得那么神,准确度还有待提高,不过确实有很多有意思的玩法,特别是针对我在做的 GPT-Load 项目,马上就能想到一个场景:Auto Model 。

目前 GPT-Load 新版加了个 自动模型 功能:让 Jev 判断这次任务适合哪一档,自动调度,省掉本地手动切换模型、思考的操作。
Jev 负责选档,真正思考和输出的还是配置好的预设模型。

目前已经支持 typesafe.ai 官方和 OpenRouter 的 Jev 渠道。

怎么用

  1. 新建 Jev 官方或 OpenRouter 分组填好密钥,配置好 jev 模型。
  2. 在全局设置里找到「实验性功能 → 自动模型」,开启并选择前面配置的 jev 模型。
  3. 可以先用默认的 4 档预设,再调整每档的目标模型、思考强度,以及档位的描述提示词。
  4. 客户端把模型设为 auto ,正常发请求即可。( auto 模型可自定义)

auto 路由、决策、命中哪一档、判断花了多久、决策费用是多少,都能在日志里看到。

一起来实验

当然,调用 Jev 是会增加判断耗时和费用(目前观察费用极低,不过耗时要看任务输入和网络链路延迟),选档精准度还需要调教。不过有回退兜底机制,不会阻塞整个请求。
佬友们有好用的预设,或者遇到选档不合理的情况,欢迎讨论。对功能设计、判断机制有建议,也请不吝指教。
希望能让 Auto 做到真的好用的自动挡,从而从实验变成正式功能。

2705 次点击
所在节点    程序员
19 条回复
sampeng
9 月 21 日
自动模型会导致缓存失效,thinking 倒是可以,不过一般般,因为准确度也并不高
Haku
9 月 21 日
这玩意是不是适合做游戏 AI ?游戏 AI 本质上还是做选择题做决策,就算需要沟通也可以生成针对问题的文字。
能把一些小的模型改成 jev 相同架构的吗?
581996
9 月 21 日
一直在用 相比较 sub2api 来说 比较轻量
qiuhang
9 月 21 日
@Haku 场景上挺适合的,可惜不开源,没法直接嵌入到本地无限用。游戏直接依赖外部商业 api 还是太昂贵和不可靠了
penisulaS
9 月 21 日
jev 是不是本质上是个小模型,所以速度快
tbphp
9 月 21 日
@sampeng 是存在这个问题,我也考虑过。

同一个任务(非会话)会自动沿用,避免多次请求都判断,但是不同的任务(主动发送消息)会触发判断。
使用的场景也有这种情况,同一个会话,但是在处理不同阶段也会切模型思考。
sampeng
9 月 21 日
@tbphp 切思考没什么问题。我建议在一次 session 下不要切模型。收益太低了。cache 低意味着飞快的消耗配额。
tbphp
9 月 21 日
@sampeng 但实际上会话中不同的指令需要不同的模型,也是很高的需求。
嗯,目前实验性功能就是希望搜集下大家的反馈,看下后续如何优化和调整吧,或者考虑给一些控制选项。
fds
9 月 21 日
@penisulaS #5 输出也少,就几个数
xialaoban
9 月 21 日
完全改版了啊。。
我部署的还是老版本
musi
9 月 21 日
@sampeng #1 thinking 其实也会导致缓存失效,因为很多模型的思考程度是要在系统提示词前注入不同的提示词/标签实现的

deepseek-v4-flash: https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731/blob/main/encoding/encoding_dsv4.py
glm-5.3: https://huggingface.co/zai-org/GLM-5.3/blob/main/chat_template.jinja
sampeng
9 月 21 日
@musi 还真是,我用 deepseek 测试了一下。。国产的好像都是这样
musi
9 月 21 日
tbphp
9 月 21 日
@musi 是的,不同厂商的模型策略不同。是否需要自动挡,还是要看自己的工作流、上游情况来尝试。
sampeng
9 月 21 日
@musi 靠。。果断去乖乖把自动 thinking 的功能去掉。。那就屁用没有了。。
yh7gdiaYW
9 月 21 日
@tbphp openai 就是这种策略,所以你折腾的这个无意义
tbphp
9 月 21 日
@yh7gdiaYW 他那是直接降智,不是根据输入自动路由。
yh7gdiaYW
9 月 21 日
@tbphp 我说的是 openai 也是用 prompt 控制思考强度,你自动路由就会破坏缓存,搞这个没有意义反而不如一直用高一点的档位
tbphp
9 月 22 日
@yh7gdiaYW 在浏览 x 上的时候,有很多类似需求。并且也手到了对应的 issue 。
需求确实存在,也不仅是单个渠道上游,只考虑缓存成本问题。
有些人的场景是有多个上游渠道的,用户会习惯不同的模型去适配不同的场景,不同渠道模型的能力也不同。
很多场景也是我考虑不到的,这些都交予用户多一个选择。

毕竟也是实验性功能,也是因为具体场景未知,希望得到用户一些反馈和体验。再进行后续的计划。

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://v2ex.ih06.com/t/1243522

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX