V2EX = way to explore
V2EX 是一个关于分享和探索的地方
Sign Up Now
For Existing Member  Sign In
V2EX  ›  ReinXD  ›  全部回复第 1 页 / 共 1 页
回复总数  2
@Retas 这里有个关键问题是如果模型 sft 的训练数据没有针对性优化,这样的操作是会下降模型性能的
dpsk 应该是把 system prompt 直接放到每次请求的开头了,这样每次增长的计算实际上只有用户新发的请求,剩下全部可以 prefix cache hit ,导致最后命中率 99%,其实没那么多魔法,不过 dpsk 应该这次在训练 sft 的阶段就对这种 prompt 方式进行优化了
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   5470 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 · 10ms · UTC 06:14 · PVG 14:14 · LAX 23:14 · JFK 02:14
♥ Do have faith in what you're doing.