1 ,不要用 llama.cpp ,虽然它可以超长 context ,并能量化 context ;但是超长 context 一旦处理慢了点,deepseek harness 底层用来连接模型的 pi 就容易超时 hang 住,再次连接的时候,重新 prefill 之前超长的 context 会非常耗时,且 llama.cpp 在同一个 slot 中处理的时候,后续不管 pp/tg 都非常慢。
2 ,推荐 mlx-dspark ,umem 够的情况下,用 draft 模型,不够,用--lookup-drafts 模式,context 不要搞默认 256k ,有个 64k 足矣,当单个 context 不够,自动切 slot 。前缀缓存( Prefix Caching / KV-Cache Reuse )和 探针验证与 Small-M 优化内核( Small-M Kernel Optimization ),让其能在 context prefill 极速,这是 llama.cpp 的最大问题。后续的 tg 阶段,也提速。虽然没有 context 量化,但是以上技术完全弥补了,且 context 不量化不损失质量。
3 ,让 dsh 自己写联网插件和记忆插件,保证客观知识的相对准确性,以及多个会话的延续性。
2 ,推荐 mlx-dspark ,umem 够的情况下,用 draft 模型,不够,用--lookup-drafts 模式,context 不要搞默认 256k ,有个 64k 足矣,当单个 context 不够,自动切 slot 。前缀缓存( Prefix Caching / KV-Cache Reuse )和 探针验证与 Small-M 优化内核( Small-M Kernel Optimization ),让其能在 context prefill 极速,这是 llama.cpp 的最大问题。后续的 tg 阶段,也提速。虽然没有 context 量化,但是以上技术完全弥补了,且 context 不量化不损失质量。
3 ,让 dsh 自己写联网插件和记忆插件,保证客观知识的相对准确性,以及多个会话的延续性。