mac ultra deepseek harness & qwen3.8-27B 几点经验

发布于

coefu:

1. 不要用 llama.cpp,虽然它支持超长上下文并能够量化上下文;但是超长上下文一旦处理慢了点,deepseek harness 底层用来连接模型的 PI 就容易超时挂起,再次连接的时候,重新填充之前超长的上下文会非常耗时,且在同一个 slot 中,llama.cpp 处理后续的 pp/tg 时也会非常慢。

2. 推荐使用 mlx-dspark,在有足够 umem 的情况下,使用 draft 模型;如果不够,就用 --lookup-drafts 模式。上下文不建议使用默认的 256k,64k 足矣,当单个上下文不足时,会自动切换 slot。前缀缓存(Prefix Caching / KV-Cache Reuse)和探针验证以及 Small-M 优化内核(Small-M Kernel Optimization)能够极大地提升上下文的预填充速度,这是 llama.cpp 最大的问题。后续的 tg 阶段也会提速。虽然没有上下文量化,但以上技术完全弥补了,并且上下文不量化也不会损失质量。

3. 让 dsh 自己编写联网插件和记忆插件,以确保客观知识的相对准确性,以及多个会话的延续性。

---

原文链接:[点击查看](https://www.v2ex.com/t/1235511)

评论

暂无评论。

0.063137s