可能很快就能实现 token 自由了
davinci21s:
qwen3.8 开源,性能比肩 opus4.6,之后出现几百个版本。
目前量化版本从 1bit 到 16bit,最低 8G 内存 mac 即可运行。
想要获得不错的体验推荐 3080 以上显卡。
传送门:[https://huggingface.co/unsloth/Qwen3.8-27B-GGUF](https://huggingface.co/unsloth/Qwen3.8-27B-GGUF)
🎉 16G 丐版 M1 部署 Qwen 3.8-27B 实测报告:
不出意外,打字机效果,不过智商还可以😄。
📊 实测配置与数据
设备:MacBook Pro(M1 / 16GB)
模型:Qwen3.8-27B(UD-Q2_K_XL,9.15GB)
GPU:全层 Metal 卸载
内存:稳定在 11 GB 左右
首 Token 延迟:约 850ms
预填充速度:10 ~ 12.5 tok/s
生成速度:约 4 tok/s。
几点调优心得👇🏻
1. M1 的瓶颈主要是内存带宽
M1 内存带宽仅 68 GB/s,每生成一个 Token 必须将 9.15G 权重通读一遍。4 tok/s 已经榨干了 M1 物理带宽的 60% 极限!
2. 按场景切换思考模式
Qwen3.8 原生自带深度思考链。日常对话通过调参关闭思考,跳过思考链直出答案,体验极其干脆;写复杂算法时开启思考,逻辑推导依然在线。
3. 用投机采样继续提速。
叠加 --flash-attn on + -ctk q8_0 + --spec-type ngram-simple 投机采样,写代码与结构化文本时,速度能飙到 5.5+ tok/s。
结论:老 M1 还能再战三年!✌🏻
---
原文链接:[点击查看](https://www.v2ex.com/t/1235880)
qwen3.8 开源,性能比肩 opus4.6,之后出现几百个版本。
目前量化版本从 1bit 到 16bit,最低 8G 内存 mac 即可运行。
想要获得不错的体验推荐 3080 以上显卡。
传送门:[https://huggingface.co/unsloth/Qwen3.8-27B-GGUF](https://huggingface.co/unsloth/Qwen3.8-27B-GGUF)
🎉 16G 丐版 M1 部署 Qwen 3.8-27B 实测报告:
不出意外,打字机效果,不过智商还可以😄。
📊 实测配置与数据
设备:MacBook Pro(M1 / 16GB)
模型:Qwen3.8-27B(UD-Q2_K_XL,9.15GB)
GPU:全层 Metal 卸载
内存:稳定在 11 GB 左右
首 Token 延迟:约 850ms
预填充速度:10 ~ 12.5 tok/s
生成速度:约 4 tok/s。
几点调优心得👇🏻
1. M1 的瓶颈主要是内存带宽
M1 内存带宽仅 68 GB/s,每生成一个 Token 必须将 9.15G 权重通读一遍。4 tok/s 已经榨干了 M1 物理带宽的 60% 极限!
2. 按场景切换思考模式
Qwen3.8 原生自带深度思考链。日常对话通过调参关闭思考,跳过思考链直出答案,体验极其干脆;写复杂算法时开启思考,逻辑推导依然在线。
3. 用投机采样继续提速。
叠加 --flash-attn on + -ctk q8_0 + --spec-type ngram-simple 投机采样,写代码与结构化文本时,速度能飙到 5.5+ tok/s。
结论:老 M1 还能再战三年!✌🏻
---
原文链接:[点击查看](https://www.v2ex.com/t/1235880)
· 0 个赞