想本地化最小成本部署 qwen3.8 27b 求个配置建议

发布于

我目前机箱和电源(850w)都只支持单卡,目前是2080ti 22G魔改,能跑4bit量化版本,但是KV不够了,上下文太短。

想换卡,换3090 24G还是4080s 32G魔改呢?后者比前者贵5000左右,要不要换呢? 还是说等老黄的大饼(显存内存一体笔记本)或者加预算上Mac呢?

如果不本地部署,买订阅也够用4、5年。但是未来不好说啊,自己能有一个推理和执行能力准确率80%以上的大模型真的很香。

---

原文链接:[点击查看](https://www.v2ex.com/t/1235162)

评论(3)

我用 4090 跑过,感觉也就那样,本地部署这玩意真是营销号吹得多。个人体验还不如新出的 gemini3.7-flash。

· 0 个赞

想问问楼上单卡 24GB 是怎么跑起来的?用的什么量化、上下文开了多少?

我这边用 4 张 24GB 才勉强跑起来,速度还特别慢。用的是 vllm 起 docker,模型是 btbtyler09 的 Qwen3.8-27B-GPTQ-8bit,-tp 4、--gpu-memory-utilization 0.98、--kv-cache-dtype fp8、--max-model-len 262144,其他还开了 chunked prefill、prefix caching 和 qwen3 的 tool-call parser 这些。

· 0 个赞

我的方案:850W 电源 + 270KP+Z890,拆成双槽 PCIE5.0 x8,插两块 5060TI 16G,跑 27b q4 量化,速度大概 23 token/s。估计是双槽通讯延迟加上 5060TI 位宽太小拖了后腿,不过图个隐私,倒也能用。想体验好点的话,建议还是上单卡 32G 以上的,比如 70ti / 80ti 那种。

· 0 个赞

0.044368s