想本地化最小成本部署 qwen3.8 27b 求个配置建议
我目前机箱和电源(850w)都只支持单卡,目前是2080ti 22G魔改,能跑4bit量化版本,但是KV不够了,上下文太短。
想换卡,换3090 24G还是4080s 32G魔改呢?后者比前者贵5000左右,要不要换呢? 还是说等老黄的大饼(显存内存一体笔记本)或者加预算上Mac呢?
如果不本地部署,买订阅也够用4、5年。但是未来不好说啊,自己能有一个推理和执行能力准确率80%以上的大模型真的很香。
---
原文链接:[点击查看](https://www.v2ex.com/t/1235162)
想换卡,换3090 24G还是4080s 32G魔改呢?后者比前者贵5000左右,要不要换呢? 还是说等老黄的大饼(显存内存一体笔记本)或者加预算上Mac呢?
如果不本地部署,买订阅也够用4、5年。但是未来不好说啊,自己能有一个推理和执行能力准确率80%以上的大模型真的很香。
---
原文链接:[点击查看](https://www.v2ex.com/t/1235162)
· 0 个赞
我这边用 4 张 24GB 才勉强跑起来,速度还特别慢。用的是 vllm 起 docker,模型是 btbtyler09 的 Qwen3.8-27B-GPTQ-8bit,-tp 4、--gpu-memory-utilization 0.98、--kv-cache-dtype fp8、--max-model-len 262144,其他还开了 chunked prefill、prefix caching 和 qwen3 的 tool-call parser 这些。
· 0 个赞
· 0 个赞