我发现个人部署本地 llm 真的很垃圾。

发布于

本地显存 48g 4090d,llm 为 fp8 量化版 qwen36.-27b。

工作流是 yt-dlp → funasr → 获取文案 → qwen 提取观点 → langgraph 调用 qwen 多 agent 对话 → crawl4ai 搜索补充 → 生成文案龙骨 → qwen 分段生成。

最终文案丢给 GPT,无论怎么调提示词或流程,基本都是说废话太多,前面提到的观点后面重复解释之类。而且调试也费时。最后换成在线 API,一切解决了。

本地模型可以用来生/编辑图、生视频、背景音等,短文可以,长篇还是算了,本地 llm 注意力机制的能力就决定了不能胜任。

---

原文链接:[点击查看](https://www.v2ex.com/t/1236094)

评论(2)

3.6 已经很老了啊,为啥不直接上 3.8?

· 0 个赞

回复

我用了两个多月的真实感受。3.8 也试过,一个样——只要传入的参数多、要求多,注意力机制的能力就跟不上,容易漏掉一些要求。打个比方,就像流水线的并行处理:你提了 10 条要求,一条流水线跑过去可能只处理了 8 条,最后拿这 8 条的结果来拼装,自然满足不了需求。

· 0 个赞

0.043827s