使用 deepseek,外接视觉模型有什么好的便宜的方案推荐

发布于

foryou2023:

deepseek 不是多模态,在实际使用中写 UI 确实差点意思,感觉好麻烦,特别是在调 UI 的时候,感觉不好沟通。

目前实践制作 UI 的流程是让 deepseek 绘制 ASCII UI 布局,确定布局之后,就整理提示词使用 gemini 的 stitch 制作原型图,原型图确定后再回到 deepseek 里面制作界面。

在实际过程中就会遇到一些小问题,比如网站的某些 UI 细节或者按钮的大小不一致,deepseek 无法看到,有些文字描述的内容,deepseek 也没有办法一次性搞定。

所以想求一个比较好的使用方案,能解决 deepseek 在 UI 视觉上遇到的问题。

---

原文链接:[点击查看](https://www.v2ex.com/t/1232764)

评论(6)

你可以试试在 Claude Code 里面挂载智谱的视觉 MCP,视觉模型既可以自己外接,也可以直接用智谱自带的 GLM-4V。

· 0 个赞

回复

感谢老哥分享,我这就去研究一下。

· 0 个赞

我之前自己折腾过调用视觉模型做 OCR 识别的脚本,分享点踩坑经验:
1. 试过百炼平台的 qwen3.6-flash,速度感觉不太行,处理稍微大点的图得等十来秒。
2. 后来拿脚本对比了一圈 Groq、Cerebras 和 Google 的视觉接口,发现识别速度和准确率最稳的是 `gemini-3.5-flash-lite`(我用它来提取理财平台的持仓数字,对准确率要求极高)。
3. 如果只是让它大致描述一下 UI 布局,其实 Groq 和 Cerebras 的模型出图会更快。
另外给个新思路:你也可以让 Agent 借助 MCP 直接连上浏览器,这样它能直接“看到”真实渲染出来的网页效果,改 UI 会更直观。

· 0 个赞

商汤的 SenseNova 视觉模型也还行,可以试试。

· 0 个赞

我的方案是直接走火山引擎,接入了豆包的视觉大模型来搞识别。

· 0 个赞

楼上几位提供的思路都很棒,非常感谢大家的推荐,我去挨个试试看。

· 0 个赞

0.050360s