使用 deepseek,外接视觉模型有什么好的便宜的方案推荐
foryou2023:
deepseek 不是多模态,在实际使用中写 UI 确实差点意思,感觉好麻烦,特别是在调 UI 的时候,感觉不好沟通。
目前实践制作 UI 的流程是让 deepseek 绘制 ASCII UI 布局,确定布局之后,就整理提示词使用 gemini 的 stitch 制作原型图,原型图确定后再回到 deepseek 里面制作界面。
在实际过程中就会遇到一些小问题,比如网站的某些 UI 细节或者按钮的大小不一致,deepseek 无法看到,有些文字描述的内容,deepseek 也没有办法一次性搞定。
所以想求一个比较好的使用方案,能解决 deepseek 在 UI 视觉上遇到的问题。
---
原文链接:[点击查看](https://www.v2ex.com/t/1232764)
deepseek 不是多模态,在实际使用中写 UI 确实差点意思,感觉好麻烦,特别是在调 UI 的时候,感觉不好沟通。
目前实践制作 UI 的流程是让 deepseek 绘制 ASCII UI 布局,确定布局之后,就整理提示词使用 gemini 的 stitch 制作原型图,原型图确定后再回到 deepseek 里面制作界面。
在实际过程中就会遇到一些小问题,比如网站的某些 UI 细节或者按钮的大小不一致,deepseek 无法看到,有些文字描述的内容,deepseek 也没有办法一次性搞定。
所以想求一个比较好的使用方案,能解决 deepseek 在 UI 视觉上遇到的问题。
---
原文链接:[点击查看](https://www.v2ex.com/t/1232764)
· 0 个赞
1. 试过百炼平台的 qwen3.6-flash,速度感觉不太行,处理稍微大点的图得等十来秒。
2. 后来拿脚本对比了一圈 Groq、Cerebras 和 Google 的视觉接口,发现识别速度和准确率最稳的是 `gemini-3.5-flash-lite`(我用它来提取理财平台的持仓数字,对准确率要求极高)。
3. 如果只是让它大致描述一下 UI 布局,其实 Groq 和 Cerebras 的模型出图会更快。
另外给个新思路:你也可以让 Agent 借助 MCP 直接连上浏览器,这样它能直接“看到”真实渲染出来的网页效果,改 UI 会更直观。
· 0 个赞
· 0 个赞
· 0 个赞
· 0 个赞