商汤发布并开源 SenseNova-Vision 理解生成统一视觉大模型,能力超越 Vision Banana

发布于

IT之家 7 月 13 日消息,商汤科技今日发布并全面开源 **日日新 SenseNova-Vision 理解生成统一视觉大模型**,这是商汤日日新大模型体系的重要视觉能力升级。

![图片](http://pic.zhso.org/2026/07/13/3a3d1617f8d7.jpg)

商汤科技表示,行业以往的 " 统一视觉 " 多是把检测、分割、深度预测等多个专家模型打包封装,本质还是割裂的。SenseNova-Vision 的核心变革是:**让视觉成为通用基础模型的原生能力,彻底融入大模型体系**。所有经典视觉任务如目标检测、图像分割、深度预测、3D 重建等,由此都实现了原生统一。

![图片](http://pic.zhso.org/2026/07/13/0dfe400a8b45.jpg)

在多项评测中,SenseNova-Vision 以“单模型”在四大核心视觉领域大范围领跑,比肩甚至超越了各领域的专用“专家模型”:

- **结构化视觉理解**:在目标检测、指代检测(Referring)、OCR、关键点定位等任务上全面领先同类型通用模型。在稠密小目标检测、长尾类别识别等复杂场景下表现尤为突出。
- **稠密几何预测**:深度估计、表面法向(Surface Normal)估计精度达到几何专用模型水准,在室内外多场景下均能保持极高的稳定性。
- **分割能力**:涵盖通用分割、推理分割、交互式分割等。得益于强大的多模态理解力,其在推理分割(Reasoning Segmentation)与对话式分割(GCG Segmentation)表现上惊艳。
- **多视角 3D 几何**:仅通过单模型即可高质量完成多视角点云重建与相机位姿估计,性能在通用视觉路线中处于领先位置。

![图片](http://pic.zhso.org/2026/07/13/b079f077fedc.png)

横向对比如下:

- 对比语义导向模型(如 Youtu-VL 等):SenseNova-Vision 在检测、分割、深度等对细节要求极高的视觉任务上实现 **全面领先**。
- 对比生成导向模型(如 Vision Banana 等):展现出全面的 **代际优势**。
- **a. 核心指标超越**:在各项权威评测的硬核对决中,SenseNova-Vision 在绝大多数指标上均实现了对 Vision Banana 的超越与领跑。
- **b. 任务能力倍增,且全面开源**:展现出更强的多任务泛化实力。如 Vision Banana 仅能应对四大核心板块中的“两类”问题,而 SenseNova-Vision 却能同时将结构化理解、稠密几何、全景分割、多视角 3D 等全任务一网打尽。在此基础上 SenseNova-Vision 还做到模型、数据全面开源。

![图片](http://pic.zhso.org/2026/07/13/6844cc7330b7.png)

商汤也同步开源了包含 5000 万条样本的视觉指令语料库 **SenseNova-Vision Corpus-50M**。

未来,商汤将把 SenseNova-Vision 的核心技术全面融入日日新 U 系列大模型中。

IT之家附开源地址:

[https://github.com/OpenSenseNova/SenseNova-Vision](https://github.com/OpenSenseNova/SenseNova-Vision)

---

原文链接:[点击查看](https://www.ithome.com/0/975/952.htm)

评论

暂无评论。