简体
  • 简体中文
  • 繁体中文

热门资讯> 正文

多模态迎来「架构换代」:商汤连出两张牌,划定大一统基座新标准

2026-07-21 17:43

(来源:机器之心)

刚刚结束的 2026 年世界人工智能大会(WAIC) ,具身智能与 AI 终端占据了最显眼的位置,人形机器人、灵巧手和各类智能硬件吸引了大量目光。

展台上的热闹之外,模型架构的演进构成了大会的另一条技术线。

这类架构问题被摆上了台面,业界急需新的解题思路。

近日,商汤科技在 WAIC 2026 发布了日日新 SenseNova U1 Pro(以下简称 U1 Pro),这款面向长程任务的交付级原生多模态智能体基座模型,将理解、生成和行动纳入统一的能力框架。

而在 WAIC 召开前夕,商汤还开源了日日新 SenseNova-Vision 视觉大模型,将目标检测、图像分割、深度预测和三维重建等经典计算机视觉任务,直接沉淀为通用大模型的原生能力。

这连续两次出手,并非孤立的技术发布。如果说 U1 Pro 代表了商汤在「上层复杂视觉创作与交付」上的原生突破,那么 SenseNova-Vision 则回答了「底层物理世界感知与几何物理表达」如何统一进通用大模型的终极命题。两者的交汇,标志着商汤已率先卡位下一代原生统一多模态基座

「单次生成」到「长程创作」

探索视觉内容系统化交付

要实现商汤科技董事长兼 CEO 徐立提出的「Agentic Creation 智能体创作」范式,模型需要围绕复杂目标持续理解、规划、生成、检查和修正,最终交付可以直接使用的结果。

这对模型底层架构提出了更高要求。U1 Pro 的技术基石 ——NEO-unify 原生统一架构,正是商汤给出的答案。

SenseNova U1 Pro 官网:https://www.sensenova.cn/u1-pro

这套架构大幅降低了跨模态交互时的信息损耗。基于此,U1 Pro 展现出面向真实产业场景的交付能力

首先是设计美感的突破。对于商业海报、品牌视觉、知识信息图这类真实创作任务,审美不只是锦上添花,它本身就是交付的一部分。U1 Pro 侧重构图、色彩、版式和视觉层级等更接近专业设计语言的维度,让模型能够理解「好看」背后的设计逻辑。

其次是 8K 原生超清输出。 超长画幅和高信息密度图片放大之后很容易出现文字变形、线条断裂和模块错位等问题。U1 Pro 在大尺寸下依然能够保持文字、图标和版式关系的清晰稳定,提高了高密度视觉任务的工程可用性。

第三是图文与细节控制能力。信息图、科普图解、PPT 页面、装配说明等任务,对模型的要求远高于一般意义上的图像生成,要组织视觉元素,还要梳理信息关系、维持版式秩序,并尽可能降低文字渲染错误。U1 Pro 在这部分强化的,本质上是图像生成与信息表达之间的耦合能力。

就像在「预测美加墨世界杯」中,商汤展现出的从「一次性灵感工具」到「长程交付者」的进化:先通过 Skills 自动搜集和分析战术数据,再将晋级路径、球员对位、战术体系、传球网络和触球热力图等内容组织成可视化报告,自动组织成逻辑严密、排版精美的可视化报告,完美实现「搜集 — 推理 — 视觉交付」的全链路闭环。

U1 Pro 最核心的价值,在于它将行业对视觉模型的评价标准,从「抽卡式的单张画面惊艳度」,拉升到了「复杂长程任务的稳定完成度」

视觉创作的竞争,也由单次结果的惊艳程度,延伸到一整条任务链的稳定运行。当然,系统级交付仍需接受更多开放环境检验,比如长程任务成功率、错误恢复能力、多轮运行成本以及跨场景稳定性。

重写经典视觉底层范式

视觉任务即多模态生成

如果说 U1 Pro 关注的是如何把复杂信息图转化为直接交付成果, SenseNova-Vision 则在更底层的维度切入,解答了经典视觉任务如何融入通用多模态基座体系的问题。

过去数十载,经典计算机视觉一直依赖「专家分工」系统,检测、分割、深度估计、三维重建各套模型拥有各自的预测头(Task-Specific Heads)、损失函数、解码规则与评测协议。这套体系非常成熟,也支撑了大量产业应用,但结构性代价同样明显。数据割裂在独立管线中,能力无法跨任务复用,每增加一种新需求,系统就需要接入新的模型或专用模块。任务越多,系统越重。

SenseNova-Vision 提出了颠覆性的解法:系统性地将多类异构视觉任务,表述为原生多模态生成问题

它彻底摒弃了繁复的 Task-Specific Heads,在同一个共享的表征空间内,对文本、像素、语义信息和几何特征进行端到端统一建模: 

  • 类别、坐标、OCR 结果等符号化答案,通过文本生成表达;

  • 分割掩码、深度图、表面法线等与空间对齐的密集预测,通过图像生成表达;

  • 复杂场景则直接采用图文交错混合输出

所有视觉任务的输出没有强行被压缩成单一格式,保留了文本和图像各自擅长的表达空间

SenseNova-Vision 概览。

SenseNova-Vision 概览。

技术报告:https://arxiv.org/pdf/2607.06560

为了支撑这一「大一统」范式,商汤对数据层面进行了系统性重组,构建并开源了 SN-VC-50M 数据集(包含 5000 万个高质量视觉监督样本),将检测框、关键点、OCR、分割掩码、深度图、表面法线、点云图和相机位姿等异构标注,统一转换为「视觉输入 + 自然语言指令 + 可解码响应」的标准范式,为整个学术界与产业界打通通用视觉基座搭建了关键基础设施。

SN-VC 的数据来源构成,以及模型训练时实际使用的数据配比。

SN-VC 的数据来源构成,以及模型训练时实际使用的数据配比。

实验数据表明,SenseNova-Vision 在实现四大类视觉任务(结构化理解、稠密几何、图像分割、多视角三维几何)全面覆盖的同时,其性能不仅在结构化视觉理解上刷新 SOTA,并在上述任务中比肩顶尖的专家模型。

对通用视觉模型而言,「任务做得多」与「专项能力足够强」具备了同时成立的可能

SenseNova-Vision 在结构化视觉理解上达到 SOTA,在稠密几何预测和分割任务上接近最强专用基线,多视角三维几何表现也逼近领先专家模型。

更重要的变化,落在能力重组上。传统专家模型的能力通常被封装在预定义任务协议中,统一训练使模型有能力处理显式训练协议之外的新任务组合,带来「跨任务能力重组」的惊喜。比如,在面对未经训练的复杂场景图(如《黑神话:悟空》《我的世界》等游戏画面)时,模型无需切换任何模块,即可在单次交互中连续输出表面法向估计、实例分割与角色关键点检测。

变化的还有视觉模型的角色。商汤为经典视觉能力进入通用基座提供了一条可扩展路径,标志着视觉 AI 正从「工具箱式的算法拼接」,迈向「全能型原生基座」的新时代。

U 系列的下一站

指向统一多模态大基座

落在多模态生成与经典视觉任务两端的 SenseNova U1 Pro 和 SenseNova-Vision,我们看似承担着不同任务,其本质上是商汤在原生统一架构上的「双向奔赴」。

据商汤透露,其未来有计划将 SenseNova-Vision 的物理世界感知与几何三维重建能力,深度融入到日日新 U 系列大模型中。届时,U 系列将演进为一个同时兼具长程创作交付、高密图文理解、物理空间感知与三维几何建模的「全感知 - 全生成」统一多模态基座

这种架构的演进,正在重新定义视觉 AI 的竞争壁垒。行业的关注点,正在从过去的「谁拥有的单点算法库更多」,转向「谁的基座模型能够吸收更丰富的专业视觉数据、以更低工程成本复用跨任务知识」。

未来尽管高精度、低延迟的专家模型,仍然将在强约束的工业场景中发挥重要作用。但毫无疑问,能够贯通理解、生成、感知与行动的原生大一统基座,正不可逆转地成为下一代通用人工智能(AGI)的核心主干。 商汤连续打出的这两张牌,无疑为这场架构换代潮划下了鲜明的标杆。

风险及免责提示:以上内容仅代表作者的个人立场和观点,不代表华盛的任何立场,华盛亦无法证实上述内容的真实性、准确性和原创性。投资者在做出任何投资决定前,应结合自身情况,考虑投资产品的风险。必要时,请咨询专业投资顾问的意见。华盛不提供任何投资建议,对此亦不做任何承诺和保证。