对话商汤林达华:多模态是 Coding 之后的下一个战场

作者丨高允毅
编辑丨马晓宁
7月18日,在2026年WAIC大会上,商汤科技承办的“基座大模型架构创新与生态合作论坛”如期举行。大会之前,在喧嚣的会场之外,《AI科技评论》拜访了商汤科技首席科学家林达华。
当被问到“大语言模型已经发展到如今高度后,下一个决胜负战场在哪”时,林达华没有罗列复杂的Benchmark,他指向办公室内的一盆矮脚绿植说“你能用语言向我描述清楚这盆盆景每一片叶子的精确位置吗?”
接着他说:“这对我来说很困难,大量的感知细节是无法用语言穷尽的。人眼能一瞬看清的感知,语言却往往无法说清楚。”
这记“盆景之问”,恰恰击中了当下大语言模型面对真实物理世界时的那道隐形的边界。
从设计中的高级审美,到城市空间的三维布局,再到自动驾驶、具身智能与现实世界的交互——凡是需要理解物理空间的场景,都离不开真正的“视觉”能力。
人类的大脑本就是语言与视觉的深度融合的产物。从这一第一性原理出发,商汤押注的下一个战场,正是多模态。
过去一年,从 OpenAI 等国际巨头到国内的Kimi、DeepSeek、字节、阿里,重金砸向多模态的玩家不在少数。然而,在视觉领域深耕多年的商汤,选择了一条更难、也更接近本质的“硬核”道路:从底层融合语言和视觉基座。并在今年3月推出原生统一多模态架构 NEO-unify。
4 月,商汤正式发布并开源了基于原生统一架构的多模态模型SenseNova U1(简称U1),切入设计赛道。而在大会当天,商汤选择迈入商用的深水区,推出可交付级别的旗舰模型——SenseNova U1 Pro(简称U1 Pro)。作为全球首个以“理解、生成、行动”原生统一为内核的多模态工具,它具备内生的“图文交错思维”,能直接输出高达原生 8K 顶级画质成片,在设计领域正面对标全球顶尖的如 GPT-Image-2等模型。
借此契机,我们与林达华进行了一场关于多模态的终极形态与商汤技术底牌的深度对话。

01
为什么多模态
是Coding之后的下一个战场
当前,AI Coding 是头部 AI 厂商疯狂内卷的行业高地,Anthropic等公司也因此实现飞升。外界疑惑的是,商汤为何在此时不急于跟风抢夺红利,反而大谈特谈多模态?
在林达华看来,AI Coding 确实是目前商业化最成熟的赛道,但纯文本语言的天花板也已经清晰显现。
“你用任何一款代码模型写前端网页,一眼就能看出来是 AI 生成的。它和具备‘苹果级’质感的现代产品界面,有着非常明显的差距。” 林达华指出,高级的设计感与空间美学,纯靠代码逻辑根本实现不了,这是纯文本 Coding 天然的盲区。
行业中最敏锐的巨头早已开始悄悄转向。以编程能力见长的 Anthropic,在Opus 4.8 版本中重点强化多模态元素。
这意味着,当后端逻辑代码的能力逐步趋同、价格战愈演愈烈,前端体验、视觉交互自然成了下一阶段的竞争高地。这也正是商汤切入AI Coding战场的机会,与其在纯文本领域硬卷,不如发挥自身在视觉上的积累和绝对优势。
在业内有一种观点认为:未来的 AI Agent 都会以纯文本命令行(CLI)交互,多模态的价值没有想象中那么高。 林达华并不认同,他认为只要人和 AI 持续共存,在人机交互上,视觉交互就是不可替代的核心载体, “因为CLI是面向机器的,而视觉才是面向人类体验的。”
无论是写办公汇报、海报设计,还是游戏开发、影视制作,这些更高频的大众场景,其本质都离不开视觉。
"想要打造能在物理世界中思考、行动的‘全能智能’,就必须打破壁垒,让视觉与语言在底层大脑中融为一体。"林达华强调,这正是商汤自研 NEO-unify 原生统一架构的核心初衷。
但这并非易事。语音和文本属于同构模态,语音可以直接映射为文字,仅多了语气、停顿等少量维度;但视觉与语言是完全异构模态,像素无法简单对应文字词元,攻克异构模态融合,一直是多模态领域长期发展的核心难点。

02
U1 Pro的打怪升级路径
长期以来,多模态大模型领域的主流技术路线是“拼接式架构”,即在成熟的语言大模型之外,外挂一个独立的视觉编码器(VE)等模块。这种方式的本质,是先将图像“翻译”成文本,再交由语言模型去处理。
拼接方案的工程门槛低、训练速度快,但其技术上天花板也相对较低。因为这种翻译的过程,会损耗大量精细化空间和感知细节信息,导致视觉与语言的融合效率很低,并非"真正看见"。
林达华带领的商汤团队很早就看到了拼接架构的局限,并一直在寻找一种原生统一模型架构的可能性。 他们认为,多模态的终极形态应当是让不同的AI模态拥有共同的语言和表征,从而能够像人类大脑一样,顺畅无阻地深度沟。
“我们很早就看到了拼接架构的局限性。多模态的终极形态,应当是让不同的模态拥有共同的内核语言和统一表征,能够像人类大脑一样,顺畅无阻地深度沟通。”林达华透露,OpenAI和谷歌同样意识到了这一点并秘而不宣,而商汤选择走得更公开、更彻底。
这是一场坚守长期主义的漫长探索:
2025年中,林达华团队联合南洋理工大学S-Lab,率先在小规模数据上验证了原生融合的设想。同年9月,团队发表论文Towards Native Vision-Language Primitives at Scale,在学术界首次系统阐述了彻底移除视觉编码器、建立深层融合的原生多模态NEO架构。
2026年3月,商汤进一步发布升级框架版——原生统一架构NEO-unify和论文NEO-unify: Building Native Multimodal Unified Models End to End系统阐述了打造端到端原生统一模型的宏大设想。
在NEO-unify架构中,商汤彻底移除了主流大模型普遍依赖的视觉编码器和变分自编码器,让模型不再需要"翻译器",而是直接从像素和文字中学习。
支撑其运转的是一套自研的 Mixture-of-Transformers(MoT) 架构。该架构的独特之处在于,它让语言和视觉信息在模型的每一层计算中完成深度交融。对于多模态领域,这种从架构层面的重构,意义堪比Transformer之于大语言模型。
那这套架构效果好不好呢?其实效率惊人,NEO-unify架构仅需3.9亿图像文本示例(仅为业界同等性能模型约1/10的数据量),就涌现出了顶尖的视觉感知和推理能力。
开源版本的SenseNova U1正是这套架构的结果,它拥有真正的“图文交错思维链”,可以在同一个上下文里边写字边插图,确保图像和文字在风格与内在逻辑上具备极高的一致性。值得一提的是,在同量级开源模型中,仅以 8B 体量起步的 U1 直接斩获 SOTA 性能,部分表现甚至跨代直逼主流大型闭源模型。
随后,研发团队敏锐地锁定了 “信息图”(infographic)赛道,并且针对这一极具商业价值的场景,该系列正以惊人的速度高频迭代:
infographic-V1:在底层算力架构上进行了全面重构,让信息图生成的信息密度与排版质感迎来了显著跨越;
infographic-V2:彻底攻克了行业顽疾,针对以往“字数一多画面就糊、甚至连字错字”的痛点,大幅提升了小字清晰度与排版精度,视觉表现直接向专业设计师看齐。
infographic-V3:重磅引入“可编辑功能”,让用户可以随时点选、直接修改画面。

图注:U1 Pro设计的关于“背包”的信息图,可以看到图中文字清晰准确,整体设计高级美观
这套持续进化的技术范式,最终在U1 Pro上迎来了全面爆发,宣告了 AI 设计进入“交付级”时代。

03
为什么这是一款做设计的好模型
在当前的AI热潮中,能画出漂亮图片的AI比比皆是。但当我们把这些AI拉进真实的商业设计场景时,往往会发现它们成了“花架子,一到复杂排版、密集信息、长需求描述的实际任务中就露了怯。
因为“画画”靠的是审美概率,而“设计”靠的是精准的逻辑与控制。
林达华将U1 Pro定位为一款在审美和设计能力上都达到一定高度的产品。这背后不是运气,而是一场漫长且严苛的专业化淬炼。整个模型的训练过程,就像一位“顶尖设计师”的成长史。
“想要让AI具备真正的专业设计能力,就必须用上亿道‘魔鬼级’的设计题去喂养它。”
林达华指出,天然的现实世界中,极少存在自带密集信息和复杂排版的完美数据,这些“养料”必须依靠人工与算法精准创造。为此,商汤构建了一个规模过亿、甚至逼近数十亿级别的超大型“多模态题库”。在这类高阶数据中,仅单张设计图对应的文字描述和需求说明,往往就长达上千字。
这种对数据极端严苛的需求,直接映射在U1 Pro的阶段性训练流中。
在预训练阶段,模型吞吐数十亿级的图文原生交错数据,打下深厚的认知地基;进入持续预训练阶段,高比例的“合成数据”成为绝对主力,团队在数亿量级的数据海中,高强度拉升模型的专业设计能力;到了最终的后训练阶段,团队则百里挑一,精选出千万量级的黄金数据进行精雕细琢,让模型的审美沉淀出成品级的交付质感。
而支撑这套庞大“合成数据”,正是商汤内部一套极其复杂的、由超级Agent驱动的自动化数据合成管线。
“核心技术的突破从来不是一场追逐风口的短跑,而是一场坚守长期主义的马拉松”。在林达华看来,只要团队认准了某个方向具备巨大的长远潜力,即使它在某个阶段并未处于社会舆论的绝对C位,商汤也会摒弃外界的杂音,以坚定的战略定力进行长期主义的饱和投入。“因为我们深知,那些能真正改变行业底层范式的长期价值,远比一时的流量热点更为巨大。”

04
先打穿信息图,讲好商业故事
商汤为多模态战略选择的一个核心赛道是设计方向,尤其是信息图,这是一个可商业化性极强的场景,尤其是B端,特别是电商、广告、游戏、出海贸易等领域,有大量设计需求。
根据Precedence Research 等的最新报告:2026年全球设计领域的生成式AI市场规模约为 13.3 亿美元。大型企业和企业级客户贡献了超过 47% 的市场份额,是AI设计工具最大的买单方。
然而长期以来,AI 生图要真正走向高端商业化,始终面临着难以逾越的瓶颈:
比如,AI无法准确理解需求,从而图不达意。市面上有不少模板拼接方案,但这种方案又存在无法消除的割裂感,整体版式、色彩、比例无法形成统一审美逻辑,肉眼能直观看出拼凑痕迹。
更麻烦的是,模型无法建立元素间的设计因果,只是简单堆砌图形文字,完全不理解版式排布、元素搭配与品牌表达之间的内在关联。
一旦客户提出局部微调需求,又往往会牵一发而动全身,导致修改成本甚至超越重新原创,这些都是AI设计难以直接走向高端商业化的核心瓶颈。
“学术界生成一张图,100 个字错 1 个,论文里可以打 99 分。但真实商业世界里,一张客户的海报错一个字,这张图就是废纸,只能打 0 分。” 商汤首席科学家林达华直接指出行业痛点。
面对这些挑战,U1 Pro依托原生统一多模态架构,从底层理解到图像生成,系统性解决了上述难题。
在评判模型优劣时,林达华评判模型好坏的标尺只有一个:交付率, 即生成内容无需大幅修改,可直接交付商用,达到付费专业设计师的出品标准。
他公布了 U1 Pro 最新交付率数据稳定在70% 。
这个数字乍一听似乎不高,但放在真实的商业场景,这足以真正改变设计赛道的供需关系。60%是商业可交付基准线,放眼全球,只有两个多模态模型超越这一基准,一个是商汤U1 Pro,另一个是来自OpenAI的GPT-Image-2,后者被称为多模态行业御用标尺。
70% 交付率背后是严苛的全维度品控,这意味着,文字错误率控制在千分级,整张图上千文字仅极低概率出现错字;图形元素、空间布局、色彩搭配等细节错误同步控制在千分级。
换句话说,AI 真正具备了人类主观的“高级审美”,能够做出让客户心甘情愿买单的设计。

图注:从U1 Pro设计的泉州主题海报,可以看到丰富的内容和细腻的设计

图注:U1 Pro设计的二十四节气海报,支持8K分辨率及特殊长宽比
U1 Pro 是怎么做到有如此高的交付率?林达华向我们透露,其核心在于商汤设计了一种叫“视觉拆解思维链”的学习模式,将模型训练成了“会思考的设计师”。
在训练过程中,当模型拿到一个高质量海报后,先会自动拆解图像全部视觉组件,再逆向推理设计师版式布局逻辑、色彩搭配思路,生成完整设计思维链进行学习,不只是学形似,而是抓思路,抓神韵。
这种设计思维内化进了模型本身,在生成图片时,U1 Pro 不像传统模型那样“一次性盲盒出图”,而是采用多轮智能体生成闭环:
第一步先基于文本需求拆解信息、规划版式,形成完整的设计方案;第二步依靠内生能力完成全图生成;第三步启动全局自检,识别文字错误、布局瑕疵与审美问题,不断反向迭代修改。直到完全符合交付标准才会输出最终成品。
为了打磨"审美的最后一公里",商汤还组建了一支由200名美院学生和专业设计师组成的"人类审美团"。这些人每天的工作就是对着U1 Pro生成的的作品疯狂"找茬"和打分。
就像设计公司的新人,被老板和甲方反复“毒打”了千百遍后,自然就知道什么是真正的高级感了。

05
世界模型是其中一个故事
采访中,林达华透露一个有趣的细节,U1 Pro其实已经具有一些空间推演能力,能玩魔方了。这意味着,这款被定位为“设计师”的模型,已经开始隐隐触摸到三维世界的边缘。
在商汤的版图上,世界模型并非是与多模态底座平行的另一条线,而是视觉与语言深度融合基座上的一个自然分支,就像Transformer是底座,上面可以长出各种LLM一样。
而当下大热的具身智能,也可以理解为同一个底座上的又一成熟分支。
以商汤“1+X”战略下孵化的生态企业大晓机器人为例,其最新推出了“开悟”世界模型,它讲的是理解、生成、预测的统一。解构其底层技术会发现,其背后依然是那个视觉与语言结合的多模态底座,只是在具体训练中具身数据占了更高的比例。
看似万流涌动,实则九流归宗。这些分赛道的探索,数据和方法最终都会在下一代模型里合流。
值得一提的是,就在7月13日,商汤还发布了另一个理解与生成统一的视觉大模型SenseNova-Vision。它的核心战略在于让视觉成为通用基础模型的原生能力,而这种原生视觉能力已在多个维度上超越了专用视觉模型。过去目标检测、图像分割、深度预测、3D重建等需要大量定制化的经典视觉任务,现在一个模型就能完成。
有了这些前沿探索的养分注入,商汤多模态的未来图景已呼之欲出。
林达华透露,下一代的U2将真正走向三维。如果说U1还是在二维平面上的设计,那么U2将融入视频的理解和生成,把感知、理解、生成、行动全部一体化。“也许再下一个版本,你给它一张设计草图,它能把整个建筑造出来。”
而更远处的终极形态,是模态从视觉、语言扩展到几十种传感器信号。“那个时候,才是大家认为的最完整的世界模型。”
然而,通往终极世界模型的道路并非一片坦途,物理规则的复杂性超乎想象。在林达华看来,未来在物理规则之外,还会纳入人类社会学等更多维度。“今天机器人能准确拿起一杯水,明天它可能会区分一杯沸水和一杯温水,并做出不同的动作反应。”
到那时,每新增一个物理属性维度,数据组合的量级就会指数级暴涨,算力和存储会成为无法突破的瓶颈。林达华对此给出了独到的解题思路:或许未来的解法是对世界属性进行解耦,拆分出不同属性的专用子模型,让它们有机组合、协同推理,而不是穷尽所有数据组合。
在这场充满未知与瓶颈的科学马拉松里,我们在林达华眼中看到的不是疲惫,是拓荒者的兴奋。 采访临近尾声,雷峰网向林达华发出最后的终极一问:
"你最想带团队攻克的下一个技术山头是什么?"
"物理世界的AGI。"林达华没有任何犹豫。
或许,在AI与人类之间,那些说不出的东西,恰恰是智能最坚硬的部分。

图注:雷峰网拍到商汤上海办公室,在迎客厅的醒目书架上放的一个碑














