
过去几年,大语言模型推动人工智能完成了一次重要跃迁。
过去几年,大语言模型推动人工智能完成了一次重要跃迁。
机器从理解和生成文本,逐步走向深度推理、工具调用和自主执行。但当 AI 进一步进入视频、游戏、机器人和自动驾驶等动态场景,仅仅理解语言已经不够。
现实世界不是由文字组成的静态知识库,而是一个持续变化的复杂系统。智能体不仅需要识别「正在发生什么」,还要预测「接下来会发生什么」,判断「某个行动会带来什么结果」,并根据环境反馈不断调整决策。
从理解语言到理解世界,正在成为人工智能下一阶段的重要能力跃迁。
7 月 19 日,WAIC 2026 启明创投·创业与投资论坛正式举行。作为大会期间聚焦科技创业与产业投资的重磅论坛,本次活动汇聚顶尖学者、领军创业者及投资机构代表,从创新创业视角出发,共同探讨 AI 如何从算力基础设施与底层技术创新,走向真实场景落地,并形成规模化、可持续的产业价值。
生数科技联合创始人、首席执行官骆怡航以「通用世界模型:打通虚实边界,筑基物理智能」为主题,分享了生数科技对通用世界模型的长期判断与技术实践。

世界模型:让 AI 从解读信息,走向参与真实世界
世界模型并不是一个全新的概念,但随着视频生成、多模态模型和具身智能快速发展,它正在从学术研究走向产业中心。在骆怡航看来,语言模型主要处理人与语言、知识和信息之间的关系,而世界模型面向的,是智能体与整个世界的交互。
他指出,人类智能并不只体现在语言处理上,人脑中大量区域都在参与视觉感知、行动规划和决策。这种智能的核心,是对物理世界的感知,以及基于环境变化作出动作决策。
「如果只依靠大语言模型理解世界,相当于只使用了人类智能中很小的一部分。大模型时代,还需要一个达到 LLM 范式级别的世界模型。」
视频模型需要理解人物和物体如何运动,机器人需要预测一个动作可能产生的结果,自动驾驶系统则需要在复杂环境中持续感知和实时决策。不同场景背后,依赖的是相似的底层能力:感知环境、预测变化并采取行动。
因此,世界模型并不等同于视频生成、三维重建或机器人控制中的某一项单点技术。一个完整的世界模型,需要形成持续运行的动态闭环。
感知、预测和行动不是三个彼此割裂的模块,而应当建立在统一的世界表征之上。模型不仅要知道世界是什么样,还要理解世界如何变化,以及行动如何改变世界。
走向通用化:世界模型规模化落地的必经之路
当前,不少世界模型仍围绕家庭机器人、工业操作、自动驾驶等特定场景构建。但如果一种机器人、一个场景就需要训练一套模型,数据采集、训练和部署成本将难以规模化。
大语言模型带给行业的重要启示,是先通过大规模预训练建立通用能力,再迁移到不同任务和场景。世界模型也需要经历类似的演进。
它需要从海量视觉和交互数据中学习空间结构、运动规律、因果关系和行动逻辑,再将这些能力迁移到不同数字内容、机器人本体和现实任务中。
「世界模型不仅要形成感知、预测与行动的闭环,还要像语言模型一样,足够通用、足够泛化。」

不同智能体可以拥有不同形态,数字世界与物理世界也有不同的输出方式,但驱动它们运行的底层智能,应当是统一的。世界模型真正的竞争,不只是谁能在单项任务中取得更高成功率,更在于谁能建立具有规模效应、迁移能力和智能涌现潜力的通用基础模型。
视频,正在成为理解世界的重要入口
构建世界模型,首先需要让 AI 看到并理解世界。文字是对现实的抽象表达,图像呈现的是某一时刻的状态,而视频则连续记录了世界如何发生变化。人物如何行动、物体如何受力、空间如何变化、一个行为如何引发后续结果,这些信息都蕴含在连续画面之中。
当视频模型预测下一帧画面时,它学习的不只是像素生成,也是在学习世界状态之间的转换关系。因此,视频模型的价值正在超越内容生产本身。它对时空结构、运动规律和物理一致性的建模能力,也在成为世界模型的重要基础。

在此基础上,世界模型还需要进一步吸收仿真数据、第一人称数据、人类操作数据和机器人真机数据,将对世界的理解转化为真实行动。生数科技由此构建统一的通用世界模型基座:先建立对世界的理解和预测能力,再面向数字与物理两个空间进行不同解码。
一体两翼:同一通用基座,驱动数字生成与物理行动
围绕统一的世界模型基座,生数科技形成了覆盖世界生成、实时交互和世界行动的产品体系。

Vidu Q 系列面向数字内容生成,持续提升模型对人物、场景、运动和物理规律的理解与预测能力,并增加内容创意和想象演绎能力;Vidu S 系列推动视频从离线生成走向实时、连续交互,解锁人在物理空间与数字内容进行实时互动的场景,比如陪伴、互动、游戏等;Motubrain 则面向物理世界,将模型对环境和任务的理解转化为机器人动作,实现物理世界中的实时交互。
三条产品路线面向不同场景,但背后共享的是对时空、因果和行动的统一建模能力。这也意味着,视频生成和具身智能并不是两条彼此独立的技术路线。
「数字世界和物理世界的 Agent 可以千差万别,但它们背后的智能应该是通用的、泛化的、统一的。」
在数字世界,世界模型可以推动视频、游戏和虚拟角色从静态内容,走向实时、连续、可交互的动态环境;在物理世界,它则可以推动机器人摆脱固定指令和预设流程,升级为能够理解目标、自主规划,并适应环境变化的智能体。
无论是虚拟角色、游戏智能体和内容 Agent,还是现实环境中的机器人,都需要理解所处环境、持续更新状态,并根据反馈作出决策。区别在于,前者将这种认知转化为内容生成与实时交互,后者则进一步将其转化为对行动结果的预测和可执行的物理动作。
它们最终指向的是同一个核心问题:机器如何建立对世界的认知,并基于这种认知完成生成、交互与行动。

从生成世界,到行动于世界
大语言模型让机器开始理解和使用语言,视频生成模型让机器具备视觉创作能力,而通用世界模型所要推动的,是让机器进一步理解世界、预测世界并行动于世界。
在骆怡航看来,未来不同形态的机器人,都将成为物理世界中的 Agent,像数字世界中的 Agent 一样实现自主规划与执行。而实现这一目标,真正的破局点仍然是模型。
「通用世界模型是物理智能最具潜力的技术路径。未来,数字世界和物理世界的 Agent 会是多样化的,但它们背后的智能是通用的——像人一样交流,像人一样创意,也像人一样行动。」
从处理信息,到理解变化;从生成内容,到作出行动,人工智能正在进入一个新的发展阶段。而通用世界模型,正是连接数字智能与物理智能、推动 AI 真正进入现实世界的关键基础设施。
来源:互联网



