硬氪首发 | 99年同济副教授、前大疆骨干创业世界模型,成立不到一月融资数千万
12 小时前 / 阅读约9分钟
来源:36kr
WorldMind获天使轮融资,聚焦具身智能与世界模型交叉融合。提出“小世界”概念,通过具体场景积累知识,形成更大世界模型基座。自主研发两项核心技术,位列评测榜单前列。

硬氪获悉,世界模型企业「WorldMind」(寰宇心生)近日完成数千万元天使轮融资。资方为元生资本,此次融资将主要用于团队建设和扩张,以及基础设施和基础模型训练。点石资本担任公司独家财务顾问。

WorldMind成立于2026年9月,核心团队聚焦具身智能、世界模型与脑科学的交叉融合。创始人兼CEO任云帆出生于1999年,曾任大疆算法预研骨干,博士毕业于香港大学MaRS Lab,后赴苏黎世大学RPG开展博士后研究。26岁入选国家级青年人才,现任同济大学博导、长聘副教授。

CTO张奇为悉尼科技大学人工智能博士、国家级青年人才,担任科技部“脑科学与类脑智能”重大专项青年科学家,长期聚焦脑视觉解码与类脑智能研究,首创脑视觉编解码Mind-X系列方法。团队另有多位海内外名校毕业博士,长期从事世界模型、具身智能、多模态大模型相关研究,在世界模型领域拥有深厚技术积累。

过去两年,世界模型逐渐成为具身智能领域最热的关键词之一。行业正在面对一个比“让机器人会做动作”更基础的问题:机器究竟该如何理解真实世界。语言模型的Scaling Law已经证明,只要不断增加数据、算力和模型规模,能力可以持续涌现。但现实世界并不是一套可以无限抓取的互联网文本。它连续、多模态、开放,而且永远存在新的物体、新的场景和新的变化。

WorldMind的判断是,世界模型真正需要寻找的,可能并不是一条简单复制语言模型的Scaling路径。采访中,创始人任云帆表示,他们还没有看到世界模型的Scaling Law被真正验证。于是他换了一个问题,机器人真的需要理解整个世界吗?

任云帆认为,答案是否定的。一个厨房机器人首先需要理解的可能只有十几平米的厨房。WorldMind把这种有限、具体、与智能体直接相关的环境称为“小世界”,背后借用的是Jakob von Uexküll提出的“环世界”概念。这也把一个无法穷举的问题变成了可以训练、可以部署、也可以获得真实反馈的问题。

“但小世界不是孤岛”,任云帆强调,家庭里的接触和摩擦,可能在工厂、仓储场景里以另一种形式出现。于是,一个场景解决的问题,不只是为了场景本身,而是在为一个更大的世界模型积累知识,WorldMind希望先在家庭、工厂、仓储、户外等具体场景中建立一个个可验证的模型,再把不同小世界中共同存在的物理规律提取出来,逐渐形成更大的世界模型基座。

这也是他们对“Scaling”的另一种理解,Scaling并不一定意味着从一开始就拥有海量数据,而可以从一个足够好的小世界起步。任云帆认为,如果先把一个具体行业问题解决到足够高的水平,相当于找到一个很好的Scaling起点,那么未来随着场景增加、数据增加、行业扩展,模型才有可能真正沿着一条曲线向上生长。

基于这样的认识,WorldMind把世界模型分为四个部分,知识、记忆、推演、校准。知识对应相对稳定的客观规律,比如牛顿力学、流体、材料、光照。记忆则更像智能体自己的经历,记录最近发生了什么、物体如何运动、机器人刚刚做过什么。

在传统直觉里,一个模型如果要同时面对越来越多的任务,似乎就必须越来越大。但WorldMind认为,真正需要不断增长的是对世界的知识,而不是负责理解“下一步会发生什么”的神经推演模块。“就像传统物理引擎一样,无论机器人是在预测一辆车下一秒的位置,还是判断一个瓶子被推了一下之后会怎么运动,底层都可以归结为动力学和运动学问题。”除此之外,模型还需要不断接受真实世界的反馈,用新的数据修正自己的预测。

目前,WorldMind已自主研发记忆增强世界模型与脑启发世界动作模型两项核心技术。其中记忆增强世界模型,首次将快慢系统机制引入世界模型的训练与推理过程,通过动态记忆机制与时空双流引导机制,实现高保真环境建模,并显著提升真机数据利用效率,降低世界模型训练成本。相关模型在权威世界模型评测基准WorldArena1.0开源榜单中位列第一,并在最新发布的WorldArena2.0多个评测赛道中稳居前三。

后者则通过引入大脑输出拷贝机制与自我中心4D世界知识架构,构建了“世界推演-空间规划-动作生成”的分层联合架构与统一混合专家模型,位列世界动作模型全球榜仿真开源第一。再往现实里走,则是无人机等真机上的世界模型在线自校准,让模型和策略在真实世界中同步学习,持续进化。

因此,他们现在做的产品,并不是一个单纯意义上的“机器人模型”,而是从世界预测到动作执行,再到真实世界反馈的完整链条。

以下是与WorldMind创始人任云帆的访谈节选:

硬氪:你们强调从小世界做起,不同小世界之间具体是怎么实现共享的?

任云帆:我们认为每一个小世界中存在的长尾问题,本质上往往是统一物理规律在这个场景中的一种投影。

比如家庭服务机器人可能只能通过家庭场景的数据覆盖80%的情况,剩下20%的长尾问题可能涉及接触力学、摩擦等物理规律。但这些规律在工厂、仓储或者其他场景中可能是更常见的数据分布。我们可以从其他场景中学习这些物理规律,再用它们补足家庭场景中的长尾问题。

所以,小世界不是孤岛。各个小世界能够共同维护一个共享的大世界模型基模,而大的世界模型又可以把更加完整的模型和物理规律蒸馏给每一个下游的小世界,形成上下行的数据和知识交互。

硬氪:你们的世界模型架构和其他世界模型最大的区别是什么?

任云帆:标准的世界模型通常是根据当前状态和即将采取的动作,预测下一个状态。我们的模型会把知识和记忆从状态中单独拿出来。也就是说,我们对下一时刻的预测,不仅取决于当前状态,还取决于模型对世界的认知,也就是世界知识,以及刚刚执行过的任务和历史记忆。

这样分解之后,一个好处是模型学习到的物理规律不再隐式地纠缠在状态空间中,而是具有相对明确的物理意义。我们可以显式维护知识和记忆,更好地进行知识共享和记忆提取,也能够用更小的模型在某一个垂域取得更好的效果。

硬氪:你们最初希望从哪些场景实现落地?

任云帆:前期从实用和公司发展的角度,我们可能会挑一些“硬骨头”,比如目前比较难解决的家庭服务场景,以及多元性很强的厨房场景。一方面可以展示公司的研发实力,另一方面也希望真正实现落地。

具体的落地方向,则取决于我们目前正在沟通的几个行业共创伙伴,大致会包括一些行业场景、工业场景以及To B的厂房、产线等。这些场景的设备往往非常非标,我们希望用一套统一的模型让机器人完成不同场景下的任务,并且能预测场景的变化。比如工地场景,世界模型可以有两个用途。第一是作为机器人的训练场,为挖掘机等"大具身"设备提供训练能力,也可以用于VLA数据采集或者强化学习,解决目前具身智能还没有解决的一些问题;第二是预测整个工地的变化,比如混凝土干燥、天气对场景的影响等,从而帮助进行工期或者设计规划。

我们希望先定义好一两个封闭场景,寻找行业共创伙伴,在真实场景中把数据采集、模型训练、实际应用和数据回流整个闭环跑起来。这是我们比较踏实、也比较关注的落地方向。

硬氪:目前落地最大的工程挑战是什么?

任云帆:这个问题肯定是难的,否则也不会到现在还没有一个通用的解决方案。但我们解决问题的方法,是把事情Narrow Down,不去试图一次解决整个行业的问题,而是先把一个具体场景和任务完整做好,把数据回流体系建立起来。

目前我们已经在实验室桌面这种比较可控的场景做了一些验证。下一步进入真实场景后,一定会遇到各种Corner Case。To B场景整体相对可控,但会比实验室复杂很多。真正需要工程能力的是,如何把知识、记忆和数据回流整个Pipeline跑通。算法方面我们非常有信心,但工程方面还需要投入更多时间和精力。

只要把环境定义得足够Compact,把场景定义得足够封闭,这件事情的上下限其实都很清楚。Worst Case是在一个任务中完成环境推演和动作执行,这一点现在的方法已经可以做到。我们真正想探索和突破的是上限,也就是这个世界能够从一张桌子、一条产线逐渐扩大到整个工厂。

所以我们不会怀疑整套Pipeline能不能落地。只要场景定义得足够清晰,一条产线或者一个任务做到比较好的效果是可以实现的。我们真正关心的是它能不能从小到大实现更好的泛化。