36氪专访丨华为诺亚生成式大模型负责人创业家庭具身,一年融了超10亿
15 小时前 / 阅读约19分钟
来源:36kr
诺因智能完成数亿元天使+++轮融资,开发GLOW生成式具身大模型架构,推出消费级家庭机器人KNOWIN-X1,采用全折叠双臂构型,旨在解决机器人家庭场景的适应性和成本问题。

图源/企业

本文约6900字,建议阅读17分钟

作者丨欧雪

编辑丨袁斯来

在华为系具身赛道创业公司中,诺因智能算是融资较为顺利的一家。

硬氪获悉,这家成立于2025年8月的公司,近日宣布完成单笔数亿元人民币天使+++轮融资。本轮融资由京东相关基金领投,正心谷资本、南山战新投和华登投资跟投。距离上一轮5亿元融资,仅过去一个多月。

创立诺因智能前,李银川同时具有具身智能、大模型、自动驾驶三方面的研发和落地经验。25岁时,他从北理工和哥大联培博士毕业后加入华为,27岁担任诺亚方舟实验室生成式大模型方向负责人。30岁那年,他离职成立诺因智能。在他看来,家庭机器人是将大模型能力转化为实际产品的重要机会。

2025年春晚后,具身智能受到资本市场的广泛关注。机器人叠衣服、倒咖啡、收拾桌子的视频也频繁出现在公众视野中,让外界看到了机器人进入家庭的可能。不过,从演示走向日常使用,还需要面临更复杂的场景:换一个房间、换一套杯碟、换一种家务,机器人能否依然稳定完成任务?

这正是诺因智能希望解决的问题。李银川回忆,创业之初,行业更多关注工业场景和模仿学习,而他选择了一条以泛化能力为核心、面向家庭场景的技术路线。在他看来,机器人进入家庭,需要同时解决适应性和成本问题:模型要能应对不同家庭中的任务,产品价格也要落在普通消费者可以接受的范围内。

为此,他们开发了技术底座GLOW,这是一套生成式具身大模型架构。它由多个模块协同,让机器人从“复现训练过的动作”,逐步走向“解决没有完整见过的任务”。数据上,诺因90%采用合成数据,整体成本可以降低10到100倍;训练上,世界模型无需生成完整视频画面,也能推演动作后果;执行上,模型单次推理可以输出完整动作序列,降低调用频率。

同时,诺因智能推出首款消费级家庭具身机器人KNOWIN-X1。它采用全折叠双臂构型,折叠后高度控制在40厘米以内,可以适配桌面、地面、沙发、洗衣机等家庭空间。

KNOWIN-X1(图源/企业)

当然,这些产品离大规模落地还有相当距离。而资本持续注入,其中一部分原因是诺因智能的人才密度。公司在不到一年内扩至200人以上。其中,算法团队博士及以上学历人才占比超过三分之二,半数成员毕业于QS世界大学排名前30的院校,其中,算法团队博士及以上学历人才占比超过三分之二,半数成员毕业于QS世界大学排名前30的院校。团队已汇聚多位华为“天才少年”。

对于行业前景,李银川仍持乐观态度。他认为,整个赛道近期可能会有所波动,但远没到泡沫彻底破灭的阶段,关键还是要看具身大模型何时出现能力涌现。

对于这一点,业内仍未达成共识。有人认为,机器人行业不会出现类似“ChatGPT时刻”的节点,但李银川认为,智能涌现只是时间问题。

“如果具身模型有一天真正出现能力涌现,机器人的商业价值毫无疑问会远超大语言模型,我认为可能是其10倍以上。”他告诉硬氪。

我们和李银川聊了聊创业以来的思考,以及他对家庭具身智能的观察。以下是硬氪与诺因智能创始人李银川的对话。

从华为出来创业

硬氪:当初决定从华为诺亚出来创业时,你是怎么想的?决定性因素是什么?

李银川:我出来创业,主要是想做一个全球最泛化的具身大模型,真正孵化出商业价值,所以选择了To C具身智能。在华为诺亚时,我觉得如果回去做To B、To G,对具身大模型研发的支持力度会比较有限。华为的战略还是把昇腾做好,做好“黑土地”,让大家都用昇腾,而不是把所有上层应用都自己做。所以我更希望出来做家庭机器人。

硬氪:你当时就想好了要做家庭方向吗?当时是怎么考虑的?

李银川:我当时应该算是国内比较早出来讲家庭机器人的人之一。我有两个非共识。

第一,2025年上半年,大家普遍认为具身智能就是操作、模仿学习、进工厂,这是当时的共识。但我当时就在讲,我们要做能够泛化的技术路线,真正做出可泛化的具身模型,而不是过拟合。只有具备泛化能力,才有机会进入To C家庭场景。这是我们在技术路线选择上的第一个非共识。

第二,在了解了当时市场上的机器人售价后,我们有信心通过新的垂直整合方式,把机器人成本降下来。成本降下来,To C才有机会。不能一台机器人卖几十万元,那普通消费者根本买不起。

因为这两个非共识,我觉得这件事有机会,所以决定出来做。

硬氪:你说有信心把成本降下来,具体的判断依据是什么?

李银川:比如具身数据成本,我们测算过,并不是所有数据都需要通过真机操作采集,这一点现在已经逐渐成为行业共识。我们90%使用合成数据,整体成本可以降低10到100倍。

数据成本降下来之后,就是机器人本体。我们核心团队充分交流后认为,通过完整自研,而不是采购别人的零部件进行组装,同样可以把成本做得比较低。

硬氪:你们一直强调模型的泛化能力。但现在家庭机器人的基础能力还没有特别强,这个阶段强调泛化,会不会有些早?

李银川:家庭机器人现在交互能力不强,很重要的原因就是它不够泛化,所以我们才更需要做泛化模型。目前行业里很多架构并没有真正朝泛化去做,而是在比谁能把单点任务做到更好。

大部分具身公司都在发布很酷炫的Demo,但对真正落地考虑得还不够。现在的家庭机器人有点像早期自动驾驶,做出一段特定道路上的效果,就觉得L4、L5时代马上要来了,但实际上中间还有很长的路。

让家庭机器人真正落地,核心是把基础能力做到足够通用。机器人进家最难的,不是完成一次精巧的演示,而是在不同家庭里都能稳定把活干完。这件事最难,所以我们才强调要做最泛化的大模型。

硬氪:那你觉得现在具身智能行业的真实发展水位在哪里?

李银川:整个赛道其实还好。具身大模型还没有到能力涌现的时刻,但一些头部学者判断这个时间不会特别远,有人觉得是一两年,也有人觉得是三五年。

等真正出现能力涌现的时候,我认为机器人赛道的商业价值会比大语言模型更有想象力。现在大语言模型公司的估值普遍比具身公司高一个数量级,平均来看差10倍没有太大问题。它们现在的盈利也没有那么高,只是大家已经看到能力涌现之后比较明确的增长空间。

但如果具身模型有一天真正出现能力涌现,机器人的商业价值毫无疑问会远超大语言模型,我认为可能是其10倍以上。所以回头看,如果具身模型真正涌现,具身公司的估值可能还有非常大的增长空间。

整个赛道近期可能会有波动,但我觉得远没到泡沫彻底破灭的阶段,关键还是看具身大模型什么时候出现能力涌现。

硬氪:为什么你觉得现在整个行业的进展还不够快?

李银川:我觉得现在大部分具身公司,包括整个行业,还不够聚焦。大家一直沿着比酷炫Demo的方向发展,只会把市场预期拉得越来越高,但离真正交付越来越远。

如果行业能更聚焦真正有价值的场景,认真做数据,把数据量做上来,把数据成本降下来,整个行业的发展会顺利很多。

硬氪:这是不是因为大家都觉得,真正落地还很远?

李银川:对,所以这样发展下去,会导致整个行业变得不太健康。

硬氪:现在市场对具身智能的投资逻辑有没有发生变化?投资人会越来越看重什么?

李银川:我觉得很快会发生变化。此前行业处于概念验证和高预期阶段,资本更看重技术前景;但随着产品逐渐走向真实场景,市场逻辑自然会回归本质。

所以未来投资人不会再简单为团队背景买单,而会更看重企业能否真正落地到场景中,并形成可持续的商业闭环和造血能力。

硬氪:具身智能的发展很像在重复自动驾驶的故事。你觉得未来也会走类似的路径吗?

李银川:肯定会有很多相似的地方。自动驾驶公司很多,有坚持做L3的,也有一开始就要做L4的,后来确实出现了很明显的分化。具身公司也会一样。

有些自动驾驶公司一开始就定位做L4、甚至L5,我并不看好。我觉得真正商业价值最大的,反而是早期定位做L3、一步一个脚印往前走的企业。这对我们来说,也有很多可以借鉴的地方。

硬氪:你们是怎么划分机器人智能等级的?

李银川:我们之前定义过L1到L5的智能能力标准。L1更像玩具、遥控和DIY产品,有可玩的商业价值;L2可以完成基础家务,但还是有限、固定场景,比如在固定环境中完成单一任务;L3能够在一个家庭里完成较长链条的任务闭环,人可以处于待命接管状态,让机器人长时间自动运行,把整理、清洁、洗衣等任务做到比较高的成功率,想象空间可以对标一个基础的家庭助手。L4可以进一步对标保姆的大部分能力,L5则是机器人具备更加通用的能力,甚至可以完成很多原本需要人来完成的工作,这就更加遥远。

但机器人并不需要发展到L4、L5,才能产生商业价值。我们重点希望先把L3的商业价值打穿,同时持续向L4探索,验证模型的泛化能力。但现阶段过早孵化L4的商业价值,还是比较困难的。

硬氪:L4的想象空间主要在哪里?

李银川:如果真正做到L4,可能需要充分对标一个保姆的大部分能力。

但实际上,大部分消费者买机器人时,对机器人的期待并不会像对保姆一样高。如果售价不贵,能够稳定帮忙做一些家务,已经可以产生很大价值。

比如扫地机器人,大家的期待其实很明确,它能把地扫干净就可以了,但一样形成了很大的市场。如果机器人能够把很多家务做好,商业价值就已经可以孵化出来。

同时,家庭场景中的能力还可以向外辐射到一些半To C场景,比如迎宾、递水、陪伴,以及其他商业场景,并不一定需要完整达到保姆的能力。

而如果真的要像保姆一样收拾家庭,对速度、成功率,甚至做饭等能力,要求就会高很多。

硬氪:如果先做专用或特定场景,再逐步走向泛化,这条路径会不会更现实?

李银川:从技术路线来看,做专用能力对做泛化能力的帮助其实不大,两者的技术差异非常大。

有些公司可能先做专用模型,把商业价值跑通,赚到钱之后再去孵化泛化模型。从商业路径上看,这当然可以理解,就是先做简单的事情赚钱,再做复杂的事情。但从技术路线演进来看,我觉得它并不是一条自然的路径。

做过拟合的系统和做大模型,本质上是两件事。语言模型十年前就能写诗,很小的LSTM也可以写古诗、背诵内容,但真正到今天的大模型才产生巨大的商业价值。原因是它具备了更强的推理能力,能够理解人的意图,也足够泛化,生产力才真正被释放出来。

具身智能也是一样。如果大家一直拼命做过拟合场景,把所有工程师都投入到单点任务的工程交付里,这些能力不会自然沉淀到通用模型底座里。从技术路线来看,它对最终的泛化模型帮助并不大,只能说可以提前产生一些收入。

硬氪:那诺因怎么在坚持泛化路线的同时,解决商业化和收入问题?

李银川:这也是我们正在持续解决的问题。我们已经找到了一些方法,在坚持泛化大模型长期目标的同时,沿途不断找到商业价值。

并不是一定要卷过拟合场景才能赚钱。同样是在消费级、To C的很多场景里,只要能力做得足够泛化,就会有很多场景可以适配我们的机器人,我们也可以找到中间的盈利点。

只要商业模式能够跑通,我们还是会坚持走最泛化的技术路线。

硬氪:你说的中间盈利点,可以具体举个例子吗?

李银川:比如我们现在主要在做整理、清洁、洗衣这样的家务机器人,同时也可以寻找这些能力在其他场景中的应用。

硬氪:具身智能距离真正大规模商业化,还需要跨过哪些关键难关?

李银川:现在只能说,我们已经把这条路线的可行性初步跑通了。比如数据降本、本体降本,以及模型泛化能力,都得到了一些验证。

但真正做到量产,以及达到非常高的作业成功率和商业化标准,都还需要持续攻坚。

更务实的世界模型

硬氪:业内对合成数据一直存在一些质疑,你们怎么看?

李银川:合成数据关键还是看怎么用。首先,生成的数据质量够不够高;其次,数据有没有真实标签,标签够不够准确,这些都是挑战。

如果这些问题能够解决,我们对基础家务场景做过测算,合成数据的能力是足够覆盖的。

硬氪:用合成数据训练出来的模型,和真实家庭环境之间会不会存在较大差距?

李银川:主要还是看生成引擎和模型架构本身。我们生成的场景和真实家庭已经比较接近,不是传统意义上那种纯仿真数据。更重要的是,不同模型路线对Sim-to-Real的敏感程度并不一样。传统模仿学习更强调拟合人类真实操作轨迹,如果仿真中的动作轨迹、接触和动力学与真实世界存在偏差,模型就容易把这些偏差一起学进去。

我们的路线不是简单复现一条真实轨迹,而是通过统一的自回归模型,把视觉、语言、空间关系和动作统一建模,让模型先理解当前世界状态、任务目标和动作结果,再生成新的动作。因此,合成数据更重要的是提供准确的空间关系、物体状态、动作结果和训练标签,而不是要求每一条轨迹都和真人操作完全一致。最后再通过少量真实数据和真机执行反馈持续对齐,进一步缩小Sim-to-Real的差距。

硬氪:后续会考虑自己采集真实数据吗?

李银川:会考虑,我们现在也在自己采集一些数据,包括Ego-Centric第一人称视角数据等。但比例比较小,我们没有大规模去做需要真人操作的真机数据采集。

硬氪:在诺因的GLOW架构里,你认为哪些能力尤其重要?

李银川:我们在GLOW里面,比较早地把一整套世界模型和具身大模型框架梳理清楚,并完整地组合起来使用。大致可以分成三类。

第一类,是以前做视频生成的公司或者学者在做的世界模型,通过视频生成去生成真实世界。在我们这里对应KnowinDream。我们没有把它直接叫世界模型,而是叫生成式具身数据引擎,本质上是一套合成数据引擎,用来生成大量Ego-Centric 3D数据。

第二类,是从仿真路线发展过来的技术,更强调对世界进行可交互建模。我们叫KnowinWorld。机器人可以在里面对推理后的动作提前进行尝试,并基于尝试结果自主演进、修正动作参数,它是一套可交互3D世界模型。

第三类,是通过隐空间学习方法,让模型学习物理关系和世界因果。在最新的GLOW架构里,我们把原来的Brain和Act能力统一到了KnowinGLOW中,用同一个多模态自回归模型完成视觉理解、空间推理、任务规划和动作生成,理解和行动在统一表征下端到端学习。

这三类能力,再加上外围的记忆、自主演进以及上层决策调度机制,几类能力融合在一起,才能构成机器人在家庭中的完整闭环。

所以我们不会刻意强调某一个模块是不是“完整的世界模型”,我们更强调的是,怎么把家庭具身大模型真正做到足够泛化,这是一条比较务实的路线。

硬氪:GLOW强调从训练、执行到反馈形成闭环,并持续自我进化,这一过程具体是怎么实现的?

李银川:比如在世界模型里,我需要让机器人把一个水瓶摆正。大模型早期用了一些训练数据,其中90%是合成数据。如果某些标签还不够准确,最终生成的动作轨迹就可能存在偏差,水瓶可能没有完全摆垂直,而是有一定倾斜。

碰到这种情况,我们可以在交互引擎里对最终结果进行打分,再根据结果对参数进行调整。

其次,在世界模型里纠正一遍以后,我们还会进行真机测试。真机产生的正负样本数据会继续回流到底座,通过RL等方式进行强化学习和对齐,帮助模型进一步调整参数。

整个过程有点类似现在大模型做代码。早期做Code模型时,需要很多人去调数据;现在模型可以自己推演、自己探索,通过编译器观察代码执行结果,再根据结果打分,反过来推动模型内部能力对齐。

我们希望在机器人领域建立的,也是一整套类似的自主演进体系。进一步说,就是让真实执行反馈回流到数据生成和训练链路,形成“模型变强—数据变好—下一代模型更强”的RSI递归自我改进闭环。

硬氪:KnowinWorld和传统物理模拟器,是完全不同的技术路线,还是本质上比较接近?

李银川:我觉得它和物理仿真器的技术路线还是比较接近的。

早期的物理模拟器、仿真器其实就已经具备很强的可交互性,但覆盖度、真实感等方面存在比较大的问题,所以后来大家不太愿意强调这条路线。

现在随着技术升级,数据量更多了,引擎生成的数据更逼真,渲染效果更好,物理建模也更加完善,所以大家开始把这类技术叫世界模型。

从我的理解来看,它也可以看作是从传统物理引擎逐步演进而来的升级版技术。

硬氪:GLOW从执行、反馈再回到数据和训练,完成一次完整闭环迭代,大概需要多久?

李银川:内部做验证时,迭代其实非常快。

比如做一个新能力,先生成一批数据,专门合成之后交给KnowinGLOW训练,训练完成后再进行动作推理和对齐。整套流程走一遍,现在可能一两天就可以完成。

目前我们的数据量和模型规模还没有达到大语言模型那么夸张的量级,相对来说还是“小模型”,所以迭代速度很快。

未来随着数据量越来越大,我们希望把一次完整版本升级控制在一到两周左右。

硬氪:你们为什么选择折叠双臂构型?当时主要考虑了哪些家庭场景需求?

李银川:早期其实也不是现在这个设计,我们去年尝试过很多不同的形态。但有一个方向一直很明确:机器人如果要进家庭,一定要尽量往小做。

我们不希望家里放一个很大的“铁疙瘩”,不工作的时候还占地方,搬不动,也很碍事。所以我们希望机器人尽量小、圆润,不工作的时候可以折叠起来,让人不会觉得危险。收起来之后就是一个比较紧凑的方块,也不容易伤到人。

目前人形机器人在噪音、安全性等方面都还有一些问题,整个技术也没有完全成熟。所以我们现阶段选择先做底盘,稳定性更高,续航也比较好,而且更安静。

折叠这个想法其实很多人可能都想过,但真正实现起来难度还是挺高的。

硬氪:复杂到什么程度的任务,是现阶段机器人做不了的?

李银川:从技术架构上讲,其实很难简单说哪一类任务是“绝对做不了”的,更多还是要考虑真正落地的难度。

比如做饭,从架构上看当然可以做,但离真正落地还很远,因为里面要考虑的问题太多。就算机器人能做饭,还要考虑谁买菜、谁洗菜。如果用户需要提前把菜买回来、洗好、全部准备好,只让机器人完成最后一步做饭,其实也未必有很大的实际价值。

所以我们更关注的不是“理论上能不能做”,而是哪些能力能够真正稳定落地,并给用户创造价值。