给大家强烈推荐一篇Jeff Dean的访谈,内容非常干货,对未来几年AI的发展有着前瞻指导意义。
Jeff Dean是何许人也?他是Google的技术奠基人,你所熟知的TPU、TensorFlow、MapReduce、Gemini都是他的作品。
而就在昨天,Jeff Dean决定离开待了27年的Google,创办AI创业公司Discovery Loop。

图:好友近日和Jeff Dean的合影
这家公司的名称是最大的剧透:AI下一个核心范式是递归与自动化。
(1)任何可以明确度量的问题,都将很快取得巨大进展
我认为到 2027 年,你会看到 ML 系统本身被大量自动化。
我们可以让系统通过跑大量实验来不断提升自己的能力。
AI会自动把问题拆成子问题,每个子问题放进一个快速的自动实验循环里,再把结果拼起来,最后产出一个改进过的系统,整个过程无需人类深度干预。
这种范式不只适用于 ML,也适用于其他科学与工程领域。
基本上只要一个任务的目标是可度量的,就会在这两年取得很大进展。
评:这个观点和Jason Wei的Asymmetry of Verification观点一致:凡可测量者,皆可攻克。

最大的非共识是人们还没意识到Agent能自主运行跑多久。
不是一两个小时,在某些问题域、底层模型足够强的情况下,它们可以跑几天甚至几周,完成非常复杂的任务。
少数人开始看到端倪,但绝大多数人还没真正内化,这会是件大事。
评:市场低估了AI应用的上限,Token的消耗不应该按Session来计算,要想象一个“推理速度是现在的100倍 & AI自主持久化运行”的未来。

未来会出现越来越多高性能、低能耗的推理硬件。
因为大家现在意识到,随着Agent的发展与普及,推理的延迟变得越来越重要。
对硬件进行定制是让能效变高 & 延迟降低的关键手段。
想想如果大模型推理延迟降低 50 倍,AI应用会呈现怎样的形态。
从第一性原理来看这个问题,一次乘法约 1 皮焦,而搬数据要一千倍。
这个一千倍的差距塑造了我们在机器学习里做的很多事的底层逻辑。
正是因为有这个能量差距,你才必须一次凑很多样本或很多 token,把数据搬运的代价摊薄,这就是batching。
相反的,如果你要降低延迟,batching 恰恰很糟糕。
为了降低推理延迟,你要在硬件性能层面做出取舍。
比如不要支持很多种计算精度,如果你对需要什么精度已有明确答案,就把它硬化进硬件,别的都不做。
评:训练要吞吐、推理要延迟,两者对 batching 的诉求相反,这就是高性能推理硬件背后的朴素逻辑。

Agent在长程推理中脱轨的常见原因是模型在做它经验不多的事。
一旦稍微偏离它熟悉的分布,性能就会像所有ML模型一样开始退化,偏得越远越不行。
解决办法有两类:
一是用Skill和提示词来把它拉回那条“灯光明亮的路”。
二是搞多 agent 系统,让多个 agent 试不同路径,再用另一个 agent 评估哪条有希望,留下有希望的、丢掉跑偏的。
这就是用推理时算力在解空间里做搜索,能显著提升长流程的性能和可靠性。
评:假定模型性能不变,有两个方法来做loop:要么通过skill来收窄分布,要么通过多 agent 进行空间搜索。

第一,挑真正让你兴奋、并且认为对世界有用的事。
第二,测一测现在的通用模型在这个问题上表现如何。你得判断你做的事是耐久的,还是6 到 12 个月内会被大模型吞噬。
基于以上原则,Jeff Dean给出了两条具体路径,构建创业团队的独特优势:
一是让你的产品能拿到通用模型拿不到的数据。
二是像 AlphaFold 那样,用对的训练数据训一个专用模型,也许算力不多但极其准确。
材料科学、芯片设计这类领域可能都成立。
评:AI创业者的核心要义是让大模型能力成为自身战略的助推器,怎么吃到beta是一门学问,“顺势而为”四个字的含金量还在提升。

真正稀缺的永远是品味(Taste)。
品味的本质是high level wisdom of what to work on。
选对问题并解决它,远好过优雅地完成一项相当无聊的研究。
这种高层智慧我认为模型不会特别擅长,所以会是人在驾驭大量 AI 辅助的计算。
评:提出正确的问题,永远比忙着解决问题要更重要。

一个有效的方法是写一批你认为未来十二个月重要的事,你可能只做其中一件,但十二个月后回头评估:哪些真的重要?哪些别人做出来了?哪些还没人做?
这能给你自己的品味积累很多样本。
还有一招是做疯狂的思想实验。
六十年来芯片业假定同一设计的每颗芯片都应当一模一样、比特不该翻转。
可在宏观尺度我们并不这样假设,比如我们用不可靠的硬件搭建出了可靠的大规模分布式系统。
那么,如果你试着用每天出 20 次错、而不是百万年才犯一次错的晶体管来重建整个现代IT工业,会发生什么?
这会带来全新的思考问题方式,比如信号信号可能要走多条冗余路径。
偶尔质疑假设是很有价值的,这种疯狂的思想实验是培养品味的绝佳方法。

评:对于获取insight而言,napkin math比excel modeling有用得多,或者说,“模糊的正确”>>“精确的错误”。
科学研究的基础是:你提出一个实验,运行实验,评估实验,然后得到结果。
现在越来越多的问题可以做到不只跑几个实验,而是同时跑非常非常多的实验,因为你能把这个循环自动化,并把循环的延迟压到极低。
这会让我们能攻克科学、工程、机器学习乃至模型设计本身的大量问题域,也包括芯片设计这类工程任务。
更进一步,如果你有一个编排框架,能接受非常高层的目标,把它拆成子问题,每个子问题就是一个自动循环、在里面探索解决该子问题的最佳方式,再由编排框架把各个子解拼装成上层问题的整体解,那会非常有影响力。
它将大幅加速机器学习、以及所有科学及工程问题的突破。
评:Jeff的这段思考很核心,是RSI(Recursive Self-Improvement)理念的具象化。我认为不要只把AI当做一种工具,AI更像一个新物种或者新国家,人类正在把越来越多的工作外包给他们。随着AI能力的提升,这个新物种会逐渐开始迭代自身科技树,未来10几年我们大概率会迎来科技大爆炸的时代。

为了加快Agent的迭代效率,你的评估器需要被大幅加速。
十年前我同事做量子化学的时候,跑密度泛函理论模拟器判断一个分子的性质,要算一整个晚上。
他们把大量模拟的输入配置和输出拿来训练一个神经网络模型,做出了一个快 30 万倍、精度几乎不减的验证装置。
这彻底改变了做科学的方式,假设你有一千万个候选要筛,现在午饭时间就能跑完,而不是一个六个月的工程。
评:Jeff Dean 的整场访谈,从头到尾其实只有一条线:把“提出假设->实现->验证”的循环自动化并把延迟压到极低,任何有可度量目标的领域都会被重写。
