罗福莉从语言模型研究走向小米大模型团队,她的公开访谈之所以值得关注,不只是因为履历,而是因为它呈现了一个一线研究者对 AI 范式变化的判断:模型正在从聊天工具走向能够执行复杂任务的系统,竞争重心也从单次回答转向长期工作能力。
从“会说”到“会做”
聊天模型的评价通常围绕回答质量,任务型系统则要面对更复杂的现实:它需要理解目标、规划步骤、调用工具、读取反馈,并在出错时修正。任何一个环节不可靠,最终结果都可能失败。
这意味着模型能力依然重要,但已经不是全部。上下文管理、工具接口、验证机制和数据闭环正在成为产品差异的一部分。模型团队需要与工程、产品和真实场景更紧密地协作。
Scaling 之外,效率重新成为主线
更大的训练规模带来过显著进步,但算力、数据和能耗不会无限增长。研究开始同时追求两件事:继续扩大有效计算,并让每一份计算产生更多能力。稀疏结构、数据质量、推理效率和长上下文因此变得重要。
效率不是简单地“把模型做小”。它要求团队理解能力来自哪里,哪些参数和数据真正有效,哪些成本只是沿用旧路径的惯性。对于需要部署在终端或高频服务中的模型,效率直接决定产品是否成立。
研究与产品之间不再有清晰高墙
过去,研究团队可以先追求榜单,再由产品团队寻找场景。进入 Agent 阶段后,真实任务中的失败会反过来定义研究问题:模型为什么丢失目标,为什么误用工具,为什么无法从长过程里识别关键状态。
因此,一流模型团队既要保留长期研究能力,也要建立快速接触用户反馈的通道。产品不是研究的下游包装,而是发现困难样本和系统瓶颈的实验场。
人才判断:好奇心比标签更长久
AI 领域变化很快,今天熟悉的框架可能在一年后被替换。真正可复利的能力,是持续阅读、提出问题、设计实验和承认错误。履历可以证明过去,面对未知问题时的学习速度才决定未来。
这也解释了为什么年轻研究者可以快速进入前沿:公开论文、代码和模型降低了获取知识的门槛。但门槛降低不等于训练消失。数学、系统、实验方法和清晰表达仍然决定一个人能否越过表面热词。
对普通产品团队的启发
- 不要只比较模型榜单,要用自己的真实任务评估完整系统;
- 把失败样本结构化,区分模型、工具、数据和流程问题;
- 先为高风险动作建立权限、确认和恢复机制,再增加自主性;
- 把成本按“完成一个可信任务”计算,而不只看 Token 单价。
AI 范式的变化,不只是模型回答得更聪明,而是系统开始承担更长、更真实、也更需要责任的工作。
从 DeepSeek 到小米,罗福莉所处的位置连接了研究、工程与产品。它提醒我们:下一阶段的竞争不会由某一个参数决定,而取决于团队能否把模型能力转化为可验证、可持续的真实结果。