效率不是省钱,是推高智能上限
数据总量有天花板,高质量数据就那么多。在数据墙面前,token 效率翻倍等于凭空多出一倍数据,产出的不是更便宜的模型,而是更聪明的模型。这是他把效率从基建议题重新定义为智能前沿的核心论证。

DEPTH PROFILE
Zhilin Yang
Moonshot AI / Kimi 创始人
Moonshot AI(月之暗面)/ Kimi
EDITOR'S SELECTION
4 条经过五问筛选的核心判断
数据总量有天花板,高质量数据就那么多。在数据墙面前,token 效率翻倍等于凭空多出一倍数据,产出的不是更便宜的模型,而是更聪明的模型。这是他把效率从基建议题重新定义为智能前沿的核心论证。
他把整个研究议程组织成三条线:token 效率提升单步质量(用同样数据训出更强的模型),长上下文让 agent 能连续运行数天甚至数周,agent swarm 让大量子 agent 并行协作解决复杂任务。三条线最终汇聚成一个系统:一群拥有超长上下文和强先验的 agent 协同工作。
几乎所有开源模型在文本模型训练完成后才追加视觉能力(late fusion),他反过来从零开始就把图像和文字混在一起训(early fusion)。结果不但没有互相拖后腿,反而互相增强:纯视觉 RL 改善了文本推理,强文本底座让零视觉 SFT 也能达到接近最好的视觉表现。
这些技术长期被当作不可动摇的默认选项。他的团队逐一替换并取得大幅提升。他认为这在十年前做不到,因为缺乏 scaling ladder 和足够的算力来做严谨实验;现在有了完整的评测体系,才有可能对古老默认做出有信心的结论。
ALL INSIGHTS
按当前资料入库顺序排列
数据总量有天花板,高质量数据就那么多。在数据墙面前,token 效率翻倍等于凭空多出一倍数据,产出的不是更便宜的模型,而是更聪明的模型。这是他把效率从基建议题重新定义为智能前沿的核心论证。
他把整个研究议程组织成三条线:token 效率提升单步质量(用同样数据训出更强的模型),长上下文让 agent 能连续运行数天甚至数周,agent swarm 让大量子 agent 并行协作解决复杂任务。三条线最终汇聚成一个系统:一群拥有超长上下文和强先验的 agent 协同工作。
几乎所有开源模型在文本模型训练完成后才追加视觉能力(late fusion),他反过来从零开始就把图像和文字混在一起训(early fusion)。结果不但没有互相拖后腿,反而互相增强:纯视觉 RL 改善了文本推理,强文本底座让零视觉 SFT 也能达到接近最好的视觉表现。
这些技术长期被当作不可动摇的默认选项。他的团队逐一替换并取得大幅提升。他认为这在十年前做不到,因为缺乏 scaling ladder 和足够的算力来做严谨实验;现在有了完整的评测体系,才有可能对古老默认做出有信心的结论。
开放权重让你可以部署在任何地方、看到模型的每一个参数而不是使用黑盒。但光开放不够,开源模型必须达到前沿水平才能真正让智能变得人人可及。
在 token 效率、长上下文、agent swarm 之后,他预期会出现新的 scaling 维度,并表示将与开源社区一起探索。
EVIDENCE
观点所依赖的证据层
2026-03-21 · 40 分钟 · EN