梁⽂锋投资者交流会 · 录⾳⽂字稿
录⾳整理录⾳ 5⽉20⽇ · 整理 2026-07-16
梁⽂锋投资者交流会 · 录⾳⽂字稿
⾳频《deepseek 0520.m4a》,总时⻓约 3 ⼩时 44 分钟。本稿由语⾳识别⾃动转写并经AI 整理,未区分说话⼈,⽅括号内为⾳频时间位置;个别专有名词与数字可能存在识别误差,请以原录⾳为准。
[00:00:01]
以及我们公司的其他同事,我们⼀开始来做这个公司,初衷是没有想到说我最后要赚多少钱,要到资本市场上去,要上市,要怎么样的,所以我们是没有这个初衷的。
最开始的⼏⼗个⼈完全没有这么想过。如果他这么想,他就不会来。所以总体讲,我们是怀着⼀个对这个世界⾮常⼤的善意来做这个事情,然后我们觉得这是对⼈类有⽤的,这是⼀个⾦钱以外的事情。
当然,到了后⾯,这个事情发现利益⾮常⼤之后,⼜有其他的诱惑,这个是另外的事情。但是我们出发的初衷、我们的愿景,以及我们保持到现在的这个愿景,不是按照⼀个商业利益最⼤化的⽅式来做的。我觉得这点⽐较关键。
我⼤概⼆⼗年前的时候,在管理上我最崇拜的是杰克·⻙尔奇,就是 GE 的前 CEO。现在回来看,他说的⼤部分东⻄可能都已经不对了,但是他最重要的⼀点说对了:⼀个公司最重要的是它的愿景。
管理⼀个⼤公司,靠的不是你的规章制度,靠的是愿景。愿景是什么呢?愿景不是挂在墙上的标语,愿景是你怎么做,不是怎么说,就是你怎么实际运⾏。反正杰克·⻙尔奇说的原话我忘了,⼤概是这个意思。
所以,我们是怎么管理这么多⼈、怎么组织起来的?其实我们没有组织,就是愿景驱动的,靠⼀个愿景来组织。我们是没有组织的。
这个有好处,也有坏处。未来我们会想办法扬⻓避短,但这个是我们的特⾊。我们并不是以⼀个“我要实现什么 KPI、没有考核”的⽅式来做,只有愿景。
这个愿景甚⾄也不是成⽂的,并不是写出来的,没有写出来过任何东⻄。这个愿景是在我们做事情的⽅法、我们对待这个世界的态度⾥。可能我们公司每个⼈对这个愿景的理解也不⼀样,可能每⼀个⼈的愿景也是有差别的,但是在⼀个⼤的⽅向上是⼀致的。
我觉得还是怀着对这个世界⾮常⼤的善意,然后想做⼀点事情。我们是⽤这个来组织起来的。
接下来我先讲,讲完之后⼤家再提问。我可能会围绕着这个愿景来讲后⾯的事情。这个愿景是真的,不是编出来的,我们是真的这么想,真的这么做的。否则你没法解释我们的很多事情。
这个愿景为什么我们这么坚持开源?因为这个愿景本⾝就要求开源。你没有这个愿景,你没法把⼈组织起来。
⽐如说,智谱也开源,但是智谱的开源跟我们的开源不⼀样。智谱的开源有⼀种被迫的感觉,他们觉得这不是本意,但是对我们来讲,这就是我们的本意。
然后在开源这个事情上⾯,我们⼀开始就想得⾮常清楚。⾸先,第⼀个就是愿景;第⼆个,我们认为要把 AI 这个事情在商业上做成,开源是有好处的。
这听起来有点⽭盾,有点违反直觉,因为在历史上,开源跟商业化都是有冲突的。但我觉得 AI 跟以前不⼀样。因为在历史上,⼀个软件公司,它的市场⼀年可能就⼏⼗亿美⾦,离开源了,它就没有了,可能就只剩下⼏千万或⼏亿美⾦了。
但是 AI 这个事情⾜够⼤,最终它可能得占掉⼈类社会 GDP 的百分之⼗,⽐如说。那么它其实是⼀个⾮常⼤的数字。⼀个⼈独占这个事情,你不可能独占这个事情,你⼀定得跟别⼈分享,否则你肯定活不下来。
这跟之前开源做⼀个软件可能是不⼀样的,因为那个软件的市场就没那么⼤。但是 AI 这个事情实在太⼤了。如果说我们想独占这个利益,那么⼀定是要被历史抛弃的。我觉得最主要这是⼀个客观的规律,这是⼀个历史观。
并不是说我不开源,我就能够独占这个市场,这在理论上就不符合客观事实。你⼀定会遇到很多阻⼒,⼀定会有其他的⽅法阻⽌你实现这个⽬标。
在这种情况下,我觉得不⼀定要按照传统的商业思维。你需要有⼀套机制来确保你⾃⼰能够获得的利益是有限的,那么你才有可能做成。需要克制,我觉得是需要克制。
如果说我们想在我们⼿上把 AI 这个事情做成,⾸先第⼀个,我觉得是需要克制的。不能够想着⼈类 GDP 的百分之多少都归我了,或者说中国 GDP 百分之多少都归我了。你越这么想,越做不成。
所以我们从⼀开始就觉得需要克制。你越克制,你越有可能能够做成这层事。这是⼀个商业上的考量,当然这是⼀个宏观的考虑。
我觉得这是符合直觉的,⾄少是符合我的直觉,或者说⾄少我是真的这么想的。我们并没有⾮常多的其他优势,我们没有什么本事,我们并没有⽐别⼈有钱,也没有说我们⼈员⽐其他公司更好,其实没有的。
你想,我们两年前成⽴这个公司的时候,我们⼜没有很多钱,⼜没有很多卡,⼜没有什么知名度,⼜没有什么号召⼒,我们就是⼀群⾮常平凡的⼈。
[00:11:49]
我真的就是⼀群平凡的⼈。如果说喜欢的⼀个叙事是⼀群平凡的⼈做出了不平凡的事情,⽽不是⼀群天才做出了不平凡的事情,这个跟我们的克制是很有关系的,跟我们的克制、跟我们的愿景是⼀脉相承的。
那么,开源跟商业化会不会有冲突?我觉得在 AI 这个事情上⾯,你不克制,你就不起。开源是属于克制的⼀部分,那么我们的克制不仅表现在开源上⾯,我们还表现在很多⽅⾯上。但总体上来讲,我们是不⽤考虑开源这个事,不⽤考虑克制这个事情。
你越克制,可能就越容易做成,或者说⾄少到⽬前为⽌是印证的,到⽬前为⽌是能解释得通的。否则没有办法能够解释为什么我们能够做成:我们并没有什么武器,起点⼜⾮常低,资源⼜⾮常少,我们的⼈其实也就是随机的⼀群平凡的⼈。我⾃⼰也就是⼀个⼤学毕业的学⽣,也不是最顶级的那个学校毕业的。
这个克制也是我们愿景⾥的⼀部分。AI 这个事情太⼤了,利益太⼤了。我们⾮常克制,只要能够做成,最后利益都会⾮常⼤。你随便分⼀点,利益就⾮常⼤,所以现在根本不⽤考虑拿这⾥⾯的哪⼀部分利益、怎么拿,我觉得根本不⽤考虑这件事情,因为这个利益⾜够⼤了。
你只要分⼀点点,就已经很⾜够了。所以我们之前说,我们只赚取⼀个合理的利润,只看你的意愿,⽽不是利润之⼤,这个是不⼀样的。这不是我们的 API 定价。我们 API 定价觉得⼀个合理的利润,⼤概是我们到市场上买⼀批设备回来,⼗个⽉收回成本,我觉得这是⼀个合理的利润。
在当前的情况下,考虑到你有⻛险、还有前期的投⼊等等,如果⼀个服务器我们在财务上按照三年或者五年的摊销,但在商业上,我们觉得⼤概⼗个⽉收回成本,我们觉得够了,OK,我们觉得够了。所以这个是我们现在 API 定价的逻辑。我们的 V3.2 Flash 跟其他的,都是⼗个⽉收回设备的成本。
这就是我们的标准。它其实不是利润最⼤化的,如果利润最⼤化,应该把价格设得更⾼。因为在这个价格区间,⽤户的需求是没有弹性的,就是我价格再翻⼀半,或者说我价格再抬⾼⼀倍,token 的消耗量区别不⼤的。
如果我价格再贵⼀倍,我的总收⼊接近⼀倍。稍等⼀下,我对⼀下。哎呀,太好了。
我跟你们讲个故事,就是我们那个 DDCP,是我们那个模型。⼀开始我们担⼼需求太多,所以⼀开始把价格定得⽐较⾼,团队⾥⼤家不是很⾼兴。后来我把价格⼜降下来了,降到四分之⼀,⼤家就很开⼼。
我觉得这个才是我们真实的想法。就是我前⾯说的愿景,我们还是让这个东⻄对⼈是有⽤的,⽽不是我们赚最多的钱,⽽是我们在能够赚到合理利润的情况下,⼤家都⽤得起。我觉得这次我们公司其他⼈的想法,就是我们那时候降价的时候,公司群⾥⾯很多⼈是欢呼的,⼤家都觉得很开⼼。
因为这是我们花了这么多精⼒,这么⽤⼼把这个模型做好的⽬的。⽬的就是能够⾮常便宜、效果⾮常好,能够让⼤家都能够充分地⽤。我们就觉得这很开⼼,这是我们的动⼒,这是我们的愿景,这是我们公司能够凝聚到⼀起去做这个事情的共识吧,这是我们公司内部的共识。
这点应该是⽐较特殊的,因为降价这样对于我们其他的竞争对⼿来讲,肯定不是个好事,他们⼀定不是欢呼的。因为你的收⼊、你的 ARR,那个你降⼀半,ARR 就掉⼀半。对,这是⼀个我们不⼀样的地⽅。
我们觉得这就够了。从我们公司内部来讲,我⼗个⽉收回成本,这个商业上我已经⾮常满意了。对于公司外部来讲,我们也觉得这个价格是⼤家⽐较开⼼、⽐较乐意看到的,⼤家是双赢的,公司跟社会、跟所有⼈都双赢的。
我觉得,OK,刚刚有⼈在屏幕上留⾔说,⼗个⽉回本这个利润太⾼了。确实是还有降价的空间,确实还有降价空间。在模型的优化上也还有空间,所以整体降价空间还是⽐较⼤的。
但是这个成本,⼗个⽉回本,我们⾃⼰能做到,其他家做不到。像可能阿⾥或者腾讯,他不是我们的优化,他的成本应该是要⽐这个⾼好⼏倍的。这⾥还是有很多优化的⼯作。
刚刚说我们为什么不继续降价,是因为它没有弹性。就是我再降价,需求不会更多了,或者我再降价,需求增加得很少了。因为这个价格所有⼈都⽤得起了,⼤家都觉得这个价格是满意的,不会因为这个价格贵⽽不⽤了。
所以降价⾸先公司不会有更多的收⼊,对社会来讲也没有更多的价值,因为这个价格⼤家都满意了。你价格再低,对这个社会的幸福感也没有增加很多。对,OK,不过刚刚这个问题上,就是我们在定价这个事情上⾯,我们肯定不是以
[00:25:32]
公司收⼊最⾼或者利润最⾼,不是最出发点的。这是我们克制的⼀部分,因为从短期来讲,你价格⾼⼀点,你可能收⼊多⼀点;但从⻓期来讲,还真不好说。因为我觉得克制是⼀种策略。
对我来讲,克制是⼀种战略。就在于有时候你可以舍弃⼀些,来换更多其他的东⻄。不开源这个事,其实也是⼀样的,也可以认为是我们的压⼒,也可以认为是我们的让利。
⾸先,这个让利对于我们公司内部来讲,我们很⾼兴,⼤家都很开⼼,员⼯觉得很有成就感,我们会因此有凝聚⼒。以及这个让利对社会是有好处的,社会也很⾼兴,其他同⾏或者说普通⼈都会很⾼兴。所以这种克制,我理解是这种克制从⻓远上来讲,能够增加我们做成 AGI 的概率。
在考虑⼀件事的时候,我是毫不怀疑 AGI 会有⾮常⼤的商业价值。那么在这个基础上,我优先考虑的不是我怎么多加⼀点份额,我怎么多拿⼀些份额,我优先考虑的是我怎么增加我能够做成的概率。
这个克制可能还体现在很多其他的⽅⾯。⽐如说,我们去年春节⽤户突然很多,但是我们并没有去追求我要留这些⽤户,或者说拿这些⽤户来变现,或者说我要去抢这些商业利益,在⽤户上⾯兑现。
我们没有去抢⽤户,没有去赚钱,但我们很努⼒想办法把⽤户服务好。我们并不会有这样的想法,说我要做成下⼀个超级 App,然后我要去跟谁竞争,我要做成下⼀个字节、做成下⼀个腾讯,完全没有这样的想法。
我们是可以这么做,但是我们没有这么做。我的理解是,这也是克制的⼀部分。你不要想什么都要赚了,你好像有了⽤户之后,好像就能够做成下⼀个字节了,然后你就把那个吃了。
我觉得这个在商业上是⾏得通的,是有可能的。如果去年时候我们⽤了⼤笔钱,就跟字节去抢⽤户,也是⼀种打法。但是我们选择是⼀种⾮常克制的做法,就是我不跟你去争这个东⻄,因为后⾯还有⻄⽠,前⾯的可能都是芝⿇。
我不应该什么芝⿇都抢了。当然,可能这个芝⿇⽐较⼤,但我觉得后⾯的 AI 可能前⾯都不算⼤。现在来看,去年我们没有在 C 端去发⼒,可能是对的。因为能看到后⾯真的是有更⼤的⻄⽠,前⾯真的只是⼀些⼩芝⿇。
如果去年我就有很多钱,然后把这个事情做得⾮常⼤的话,有什么好处?你并没有得到什么东⻄。这些是我的真实想法,因为我觉得后⾯的 AGI 机会应该是⾮常⼤的,后⾯的AGI 机会永远是⾮常⼤的。
我甚⾄不⽤考虑我到时候在⾥⾯是占⼀个位置,或者说在那⾥⾯我的商业模式是什么,我们根本就不⽤考虑。只要有那么⼤的商业机会,你⼀定是有办法的。那么前⾯的芝⿇,我们也会捡,但是我们就随⼿捡⼀点,并不会说我停下来,或者说我把它当成重要事情来做。
所以去年的 C 端⽇活这些,我觉得可能就是个⼩事。但我们也捡了,我们也⽤⼀个⽐较低的成本维持了⽤户的使⽤,因为有可能以后是有⽤的。虽然现在不知道这⽤户有什么⽤,现在它是⼀个纯成本的⽀出,但是以后可能是有⽤的。
既然是随⼿能够拿到的,我们就会顺⼿拿到。包括今年来看,很有可能我们在 API 或者AI ⽅⾯的 ARR 收⼊,也是有⼀个机会的。就是如果这个需求可以继续扩⼤,如果继续扩⼤,显卡可以买到更多的显卡,那么 ARR 做到⼏个亿美⾦是很有可能的。
如果说 AI 能做到⼗亿美⾦的话,那么基本上我公司的现⾦流可能就能够回正了,能够cover 我的研发费⽤,能够 cover 我的所有费⽤。所以说这个也是有可能的,但是我们没有把它当⼀个优先来做。
这个我们会做,但我觉得这个是个重要事情。它不是我们第⼀优先考虑的,或者不是我们今天真的关⼼的。更⼤的机会应该还在后⾯,前⾯的机会包括去年的 C 端、今年的 B端,我觉得这事要做,要把它做好,但这不是我们的⽬标。
或者说,我们公司⼤部分⼈不认为这是⼀个⾮常重要的事情,不认为这是⼀个跟 AGI ⽐较起来同等重要的问题。
开源那个可以多说⼀下,因为之前有很多问题问的都是开源。⾸先,我觉得我们是会开源的,然后我们最强的模型可能也是会开源的。因为我看不到闭源什么好处,看不到必然的好处。字节它的模型是闭源的,它有什么好处?我看不到有什么好处。
哪怕是模型开源,你把所有东⻄都告诉别⼈,这个门槛也⾮常⾼。别⼈要⽤起来,这个门槛也⾮常⾼。他要⽤起来,就很难;其次,他要⽤起来,还要成本做得很低,也很难很难,没有那么容易。
并不是我开源了,他就能够轻易地做到跟我⼀样的部署成本。这⾥边还是有很多⼯作要做的。虽然说这些⼯作原理都明⽩,但是不是每⼀家公司都愿意,或者都有这个意愿和能⼒来组织⼈⼒去达到这个⽬标的。
这点我也很习惯。它可能就不擅⻓做这个事情,因为它阻⼒太⼤了。它要控制这个成本很难,它有很多管理上的以及物理上的制约。这也是创业公司的优势,因为创业公司如果太⼩的话,你没有这个⼒量来做这个事情;如果你是⼤公司的话,你很难组织。
[00:38:36]
这个事情都有难点,所以这是属于我们这个规模的公司的⼀个甜区,sweet point。然后如果我们更⼤了,可能我们没有其他问题;如果更⼩的话,朋友们⼒量⼜会不⾜。
所以,⾄于开源,我觉得我们应该定价。⽬前我们应该认识到,不会逼⼈。因为定价的模型,我也不会收⼀个⾮常⾼的费⽤,我也是可能按照⼗个⽉回本来收这个费。按⼗个⽉回本,就已经能够把竞争对⼿……
我按⼗个⽉回本这个,就能够让独⽴部署的第三⽅⽆利可图。第三⽅他做不到,他做不到这个成本,他肯定做不到。
所以开源并不会影响我的收⼊。当然,如果说我要赚⼀百倍的利润,那么开源是……
听到你的话,但视频好像掉了,⽼板。
刚刚可能是电话接来了。
就是开源,我觉得对我们的商业模式是没有任何影响的。前提是我们只赚六倍的利润,⼗个⽉收回成本,⼤概对应的是六倍的利润。我们只赚六倍利润的情况下,开源是不会有什么影响的。
但如果说你要赚⼀百倍利润,那么开源确实会影响你赚⼀百倍利润,因为第三⽅会部署,他可能是⼆⼗倍成本,就⽐你低了。
这个模式是不是⻓期可以持续的?我觉得是可以的。就在我们这个愿景下,我觉得开源是⻓期可以持续的,或者我们是打算这么做的。你可以认为,就是有克制,也是有让你⽐较⻓利。
这个策略是能够在技术前⾯让我们有更多的机会,我们能够做成 AGI 的概率也是更⼤的。我们更从容。
你想,我们根本都不⽤加班,因为就没那么难。但是对其他家来讲,可能就很难,因为你想的也太多了。
其实不难的,根本就不难。才开始是⼀个……外⾯可能看起来,我们选了⼀个很难的模式,我们要做研究,我们去做最难的事情,好像是个 hard 的模式。但其实我们在外地⽅舍弃了很多,使得我们还是⾮常有⼒的,我们还是做得⾮常轻松的。
所以对开源这件事情,实际上我的判断是,它是持续的。开源和商业付费之间没有冲突,前提是六倍利润的情况下没有冲突的。
六倍利润看起来很⾼,但其实不⾼。因为现在 AI 的效率这么⾼的情况下,现在⼀个合理利润可能就是这么多。未来它可能会降到,⽐如说四倍、三倍,我觉得这已经是……再到底也不可能再降了。但就是它还是会有很⼤的利润。
就光是看卖 API 这个事情,但我并不觉得卖 API 这个事情有那么⼤吸引⼒。但是就这个事情,你可以说明,没有,我没有看到有什么冲突。
然后我也不担⼼别⼈部署我们的模型,然后跟我们来竞争,⼀点都不担⼼。我们还希望他们能够部署起来。
我们尽可能给开源社区提供帮助,协助⼤家能够把我们的模型部署起来。我不担⼼他会跟我抢这个⽣意,因为这个市场⾜够⼤。我只担⼼他部署不起来,他有些细节没做对,效果变得⽐较差,或者说他的成本会⽐较⾼。
对,这⾥是没有冲突的。
然后去年的时候,我问的,去年有 To B 这个⽣意的时候会问得⽐较多的是:我们那个 C端,我开源,那么 C 端是不是跟我这个 C 端⼜会冲突了呢?因为我没有流量的优势,或者说腾讯⾃⼰流量很多,他部署我们的开源模型,他就把所有的 C 端⽤户都接过去了,就把我的 C 端⽤户都抢⾛了。
但其实并不会,这个还是有很多原因的。
然后问题是:我们给的开源模型,跟我们⾃⼰部署的模型是不是⼀样?是⼀样的。我们不会说开源⼀个差点的模型,然后我们⾃⼰部署的时候⽤⼀个更好的模型,是不会的,是⼀样的。
这也说明它其实没有冲突。我们去年⼀整年,在 C 端我基本就是开源了,然后 C 端的服务没有看到冲突,真的没有看到冲突。所以,这是开源的这部分。
然后下⾯还有就是,公司的⻓期 vision,我觉得我们⽬标应该是 AGI。每个⼈对 AI 定义不⼀定⼀样,但是不妨碍我们把 AGI 当做我们的⽬标。
从技术路线上来看,其实 AGI 这条路线图是⽐较清晰的。跟⽬前的这⼀代 AI 技术,如果说你能够把⼀个问题描述得很清楚,给它完整的上下⽂和指令,它已经超过⼈类了。但这⾥有个定义,有个前提是:你给它完整的上下⽂,你给它完整的指令。
然后这个定义是很难达到的。⽐如说我们今天开会,其实我们前⾯有很⻓很强的上下⽂,可能⼤家有⼏⼗年的上下⽂,然后这是 AI 不具备的。那么现在 AI 能具备的是,在⼀个局限的上下⽂⾥⾯,它能做得⽐⼈更好。
但它还是替代不了⼈类。这⾥⾯还差⼀个地⽅,是持续学习。因为⼈也能够持续学习。你招⼀个员⼯,他可能花两个⽉时间来熟悉这公司的环境,熟悉他的⼯作,他谈两个⽉的,你这样他就可以上⼿了。
他就能做很多事情。他能够听懂你说的话,⽐如说你说,叫那个⼩王来,他就知道⼩王是谁。但如果 AI 的话,因为这个上下⽂,他前⾯没有这两个⽉的学习。
你跟他说,叫⼩王过来,你得告诉他⼩王是谁、什么职务、他在哪⾥、要怎么去找他、要找他的时候注意什么。你得给 AI 所有的上下⽂。那么在这种情况下,AI 是能做的,但是你不可能给他所有的上下⽂,也不现实。
所以 AI 并不能够替代你的员⼯。但如果说 AI 具有持续学习的能⼒,它跟你的员⼯⼀样,到公司学习两个⽉,那么
[00:51:02]
但就可以替代天下的⼈了,所以我们离下⼀步还差⼀个学习去学习。
AI 的发展,我们可以理解成它是⼀个阶梯。去年⾛的阶梯是 CoT,就是思维链。因为我们发现,通过思维链的⽅式,可以让智能达到⼀个更⾼的⽔平。通过它⾃⼰思考,可以让这个上限,可以让这个 AI 能做更多的事情。
那么我们⼜跨过了⼀个阶梯。今年的阶梯就是 Agent,因为我们发现,⽤ Agent 的⽅式,即便多有事情也可以做,它的能⼒范围会更⼤,它的智能上限会更⾼。
为什么是阶梯呢?因为后⾯的每⼀步都是基于前⾯的基础上的。Agent 要⽤到 CoT,然后CoT 也要⽤到前⾯的阶梯,前⾯的阶梯就是语⾔模型,所以它并没有⼀步是⽩⾛的。
所以,AI 的发展,智能的⾛向是有迹可循的。说今年⾛的这个阶梯是 Agent,但是 Agent这个阶梯,它也是会⾛完的。就是它把所有可能解决的问题都解决完之后,但是它还是不能替代你的员⼯,但是它已经到它能⼒的上限了。
就好像 CoT ⼀样,CoT 到它的上限之后,它已经超过最顶尖的⼈类了,在做奥数题、写程序上⾯已经超过最顶尖的⼈类了。但是它还是停在那个地⽅,它那个技术并没有能够到达 AGI。
所以你看,AI 这个智能的⾛向,它是有迹可循的。然后在 Agent 之后,我们觉得应该要解决的问题是持续学习,就是怎么让模型可以持续地学习,⽽不是说你要给它⼀个很强的训练,它应该能够像⼈⼀样做⼀个⽐较⻓时间的持续学习。
这个问题跟完成任务等等是同⼀回事,它们相关,解决的是同⼀个问题。我们现在站在Agent 这个地⽅,能看到的是下⼀个瓶颈,就是持续学习。下⼀个要解决的问题,就是解决怎么持续学习,这个是看得到的,是相对来讲⽐较明确的。
就是卡在前⾯的这个障碍,你必须要跨过去,⽽且⼀定是有办法能跨过去的,但需要时间。持续学习之后,可能我们就会来到⼀个奇点。这个奇点就是,当这个模型能够持续学习之后,它已经能够做⼈类能做的所有事情了。
它就能够⾃⼰开发⾃⼰的版本,能够⾃⼰再研究,然后开发⾃⼰的下⼀个版本,开发更前的⼈⼯智能模型。所以它就会到⼀个奇点,能够实现⾃⼰的迭代。
但这个奇点,它并不是⼀个奇点,它也是⼀个渐进的过程。这个过程可能也是⼀个⽐较⻓的渐变,它不是个突变。但是习惯性地,我们都认为它可能是个奇点。
因为在很早之前,那些预⾔家认为这⾥会有个奇点,但其实它不是⼀个奇点,它是⼀个连续的过程。然后这⼀步⾛完之后,我觉得才是具⾝智能。
这是我们的推测,这是我们觉得这个时间表应该是:先解决学习去学习,然后再到那个智能的奇点,能⾃我迭代的奇点,然后才是具⾝智能。到具⾝智能之后,它就⾛进现实世界,可以给你做家务,可以给你养⽼。
我们觉得这是⼀个⽐较理想的路线图,但每个⼈的观点不⼀样,没有对错之分。只是我们觉得,这个路线图是最轻松的。
这个路线图是因为每⼀步你要做新的都很少。这个路线图我们可以不⽤加班。但是如果路线图是反过来的,⽐如说它要先实现具⾝智能,那么这⾥⾃⼰做得很累,这是⼀个很苦的活。我们不希望是这样的路线图,我们希望做得轻松⼀点。
如果说我们先解决持续学习,再解决那个⾃我迭代的奇点,再解决具⾝智能,这个路上就很轻松。因为到后⾯之后,你可以⽤前⾯的技术来帮助开发后⾯的技术。奇点之后再做具⾝智能,那个就不⽤⼈来做,就不⽤我们来做了,那个模型⾃⼰就可以出来了。
所以这个是回答我们的⻓期⽬标是什么。我就跟他说,这就是我们的⻓期⽬标,就是我们说的 AGI。
⼤家回到现实。去年最重要的现实就是,⼤家都要做 Chatbot,要抢 C 端的流量。那么今年的现实是,⼤家都要抢 To B 的收⼊,要参与到这⾥⾯去,因为如果不参与的话,根本就不在牌桌上,对不对?
但我们并不认为它是⼀个重要事情,或者说,在我们公司内部,我们真正关⼼的,其实是刚刚我说的这些 AGI 的路线图,以及下⼀步这个技术怎么突破。
但是有⼀点很奇怪的是,最想得到的东⻄,反⽽你就得不到。那个并没有那么在意的事情,反⽽是还蛮容易能够得到。
这⾥边有⼀个战略上的优势,就是我们⼼⾥⾯想着 AGI,我们做的是 AGI。那我们再做那个应⽤,再做那个 C 端、B 端的时候,根本就不⽤太多的⼼思去做那个事情,其实花很少的精⼒就可以了。
我觉得是说,你站在⼀个技术的⾼位上来做相对低⼀级别的技术,是有这样降维打击的。⾄少在去年的 C 端,我们看到确实是这样。我们没有在 C 端上花很多⼒⽓,甚⾄⼀度我们都不想维护那些⽤户了,但是⽤户赶都赶不⾛。
因为真的是赶不⾛,所以最终都还在。但稍微……然后今年 B 端的这个收⼊,现在看起来这个增⻓还⽐较乐观。我觉得可能这个数字跟同⾏⽐的话,应该也是⽐较好的,我估计。但是我们并没有花很⼤的精⼒去做这事情,我们根本就没有
[01:02:45]
做⼀件事情,就是顺便做的。
做互联⽹智能的上线,⾛的时候,AGI 这⼀步是我必须⾛的,是个台阶。通往 AGI 的路上,我要经过这个台阶。那么我把这些技术都通过 API 给⼤家服务,我没有⼲额外的事情。
我们还是在做 AI,这是⼀个副产品。我只要搞⼏个⼈维护这个 API 就可以了,甚⾄客服都没有,也不⽤销售,什么都不需要,⽤户⾃⼰就会来。
或者说,被认为是 C 端的⽤户,C 端和 B 端,都是我们做 AGI 路上的副产物,都是⼀个中间的产出,跟我做 AGI 没有冲突。我并不是为了做 C 端,或者为了做 B 端⽽去做它,⽽是我们做 AGI 是为了做 AGI,刚好能产出这个东⻄,我就把它拿来做商业化了。
这跟其他公司不⼀样。其他公司就是为了做这个,为了服务 C 端⽤户,或者服务 B 端⽤户⽽去做这个模型。但对我们来讲,初衷不是这样的,我们初衷还是去追求 AGI。
我觉得这个在⼀定程度上是⼀种降维打击。AGI 是更⼤的愿景,这个愿景能够凝聚起更多优秀的⼈,它有更强的凝聚⼒。所以我在组织上有优势,然后我利⽤这个优势去……它就是⼀种降维打击。
但如果你是⼀个商业公司,你的愿景就是服务好 C 端⽤户,那么是另外⼀个故事。他有其他的优势,在产品上、⽤户服务上、流量上会有优势,但是在技术上没有优势。
现在⽐较有利的形势是,模型技术是最重要的。你要将模型做好,其他……对,然后这个可以解释我们之前发展的轨迹。我们真的是选择 AGI,然后我根本没有想着说要做很多的⽤户。
去年春节我们突然⽕的时候,那不在我们的剧本⾥⾯,我们完全没有想过那个东⻄。我们就是想把这个技术做好。但是那时候我发现,其实我们这个组织相对于完全商业化、以产品为⽬标的组织来讲,在⼈才跟组织上是有额外优势的。
这也很神奇。那时候 C 端⼤家都抢得头破⾎流,结果被⼀个没有去抢的⼈牵⾛了。这个也确实说明我前⾯说的逻辑是有道理的,确实是有⼈才和组织上的优势。
这个⼈才优势不是说我的⼈⽐他更聪明,⽽是这些⼈才我怎么组织起来,怎么激励他,然后怎么合作。这个东⻄是有优势的。因为你把聪明的⼈聚在⼀起,并不是说他⾃然⽽然就能够合作,⾃然⽽然就能够⾮常有激情地去奔⼀个⽬标、去完成的,所以你需要⼀个愿景。
我们前⾯的经历给我的启⽰是,AGI 这个愿景是很强⼤的。
OK,这是问题。然后下⼀个问题是,核⼼利益的重要性是什么?
我前⾯说,我们在很多⽅⾯都要⾮常克制。但是我们的核⼼利益是什么?其实我们的核⼼利益只有⼀点:我们最⼤的核⼼利益是要保持团队的稳定性。这是我们最⼤的核⼼利益,甚⾄可以认为是唯⼀的核⼼利益。
只要我能够保持团队的稳定性,我⼀定能做成,⼀定能做成 AGI,就这么简单。只要⼤家都不⾛,我们能够继续做,我就⼀定能……基本上没有什么⻛险。只是说早点晚⼀点,将遇到挫折;如果遇到挫折,⼤家都不⾛,那么我⼜可以继续。
钱肯定不是问题,资源不是问题,其他要素都是容易获得的。对我们来讲,只有⼀个核⼼利益,只有⼀个没法退让的:我们必须要保持团队的稳定性。
这也是我们⾯临的⼀个⾮常⼤的挑战,或者说,我觉得是最⼤的⻛险。当然,这个⻛险随着我们近期的这⼀次融资,得到了⽐较⼤的解除。因为⼤家拿到的期权都还是⽐较多的,⾦额还是⽐较⼤的。
从团队稳定性来讲,只要最重要的⼀些员⼯、最⽼的员⼯能够稳定,那么其他⼈是不太会⾛的。其他⼈哪怕期权少⼀点、收⼊少⼀点,他也不会⾛。因为他不是全奔着钱来的,⼤家都希望在⼀个能够做成 AGI 的环境⾥⾯去做这个事情。
所以对⼈才来讲,还是有吸引⼒的。从历史上来看,我们的⼈才流动是⽐较少的,跟同⾏⽐,我们⼈才流动永远是⽐较少的。但是,这依然是我们最⼤的挑战,是唯⼀的挑战,可以这么讲。
其他都是时间问题,其他最多导致我们晚半年、晚⼀年,但是不会说做不出来。肯定是不缺钱,肯定是不缺资源,其实这些都是不缺的。
所以我们现在做的很多事情,都是为了保持团队的稳定性。除了这⼀点以外,其他我觉得我们都是可以不要的,都是可以克制的。我们⼀直⾮常克制,不愿意跟任何⼀家互联⽹⼤⼚或者⼩⼚成为对⼿。
我希望我能够给他赋能,或者希望我能够协助⼤家去做这个事情,希望能够帮助⼤家做这个事情。这也是我们前⾯说的,我们的商业意义的⼀部分。前提是⼤家不要管……
[01:15:12]
在这个前提下,我们是很愿意协助、帮助任何⼈,甚⾄我们的竞争对⼿,包括阿⾥、智谱、⽉之暗⾯,去做得更好。因为我们并不损失什么东⻄,我们本来也是开源的,开源也是没有把边界尽可能说清楚,对怎么做,希望你能够复现;你如果复现不了,你讲,我告诉你怎么复现。
这本来就是开源的⼀部分,不会因为你是竞争对⼿就怎么样。当然,如果是合作伙伴,我会做更多的事情。但是在⼤的利益上⾯是没有冲突的。
在对外⾯打交道的时候,我们的态度是:我们只做 AGI 的主线。这就是我刚刚说的这个GPT、CoT、Agent 等等,就只做主线。AI 领域很⼴泛,有很多东⻄我们觉得它不在这个主线上⾯,⽐如说 3D、视频⽣成,我觉得可能跟智能的主线没有太⼤的关系,我们不会去做。
还有⼀些,⽐如说世界模型,我觉得现在跟智能的上限也没有太⼤的关系,所以我们也不会去做。但是其他⼈做,我们也很乐意帮忙。有没有时间是⼀回事,但是利益上是没有冲突的。
我们也希望这些 AI 技术能够⽤到各种⽣产环境⾥⾯去,能够提⾼社会的⽣产效率,能够帮助各⾏各业去提⾼⽣产效率。我们是⾮常有动⼒做这个事情的。
我有没有时间、有没有⼈⼿,或者我们的同学⾃⼰感不感兴趣,那是另外⼀回事。但是在利益上是没有冲突的,我们是希望能够达到这个⽬的。并且我们认为,这个跟商业没有任何冲突,我该拿到的利益还是没有少。
我觉得我们之前秉持这种态度,其实我们并没有因此⽽少拿到任何东⻄,并没有因为我开源,并没有因为我们的善意或者说我对其他⼈提供帮助,⽽导致我们少拿了任何东⻄。⽐如说去年的 C 端⽤户,我们现在 C 端⽤户还是⽐较多的,也还是⽐较稳固的。
我们今年的 B 端,我觉得也是⽐较乐观的。我并没有因为我们的善意⽽影响到我的商业利益,完全没有影响,反⽽可能还有加分。这个看起来违反直觉,但它确实是这样的。或者我们反过来想,如果违背它,也是必然的,我能够拿到更多东⻄吗?没有。
有个问题是,怎么理解世界模型和 AI 智能上限提⾼没有关系?我说的是在现在这个阶段,这是我们的判断。我们有看到,这是我们⾃⼰的 AI 路线图,不是唯⼀的路线图。
从我们的理解、从我们的判断来看,当前最重要的是把 AI 训练做好。把 AI 训练做好,并不需要世界模型,甚⾄不⽤多模态。因为你把 AI 训练范围缩⼩⼀点,没有多模态,只是有⼀部分任务你做不了,但是不影响这个算法的成⽴。
多模态最终还是要做的。现在重要的是训练,然后下⼀步要解决的是持续学习的问题,再下⼀步要解决的是它⾃⼰问问题。但是这个路线图⾥⾯没有世界模型,没有视频⽣成。
视频⽣成⼀开始出来的时候就很⽕,好像这是必须要做的,如果你不做,你就不是⼀个AI 公司⼀样。所以我就很奇怪,这个其实你只要仔细去想⼀下,它跟智能的路线图是没有什么关系的。
事实上,你也发现,那个视频⽣成⼀开始 Sora 出来之后,所有⼈都做,⼤公司、⼩公司都做。但是⼩公司后来都把它砍掉了。它跟智能的上限没有关系。
但在商业上,它是个好⽣意,在商业上是个好⽣意。但是这跟智能没有什么关系。我们不会因为它是⼀个好商业⽽去做它,我们只会因为它是智能路线图上的东⻄,才会去做。
视频⽣成那个,因为那个相对⽐较清楚,就拿它举例。然后世界模型,世界模型这个含义就没那么清楚,因为很多东⻄都可以说它是世界模型。
从我们的判断,世界模型和智能还不是现在这个阶段最重要的事情。最重要的才是 AI 训练,以及 AI 训练之后怎么解决持续学习。这是我们公司的判断,当然每个公司它的判断是不⼀样的。
我刚说的是,我们公司对公司来讲最重要的问题,就是⼈员的稳定性。从另外⼀个维度来讲,我们缺什么呢?我们跟美国的差距是什么?其实差距只有⼀点,就是资源。
我们没有那么多卡,我们的卡的数量还是⽐较少的。我们现在⼤概是两万张 H 等效算⼒,这其中⼤部分是刚到,最近⼀两个⽉刚到,可能还有很多机器还没有来。
我们总的算⼒去年⽐较少,今年我们在⾮常激进地扩充这个算⼒。我们现在⼤概是两万张H 等效,接下来⼏个⽉我们还会有⼤批量的机器买过来,基本上都是英伟达。
我们需要多少卡?现在肯定是越多越好。在我们能够承受的范围内,肯定是卡越多越好,这是毫⽆疑问的。所以我们现在策略是,在合理的价格⾥⾯,能买到多少卡就买多少卡。
如果说这笔融资⽤完之后,我能买多少卡,我就买多少卡。花钱的速度不在计划⾥⾯,⽽是只要价格合理,有多少我都买。那么如果说我在半年之内就把钱花完了,我觉得是个好事。如果说我在半年之内把钱都花完,那这个太幸福了,这太理想了。
实际上,要把这么多钱花完⾮常不容易,买不到那么多卡,很难买,⽽且价格也很⾼,也不能说花⾮常⾼的价格去买,还得确保这个价格是合理的。
[01:26:41]
如果我半年之内就把这个钱花完的话,可能是最理想的。因为我把钱变成英伟达卡,肯定是⽐放在银⾏⾥⾯好。放银⾏⾥⾯,我现在已经可能是存两个点,好像就要。但是买英伟达卡,⼗个⽉的社会成本。
所以肯定是你能买到多少就买到多少。最先如果买了卡之后,后⾯我有很多空间,我通过提供服务或者我怎么样,我总是能够有现⾦流的。我有现⾦流我就可以活,我就不需要在我账上⾯放很多很多钱。
所以说,我们只担⼼买不到那么多卡。如果能够把钱都变成卡的话,那我们会毫不犹豫把所有的钱都变成卡,并且在这⾥⾯我们是愿意付⼀定的溢价的。就是我们愿意付⼀定的溢价去把它变成卡,因为这太划算了。
哪怕我们在付完溢价之后,其实我们也很难实现这个⽬标。那么客观上来讲,如果说我今年能够花掉两百亿,那么就属于我们的采购部门业绩超级好了。
我们跟美国的差距主要在资源上⾯,然后⼈上⾯差距不是很⼤的。⼈上⾯⼏乎没有差距,因为就是同⼀批⼈,可能是中国⼈。中国⼈出去的时候,有⼀些⼈留在国内,有些⼈留在国外,有些⼈去国外,他并没有说是聪明的⼈去国外,没有的。
其实它是⽐较随机的。最聪明的那些⼈,可能不是说⼀半多⼀点去国外的,但有⼀半少⼀点留在国内。国内⼈才是不缺的,⽽且我们的基数⼤,我们每年有那么多⼈的补充。
⼈才不是瓶颈,资源是最⼤的瓶颈。资源⾸先影响到⼈才培养,因为算⼒少,我们能做的实验机会⽐较少,所以我们的⼈才整体上⽐美国有差距。⼈才的差距,本质上也是因为算⼒的差距。
在现在最⼤的模型上,我们其实训不起的。我们哪怕把五百亿全花掉,其实也训不起。哪怕能堆起来也⽤不起。现在最⼤的模型,它激活⼤概是⼋百 B;国内的话,我们还在⼏⼗B 的这个规模,国内最⼤模型可能就⼏⼗ B 激活,那么差⼀个数量级。
如果我要训练跟 AI 同样⼤的模型,应该需要五万张 GB300,或者华为 950,⼆⼗万卡。这只是训练,还没有考虑做研究。所以我们跟美国之间最⼤的差距是在资源上⾯。
我们现在的资源,以及我们今年之内、接下来⼏个⽉的资源,包括⻢上⼤资源,也只⾜够我们在⼗ B 激活的这个规模⾥⾯去做更多的实验。因为我在⼏⼗ B 激活的这个规模⾥⾯,还有很多实验要做,还有很多事情需要搞清楚的。我们应该离能够训⼋百 B 的模型还⽐较远,时间还⾮常多,没有那么多卡。
所以我们跟美国的区别,我认为就是资源上的区别。我们可能会认为,我们看到的所有区别,包括⼈才的区别、模型能⼒的区别、应⽤的区别,可以认为都是因为算⼒资源上的区别。
算⼒资源⼀⽅⾯是国内本⾝卡就买不到,另外⼀⽅⾯是我们的资本投⼊⽐美国要少。我们在资本投⼊层⾯上少了很多,基于⼈才的⼯资在这⾥⾯占的⽐重是很低的。你看他们开的薪⽔⼀个亿美⾦这种,但算起来,⼈才的薪⽔还是占⽐很少,⼤头还是算⼒。
这个问题⽬前基本上⽆解,因为华为的产量也是有限的。因为我要训⼋百 B 的话,我就得⼆⼗万张华为最新的卡,这只是训练,还没有考虑做研究。
所以我们现在根本就不会考虑,到这么⼤的⼀个规模上去跟美国竞争。我们现在输,还是在我们能够训练得起、能够⽤得起的规模上,就⼏⼗ B 激活的规模上要先把它做好。再等下⼀步有更多的资源的时候,再把它做到⼀百五⼗ B、⼀百五⼗六 B,或者两百五⼗ B激活的这个规模。
所以我们跟美国在这⾥⾯有⼀个⽬前看起来很难弥补的差距。你要硬要训那么⼤模型也是能训,但是你没法做充分的研究。就是你在训之前,没法做充分的研究。
还有个⼤家⽐较关⼼的问题是,所有⼤模型竞争,它终局的差距会体现在什么地⽅?就是当⼤模型最终差距会体现在哪⾥?我觉得这个差距最终可能是没有太⼤差距的。
最终的差距应该是三⽅⾯:⼀⽅⾯成本,⼀⽅⾯时间,⼀⽅⾯⽤户体验。除此以外,可能是没有什么差距的。
成本⽐较好理解,你提供同样的服务、同样质量的服务,你能够以什么成本来提供。同样⼀件服务,不如说⽐亚迪的电池,在同等技术量的情况下,其他家是不是能够按照这个价格来提供,我觉得这个是个较难的事情。不是那么容易做到的,肯定是壁垒。
所以成本肯定是⼀个差异,我觉得可能成本是排在第⼀位的区别。然后第⼆个就是时间,你什么时候能够做到。你早⼏个⽉、晚⼏个⽉,它就不⼀样了。
第三个可能是体验,⽤户体验还是有些不⼀样的。这个⽤户中间还是会有⼀些⽤户粘性和⽤户壁垒的,但它可能不本质。本质还是第⼀个成本,第⼆个时间。你先做出来还是后做出来,你做到同样东⻄,是快点还是慢⼀点。
⻓期商业化路径和产品线进⼀步丰富后,怎么定价?我们觉得现在最值得做、最值得花精⼒的,还是做 AGI。现在要把 AGI 往前再往前推,就是把智能的下限往上推,往前推。
这个应该是在现阶段,⽐做更多的产品线、考虑更多商业化路径更划算,或者说它是⼀个收益更⼤的路径。我觉得在未来的⼀段时间,以及过去的任何⼀段时间,可能都是这样的。就是说,如果说我们
[01:39:46]
我们花了很多时间去思考,丰富我们的产品有什么⽤吗?
半年前讨论出来的商业化是什么?⼀定是我要去做⼴告,然后我要去做电商,我要去在产品⾥⾯植⼊电商,然后要跟本地⽣活什么很⼤⼀体。肯定没⽤的,因为变化太快了。你这个产品,如果说你在前⾯,或者我们现在这个阶段,去花很多时间做商业化考虑、商业化路径,产品线它⽣命周期很短。
我觉得没有到这个时候。这是我们的判断,或者⾄少前⾯的这些经验都是⽀持这个判断的。在过去三年,任何⼀个时候你来跟我说商业化路径、产品线,都是浪费时间,因为你并不能够预测、不能够预⻅未来。你能够预⻅的是很少的。
因为我看时间,不知道⼤家要中场休息⼀下吗?要先吃点东⻄吗?还是我们继续聊?⼤家没有意⻅,我就继续说。
在做全球领先的 AGI 研究,并在适当时候进⾏商业化。我觉得我们⼀直在做商业化,我认为⼀直在做商业化,只是没有以商业化为⽬标。我们是以 AGI 为⽬标,但是我们⼀直在做商业化,所以我们才有 C 端的⽤户,才有 B 端的收⼊。
从历史经验来看,这个策略是成功的。然后我觉得,我们离彻底转向商业化的时间点,应该是很遥远的。所以最⼤的还是技术的延伸,然后做下⼀代的技术,更多地解决现在的问题。这些收益⽐,我个⼈觉得,就在现在能看到的未来,在任何⼀个时候你聚焦在产品上都太早了。
所以这也是我们克制的⼀部分。我希望这些商业机会能够让其他⼈来做,我们希望这些商业机会、怎么⽤这个 AI,是整个社会、我们所有的合作伙伴⼀起来做,⼤家⼀起来分享这个收益,⽽不是我想独吞,这不可能。⽽且我们没有那么多精⼒,我们的组织也没有那么多⼈去做这个事情。
对于合作伙伴,其实我们这个融资是精⼼挑选的。具体怎么合作的这个提议,但⾸先我觉得,利益是⽐较⼀致的,就是跟我们利益最⼀致的、对我们最没有敌意的,或者说最希望我们能够做成功的。不是所有⼈都希望我们能做成功的,因为我们还是损害了很多其他⼈的利益的。
公司重⼤战略、技术业务决定的流程和决策机制。我们公司整体上是建⽴在共识的基础上的,我并不是说我⼀个⼈决定所有事情,⽽是我要寻求共识。我在公司内的权威以及在公司内的影响⼒,是建⽴在共识的基础上的。
⽐如说我要做⼀个事情,我肯定是先看我们⼤家的共识是什么,⼤家想不想做。然后有可能我会有⼀些引导或者倾向,但是这引导的作⽤是有限的,引导的作⽤是⾮常有限的,还是建⽴在⼀个共识的基础上。这个决策机制其实是⼀种寻求共识的机制,这并不是说我能够推动⼀个什么事情,它⼀定是共识,我才能够推得下去,然后我才会去推。
⽬前主要精⼒基本上都在 DeepSeek 这边。我们休息五分钟。我快点写。⼤家可以开⻨,给我⼀点反馈。我们这边没问题,要不然先休息五分钟。
各家模型最终效果拉开差距,应该是⼀个综合上的。⽐较模型效果,肯定是得在相同的成本上来⽐较,这个才是有意义的。因为你⽐较两辆⻋,也是同价位的⻋来⽐较。
做得好的模型跟做得差的模型,这个差别应该不是在具体某个环节,它应该是整体上的。
Anthropic 跟现在超过 OpenAI,这是不是⻓期的?我觉得这不是⻓期的,这肯定是极端性的。OpenAI 和 Google,未来⼤概率还是会交替上升,应该是会交替上升。其实现在Anthropic 在 Code Agent 上的优势没有那么⼤,其实并没有说它碾压 OpenAI。
我们公司可能有⼀半的⼈,平时有⼀半的⼈觉得 OpenAI 是更好的。其实 Anthropic 它有先发优势,但这先发优势应该很快就没了,并不是⼀个它能够⻓期占得住的优势。⼤家这三家都很厉害,这三家⾥⾯的效率是最⾼的,它花的成本、它花掉的、它烧掉的钱应该是最少的。
在全球 AI 中主导分⼯的时候,中国公司很有可能扮演的⼀个⾓⾊还是产量最⼤。常理来讲,我们的产能最⼤,包括芯⽚,芯⽚可能我们的产能最⼤,我们的电⼒最多,所以我们的 AI 最终很有可能我们是三体之⼀。
中国⼈会把这产品做到最便宜,然后再在效果上,毕竟国外的商品,现在很多商品中国产跟美国差并没有太⼤的区别。未来可能 AI 也是这样,但是中国产的 AI 可能价格会更便宜。这个便宜可能是系统性的低,就跟其他⾏业中国提供的服务更便宜可能是⼀样的。
我要做事情的时候,我习惯的思考是:我现在这个时候做什么收益最⼤?如果说我觉得现在做产品收益最⼤,我觉得去做产品;如果说我觉得现在把 AGI 先实现收益最⼤,那我就是先去做 AGI。显然,我觉得现在做产品不是收益最⼤的。
如果你是国产卡适配的问题,国产卡现在其实是有⼀个历史性的机遇的。因为之前国产卡适配有⼀个难题,叫⽣态不好。就买了卡之后,但是⽤不起来,它没有英伟达那个⽣态。所以说英伟达的护城河是很强的。
但是这个事情在发⽣变化。英伟达 CUDA的护城河在快速地被⽡解,快速被⽡解的原因可能是有三⽅⾯。⼀⽅⾯是现在有了 AI,然后有了 AI 之后,我要建⽴起这个⽣态⽐以前容易很多了,因为 AI 可以写代码。
[01:56:36]
我可以⽤ AI 来构建这个⽣态,就可以把跟英伟达⼀模⼀样的⽣态构建出来。第⼀个,因为有 AI;第⼆个,有⼀些新的技术。⽐如说,我们家出了⼀个技术,叫 TileLang,是⼀种⾼级语⾔。
⽤这个⾼级语⾔来写 CUDA的算⼦,可以很快地把英伟达的整套⽣态全部都写⼀遍,再结合 AI,这个看起来没有什么障碍。但是现在还没有完成,还没有做完,不过这个技术路线看起来是没有什么障碍的。
还有⼀点,因为 CUDA,英伟达它是从游戏卡演变出来的,所以它在很多地⽅,游戏卡的设计跟游戏卡的设置是⼀脉相承的。CUDA是兼容游戏卡的。以前因为 AI 计算是⼀个很⼩的领域,⽐游戏卡的市场要⼩,所以这样是合理的。
但是现在计算卡的市场已经⽐游戏卡更⼤了,就没有理由这两个还需要耦合起来。现在的趋势是,以后就不再耦合了。那么专⽤芯⽚,不管是华为还是英伟达⾃⼰,以后都是专⽤芯⽚,都不是之前的这些东⻄了。
在这个背景下,原来英伟达⽣态的作⽤就⼤幅度减少了。因为对于⼀个专⽤芯⽚来讲,跟CUDA没有什么关系,它跟 CUDA是不绑定的。或者说,这个芯⽚在设计的时候,就已经考虑到怎么建⽴这个⽣态了。
有点复杂,但 anyway,国产 AI 芯⽚替代现在是有个历史性机会的。我们认为,未来⼀年之内,我们能够看到有⼀个事情被验证:国产芯⽚的⽣态完全没有问题。之前认为是有问题的,认为是⽤不起来、不好⽤,但是未来我觉得⼀年之内,我们能够扭转这个认知,或者会⽤事实来扭转这些。
国产 AI 芯⽚的硬件和⽣态都没有问题,唯⼀有问题的是产能不够。国产卡适配这⼀点,没有障碍,英伟达挡不住。如果是在⼀个正常的商业环境⾥⾯,我能买到英伟达的卡,那么国产替代是⽐较难的;但是在英伟达的卡买不到的情况下,所有⼈都迫不得已,都要去做国产芯⽚。
在这个背景下,国产卡的适配是没有任何障碍的。国产卡建⽴起跟英伟达⼀样、甚⾄⽐英伟达还好的⽣态,我觉得没有障碍,但还需要时间。
我们现在主要是跟华为有合作。华为他们⾃⼰适配,但我们⾃⼰会参与这个⽣态,会深⼊参与到华为这个⾥⾯去。华为的问题还是产能不⾜。像华为给我们的⼤概是⼀万六千张卡的产能,互联⽹⼤⼚可能是⼗⼏万张,我们⼀万多张,我觉得这个⽐例也是⽐较……但这已经可能是华为就这么多产能了。
所以我们也没法指望在华为上⾯训后⾯那个更⼤的模型,或者说训练⼏百 B 参数激活的模型,有时就有说在今年。但是明年、后年说不定是有机会的。
华为卡适配,我们主要做的⼯作是把它的⾼级语⾔编译器做好,把 TileLang 做好。把TileLang 做好之后,问题可能就迎刃⽽解了。这个事情说起来⽐较复杂,但是我们在做,做完之后再来解释会清晰⽐较多。
你可以理解,V3 训练的时候,它⽤的还是英伟达的卡,但是已经不⽤英伟达的⽣态了。V3 ⽤英伟达的卡,但是没有⽤英伟达的⽣态,⽽是我们先写⼀个⾼级编译器叫TileLang,然后基于 TileLang 的⽣态来完成其他所有的事情,就已经⼏乎不依赖英伟达的⽣态了。
只要我把这⼀套东⻄,把这个过程重新在华为卡上做⼀遍,那么就完成了。我觉得这⾥可能是⼀个历史性的使命,即可以完全扭转之前⼤家对国产卡⽣态不好的认知。现在有些天时地利基本上都全了,就差时间。我觉得⼀年之内,应该会有很多⼈在上⾯都有,或者说都明⽩这问题算是解决了,剩下就是产能的问题。
我对国产算⼒是⽐较乐观的。我觉得在这⼀点上,英伟达是在掘⾃⼰的坟墓。华为的超节点,华为的 950 超节点,在性能和价格上可以完全平替英伟达的 GB200、GB300。价格肯定要贵,但贵得有限。价格贵百分之五⼗、百分之⼀百,贵百分之⼀百⽆所谓,贵百分之两百都⽆所谓。
⽐如贵百分之⼀百,我觉得已经可以认为在价格上可以平替了。在任务上也是可以平替的,所有 GB300 能做的任务,华为超节点都能做,延时什么都⼀样。唯⼀的代价是,四张华为卡顶⼀张英伟达的卡,同时落后两年。
四张顶⼀张这个可以理解。落后两年的意思是,四张华为 950 能顶⼀张 GB300。落后两年是时间上落后两年。华为 950 超节点是今年 Q3 还是 Q4 的货,英伟达 GB200 是两年前 Q3 的货,差两年。
英伟达今年 Q3 可能已经有新⼀代了。所以我们跟美国在芯⽚上的差距,我认为⽣态上以后不会再有差距,但是在芯⽚上是四倍加两年。
还有问题是,我们会不会向上游进⾏垂直整合?我希望不要。所以有个问题是,我们是不是会往上游应⽤进⾏垂直整合?我们希望不⽤这个,我希望是其他⼈来做这个事情。我不希望我把所有东⻄都吃了,我只要吃⼀块就好,我只要吃我最擅⻓那⼀块,或者我觉得我们⾃⼰认为最核⼼那⼀块,然后跟⽤户
[02:08:18]
直接相关那⼀块,我觉得可能对于我们的很多产业伙伴来讲,他们⽐我们更关注类似……应该是别⼈的意义,不应该我把它诠释了。
未来我们会不会⾃建⼤型的集群?我觉得⾃建⼤型的集群是肯定要的,我们⾃⼰⼀直在做这个事情,我们所有的集群都是⾃⼰建的。但是未来要不要⾃研芯⽚,我觉得取决于这⾥的收益有多⼤,取决于收益有多⼤。
Tesla、培育……这个事情。假如说你是运营发电⼚的,你并不⼀定需要去造发电机,对不对?发电设备可以是别⼈造的,只要它的价格合理,你为什么要⾃⼰造?
所以,我希望不⽤去做芯⽚。我希望能够以合理的价格买到芯⽚,这样我就不⽤去做芯⽚。我觉得这个很有可能是这样的,就是最近英伟达芯⽚的利润,不⻅得是可以……虽然……
我们希望只做⼀块。我觉得 AI 这个事情很⼤,并不需要我……我只做⼀块。如果聚焦,并且我认为这⾥的⽣意利益已经⾜够⼤,就如果是 AI 时代会产⽣很多家万亿级别的公司,我觉得我们是其中⼀家。
我们⼀直做其中⼀⼩块,我们是其中⼀家已经没有什么问题了,并不需要我……我并不是信⼼勃勃要做地⽅。我觉得最可能是⽐较难变,且你真的想做别的话,你还是会有更多的主意,这个会……这是我们的态度。
譬如说,⾄少在 To B、To C 这两个业务上,⽬前能看到的,真的想做 To C 闭环的,反⽽我们做得好;真的想做 To B 闭环的,说不定也没有我们做得好。你想要得越多……
然后还有,To B 这个可以多说⼏句。To B 业务的上限应该还是需求,在现在这⼀代AGI、AI 技术的背景下,To B 的需求应该是有限的。它会快速增⻓,但并不是⼀个⽆穷⼤的事情,最终还是受制于需求,不是算⼒。
在当前技术的条件下,收⼊有多⼤,最终还是取决于需求。因为你这样想,我⼗个⽉就能收回成本,我肯定是如果有去处,我⼀块买,是因为没有那么多事情。对,需求应该会越来越⼤,如果随着技术持续有突破,这个需求会越来越⼤。
多模态布局,我们⼀直在做。对产品来讲,它很重要;对 C 端⽤户产品来讲,它很重要。但是对智能的上限,它是⼀个组件,它不是主线本⾝。
但是它作为⼀个组件,多模态我们肯定会做,⽽且我们也在做。我们应该会上相关的模型,就是我们 V4、V4 的后续版本会⽀持原⽣的多模态。但是我们对多模态、对智能来讲,它是个组件,我们不把它当作智能本⾝,它的主线跟搜索⼀样。
搜索也是⼀个组件,多模态也可以,我们的理解它也是⼀个组件。Scaling,我们是信Scaling,肯定是规模越⼤,效果越好,能够解锁更多的功能。阻⽌我们 Scaling 的其实就是算⼒,并不是我们不想 Scaling,是我们没有那么多的算⼒去做这个 Scaling。
我们没有触摸到这个上限在哪⾥。我们训练这么⼤的模型,并不是因为我觉得这么⼤的模型就够了,⽽是我刚好有这么多资源。我是按照我的资源来算,我能够接受、能够训练的模型是多⼤,是这样算出来的,并不是这个模型就够了。
⽬前来看,模型收益还是⾮常明显的。我们还没有机会碰到这个 Scaling 的墙,这离我们还很远。硅⾕在说 Scaling 到头的时候,那是对硅⾕来说;对中国⼈来讲,我们离那个还很远,我们根本就没有 Scaling 到那个程度。
这个 Scaling 包括数据的 Scaling、模型规模的 Scaling,然后训练成本。我们离探索这个Scaling 的上限还⽐较远,就是没有那么多算⼒。但我们也会不遗余⼒地去推进这个Scaling 的上限。
包括我们融资完之后,我们有更多的算⼒,可能训练更⼤的模型。时间内买到,就在越短时间内买到;如果能半年精⼒全花完,那么这是最好的,实际上做不到。
下⼀代模型的核⼼能⼒,我觉得它必须要有持续学习的能⼒,它才能叫下⼀代模型。在那之前,我们能做的就是成本,然后效果做得更好,速度做得更快。但是要有⼤突破,它应该是具备持续学习的。
然后还有⼀个问题,就是为什么好像我们特别在乎这个模型的计算效率?因为我确实发现,不是所有⼈都很在乎这个模型的效率。⼀个商业化公司来讲,没有动⼒去追求模型的效率,因为模型效率⾼⼀点……
所以,它没有那么⼤的动⼒去追求模型效率要⾮常⾼。所以⼏个创业公司,他们⾃⼰并不会……你没有听到他们说低成本是他们追求的东⻄,因为那个不符合他们的利益。低成本了,你还赚什么钱?低成本了,你就收不到什么钱了。
相反,这是我们愿景的⼀部分。或者说,我们的愿景,我们的同学在乎这个成本,因为我们的同学都是普通⼈,他知道⽤这个都是要花钱的。他能够有这个同理⼼:别⼈要花钱来⽤,那么别⼈如果便宜⼀点,别⼈能够接受的程度会更⾼。
所以我们有很多同学还是希望我们能够把成本做到更低。但是如果你从商业⾓度讲的话,其实不会这么考虑。从商业来讲……
[02:21:31]
从成本或者从商业⾓度讲,这不是第⼀优先级。
对于不管是创业公司来讲,还是⼤公司来讲,这个服务成本根本就不⾼。但是我觉得我们希望它是⽐较轻的,我希望它是⼀个负担得起的,特别是在中国算⼒紧缺的这样的背景下,是负担得起的,能在国产卡上⽤的。
我觉得低成本⾸先是⼀个结果。我们的模型确实⼀直在模型架构上往⼀个更低成本的⽅向⾛,这跟我们的愿景有关系。我们还有很多在算法上的⽅法,成本还可以往下⾛。
成本往下⾛还有⼀个原因是,成本越低,我就越能训练更⼤的模型,我就越能承担起更⼤的模型。在同样算⼒上,在算⼒有限的情况下,如果我的计算效率更⾼,我就能够承担起更⼤的模型。
对⼤公司来讲,他不⼀定会这么考虑。对⼤公司来讲,资源是可以加的,可以通过加资源来解决。但是我们会优先考虑成本效率。
数据类模型的价值,数据这个范围⽐较⼴,数据应该⼏乎就等于模型的⼀半。为什么我会觉得,如果我想要那个,或者假如设 AI 能够占 GDP 的百分之⼆⼗,然后如果说我想要在这⾥⾯占百分之五,绝对⾏不通。因为我肯定会被另外⼀个⼈打败,如果另外⼀个⼈说我只要占百分之⼀,那么肯定就会被他打败。
如果说我的⽬标是,我要占 AI、全⼈类 GDP 的百分之五,理论上算这个账还是成⽴的。你看 OpenAI,他算这个账好像是能算得过来的,理论上是没问题的。但是他有个问题,他会被另外⼀个愿意只占百分之⼀的⼈打败。
因为另外⼀个⼈说,我做得这么好,但是我只要拿全球 GDP 的百分之⼀就可以了,那么就会把他打败。这时候如果⼜出来另外⼀个⼈,说我只要百分之零点⼀就可以了,那么⼜会把前⾯的⼈给打败。
从宏观上来讲,不管这百分之⼏是从哪⾥拿,彼此之间没有区别,都是⼀样。拿得多的⼈会被拿得少的⼈打败。甚⾄你还不⽤真的拿得多,愿景如果是拿得多的话,你就会被愿景是拿得少的⼈给打败。
其实⼤家都没有拿到钱,然后只是⼀个愿景。你愿景是拿得多,你就先输了,你就会⾯临着更⼤的困难。这个世界就是这样。
OpenAI 从⼀开始觉得他真的能够垄断这个世界,但是实际上他会遇到很多很多挑战者。他会遇到挑战,他就不会那么轻松。美国会遇到过的挑战,那么他在未来可能还会遇到中国的挑战,因为中国⼈愿意拿得更少,就可以给你提供这个服务。
在中国,也会有⼈愿意拿得更少⼀点。但最后这⾥会有个平衡,因为你拿得太少之后,公司商业逻辑就不成⽴,就活不下去了。所以你拿得太少了,你活不下去;你拿太多了,你会被拿得少的⼈打败。
所以对我们来讲,我们并不是利润要拿最多的钱,或者说算收益最⼤化的定价,⽽是只赚⼀个合理的收益。这是⼀个解释。
我是相信这个事的,我并不是去为这个事情找理由,因为没必要找理由。我本来就这么做的,我这么做肯定是有理由的。这个理由可能不是⾮常惯常,但是我觉得公司本来就不惯常。
我们公司的管理其实是两条线:⼀条线是从上到下,⼀条是从下到上。从下⽽上,就是每个⼈⾃⼰想做什么,⾃⼰做,没有⼈管他,没有 KPI。
从上到下,就是正式的,我们要集体做⼀个什么事情,需要全公司的⼈⼀起来配合。⽐如说我们要发 V4,那么就得分⼯,每个⼈得做⼀部分。那个是从上到下,然后从上到下这个我们叫做正式。
⼀般我们希望这正式不要占⽤员⼯所有时间的⼀半,就正式不要超过⼀半。他还有⼀半的时间,是不被安排的,他想做什么就做什么。这是⼀个研究的范围,让他可以⾃⼰去探索,按照他觉得什么重要,他去探索什么,没有前置的要求。
只要公司能够⽀持,公司算⼒能够⽀持他做,或者说他不需要算⼒,他需要做得很少,那么他根本就不⽤来协调。所以我们现在是这样的⼀个组织⽅式。
有些⼈觉得我们是从上⽽下的,有些⼈觉得我们是从下⽽上的,我觉得两个都对。我的⼀个标准是,正式最好不要超过⼀半。
我们⼀般也不太加班。加班有两个原因。第⼀个是,做研究是需要⼀个⽐较松弛的环境。你如果逼得很紧,就没法做研究。因为既然就是要你⾃⼰有这个兴趣,你⾃⼰平时要去想这些问题,所以得是在⼀个⽐较松弛的环境⾥,才有可能能够探索。这是⼀个出于研究⽂化的需要。
第⼆个是,我们⾮常聚焦。我们⾮常聚焦,就意味着我们要做的事情很少。那我就没那么多事情要做,我就不需要加班。
这个跟前⾯的克制是⼀脉相承的。因为我克制,所以很多时候我就不做了。那么我要做的事情少了,每个⼈分到的⼯作就少了。你看到我们的产品很多都不完善的,我们也没有去补它。
这也是我们的⼀种⽂化。
OK,因为问题很多,我⼤部分都扫了⼀遍。⼤家还有什么问题,⼤家提问。
请各位投资⼈⾃由开⻨交流吧。我稍微提醒⼀下,梁⽂锋讲了很多⼀些⽐较敏感的信息,请⼤家千万不要外传⼀些数字或⼀些情况,包括卡量什么的。同时也千万不要录屏对外做分享。很感谢各位,请各位有问题的话,⾃由开⻨交流。
[02:34:59]
杨哥,您能分享更多关于持续学习什么时候带来突破的时间线吗?包括如果实现持续学习,还需要哪些架构、算法的创新,以及其他关键要素?
⼈少,需要研究。现在全世界都在研究这个问题。或者说,对投资⼈来讲,现在投资⼈看到的最多的是 AGENT;但对于我们这些研究的⼈来讲,现在看到更多的是学习,以及怎么解决学习这个问题。
其实学习可能不是⼀项技术,它是⼀个问题。怎么解决这个问题,可能有很多种技术,不是⼀项技术,它不是⼀个东⻄,会是很多东⻄。或者说,AGI 是由很多东⻄组成的,需要模型,然后还需要很多其他东⻄。
其实它也是⼀个⼯程和算法问题。这个问题⽐较专业,但有很多⽅法,也有很多研究。
梁总,谢谢。⾮常感谢今天这个机会。我⾸先⾮常想回应和感激⼀下,您最开始说的让我⾮常感动,也给我们很多启发。您提到,这个团队带着最⼤的善意,希望能够在这个⾏业⾥⾯,对这个社会、⼈类智能的发展有所推动,做⼀点点贡献。
并且在这个⾥⾯,是带着这种使命感和愿景。我觉得这跟我们所服务公司的企业⽂化⾮常相近,就是“修⼰达⼈”。我深刻地理解了为什么您会带领团队做开源的事情。
我会形象地感觉,像我们去做⼀个榕树这样的⼩⻦天堂⽣态,利万物⽽不争,但这样它就会被⼤家接纳,万物共⽣共存,最终就会⽆处不在。所以,我们会以这次投资,同样表达我们对这个使命和愿景的认可、⽀持和尊重。
同时,我们也希望能够在这个产业未来,我们所擅⻓的⼀些领域等,去贡献⼀些⼒量。在这块也想跟您继续请教和探讨。⽐如在未来⽣态的共建当中,现在开源之后,这个⾏业⾥有多少伙伴、⼈才、团队,能够⽐较好地复现咱们开源⽬前的⼀些模型和成果?
未来在下⼀步想让这个⽣态进⼀步发展的时候,您感觉在哪⼏个⽅⾯,需要更多⾼质量的⼈才能够衔接到我们的模型,把它复现?还是说现在 GPU 的算⼒相对有⼀些稀缺?⼤家未来会不会是⼀种模型矩阵的⽅式?
⽐如咱们把⼤模型基模做得越来越好,各⾏各业的伙伴和团队去做⼀些模型矩阵⾥⾯的垂直⾏业模型,或者⼀些应⽤模型。这块⽬前的发展怎么样?未来⼀步⼀步,两年、三年,您感觉会⻓成⼀个什么样的⽣态?
这是我第⼀个想跟您请教的。第⼆个,您刚才也跟很多伙伴分享了很多关于 AI 硬件⽅⾯的观察。像 AI 全球⼤公司,可能单体都会做千亿美元级别的投⼊,中国⽬前看起来在硬件算⼒上有些短板。
您感觉这个多⻓时间可以解决,并⽀撑咱们 AI 的发展,让算⼒和硬件短板不给 AGI 拖后腿?您觉得这是不是中国⼈未来使命必达,我们肯定能做出来,只是时间和资⾦投⼊的问题?
但同时,可能它会是两⽅⾯的。⼀⽅⾯,模型的进步会让模型智能化的提升,导致单⼀任务或者某些智能化单体对硬件、对算⼒的消耗逐渐递减,不再需要那么⼤算⼒的运算,因为模型的进步会让它巧算。我不知道我理解得对不对。
另外⼀⽅⾯,硬件的技术进步会让算⼒的算能效能更强⼤。这会不会是两边相向⽽⾏的路径?现在如果是在这个时点,⽤现在的 960 也好,还是 H200 也好,去做千亿美元级别的算⼒投⼊,您刚才提到说您是给它按三年摊销,那它的实际⽣命周期,您觉得技术迭代是四五年?
或者直⽩地说,会不会现在算⼒中⼼按现在的卡去建了万卡集群,可能三年之后它其实就是相对不那么先进的算⼒了?会不会有现阶段是 under construction、不够⽤,三年之后变成相对不那么优质的算⼒有冗余的情况?我不知道会不会有这样⼀种现象。以上两个问
题请教您,谢谢。
谢谢。第⼀个问题是⽣态的问题。
我们现在觉得,可能每个企业都⾯临的问题是⼈才不够。但我觉得这个⼈才短缺会是阶段性的。我们在每个⾏业发展的初期,⼈才都是不够的。
包括以前做⽹站,刚开始做⽹站的时候,做⽹站的⼈很少,⼈才很缺。后来互联⽹要做服务端,⼈才也是很缺的。但是这种⼈才短缺都⾮常快会被解决,也就两三年,因为会培养出⼤量的⼈。
AI ⼈才的短缺也是阶段性的,并且我们已经看到,⼤幅度被缓解了。因为 AI ⼈真的不缺,每个公司很快会把⼈培养出来,培养⼈是很快的。所以,AI 这个⾏业整体上,不管是⽣态、模型公司还是什么,⼈才都不缺。
⼈才缺肯定是⼀个短期现象。历史上从来没有出现过⻓期缺某⼀类⼈的情况。我还记得⼗⼏年前说⻜⾏员很缺,⻜⾏员的培养周期很⻓,但也很快被解决了。
所以⼤家不⽤担⼼缺⼈才的问题。以及国内现在做模型的公司有点太多了,还是太多了。美国可能就三家,中国做基模的东⻄太多了。
最终⼀定是不需要那么多⼈去做基模的,⼀定会收敛。所以资源也是⽐较分散,某种程度上也⽐较浪费。就先于
[02:44:00]
每⼀家都要做同样的事情,但美国只要三家做,资源只集中在这三家。中国资源分得很散,每⼀家拿到的资源就更少。我觉得这个肯定是会收敛的,⼀定会,但这需要过程,最终⼀定会收敛。
不需要那么多家,因为现在可能⼤家觉得做这个事情的利润率⾮常⾼,所以⼀定要⾃⼰做。但当他发现这个事情可能没有那么⾼利润的时候,可能就不做了。最近肯定是没有那么⾼利润的,我不相信有那么⾼利润,因为这不符合客观规律。
这意味着我们是处在⼀个阶段上:如果有⼀个⾮常⾼的利润率,这⼀定不符合客观规律。我们应该是⼀个合理的利润。所以这是产业的⼀个现状,我觉得肯定会收敛。
就是⼤家做⼤模型的那⼀部分,其中不要说某⼀家独占,说“我要拿⾛全部利润”,这个肯定不⾏。如果说每⼀家都只拿合理的利润,那么其实不需要那么多⼈去做⼤模型。中国最后有个三四家竞争,竞争就很充分了,价格绝对已经够打价格战了。
⼤模型可能不说两家⼤公司、两家⼩公司,可能就已经⽐较够了。
⾄于⽣态上的,我没有什么太多的想法。我们希望能够扶持更多的⼈,但是我们并没有那么多的精⼒。我们是有这个意愿,并且不会有利益冲突,但是我们有没有去做是另外⼀回事。
但⾄少这⾥边是没有利益冲突的,我们是希望合作共赢的。⾸先,我绝对不认为⼤模型公司可以拿⾛⼤部分利润,这个不可能,因为这么多家⼤模型公司,现在差距不⽤那么⼤。
差距只有两个东⻄:⼀个是时间,⼀个是成本。所以不⾄于哪⼀家有暴利,我觉得不⾄于有暴利。成本控制得好的⼈就多赚⼀点,成本控制得差的⼈就少赚⼀点,仅仅此⽽已。
是不是有回答了?第⼀个问题是不是回答完了?
⼤家能……你相信以后肯定是有很多⼈可以……未来其实会……⼤家数据应⽤这些的循环迭代……
现在可以听到吗?谢谢。对,感谢您的回答,也⾮常深刻地理解和尊重您的这种⾏业⾥⾯的⽣态战略定位。⽐如说数据这⼀块,现在公开的数据,相信模型公司都已经可以有渠道获取,这个⽅法应该都不成问题,只是时间和成本的问题。
那么后续⽐如说将到真正到 AGI 的时候,有可能⼤家⼀个设想或者理想的状态是,模型可以⾃我迭代、⾃我学习,就是⾃⼰训练⾃⼰。那么这⼀块的话,⽬前这个数据,您感觉仿真数据是不是可以⽤起来,还是说真实数据的质量最⾼?
如果说还是需要来⾃于真实数据,那会不会是限制这个 AI 的智能还是在⼈类的过往……这个层⾯,因为它依赖的是⼈类真正曾经有过的真实数据?还是说可以突破这个上限,通过模拟数据、仿真数据、创造数据等等的⽅式,让这个模型能⼒去超越⼈类过往的所有真实……
我觉得是能超越的。我觉得有两点超越的,⽐如说围棋,AlphaGo 他下了⼀⼿⼈类从来没有⻅到过的棋。就是说,他肯定是在⼀定的范围内超越⼈类的。
但是他可能也有上限,他可能也是有局限性。但是这个局限性我们现在看不到。我们认为,所以笼统地认为,它是可以基于⼈类已经有的、我们已经能说出来的知识上,予以超越的。
那这块后续是靠真实数据还是仿真数据?它会 work 吗?
不可能就有很多⽅法。
好的,谢谢。也占⽤您的时间了,也想继续请教刚才关于 AI Infra 的问题。
第⼆个问题是什么?有点……
好了,我简单快速地重复⼀下。就是想请教,对于 AI Infra 这⼀块,未来相信算⼒现在⼤家都是千亿美元级别地在投⼊。那么这块的话,有可能我们相信中国⼈未来在硬件上是使命必达,有⼀天可能会有⾼效率的算⼒,但有可能这个在实践的过程当中,⽬前还是⼀个掣肘。
那么未来会不会是两⽅⾯向下⽽⾏?⼀⽅⾯是模型的能⼒迭代之后,它其实对于算⼒从硬算变成巧算,所以单位模型或者任务对算⼒的要求和消耗会逐步地边际降低。另⼀⽅⾯,⽐如说硬件像卡的能⼒提升,会让迭代速度越来越快,单卡效率提升。
那么这个在过程当中是怎么样的⼀个现象?会不会是说,现在去建了万卡集群,去买了H200 或者 960,但是过个两三年,它就变成了⼀个相对没有那么优质的算⼒,相对⼜变成了⼀个陈旧的器件?
英伟达的卡基本上你可以按照五年折旧。华为的卡最多按三年折旧吧。华为 950 今年能⽤还挺好的,明年⽤我觉得还可以,后⾯再⽤我觉得可能就真的太费电了。
华为卡⽣命周期肯定是会短⼀点,因为它本来就已经⽐英伟达晚两年了。但是我觉得差距没那么⼤。
如果说 B200 现在能买到多少,我觉得都划算。假如说对于腾讯来讲,阿⾥巴巴能买到的话,再看量;如果合理价格能买到,肯定都是划算的。但不是⼀个算成本的时候,相信买不到。
明⽩。我们算⼒落后,这是⼀个事实。这个事实通过三⽅⾯来消解。第⼀⽅⾯是我们承受模型落后,我们只能够⽤⽐他们更⼩的模型,⼩多少问题就是训练。我们要承受⼀定的模型落后,以及模型的尺⼨更⼩。
这落后有⼀个好处,落后意味着你有更多的时间,你有⼀定的技术,然后这样的话你就可以⽤巧妙的⽅法
[02:53:59]
谢谢。
所以我们跟美国的差距可能是落后美国 12 个⽉,落后美国可能 12 到 18 个⽉,或者说 6到 12 个⽉。反正简单说,就是落后美国两年,然后只⽤美国⼆⼗分之⼀的算⼒把这个事情做出来。
这个叙事就是落后⼀到两年,但是只⽤它⼆⼗分之⼀的算⼒。那么未来我们要把这个叙事改写,就是我们⽤它⼏分之⼀的算⼒,但是把这个时间缩得更短,缩到 6 个⽉、3 个⽉,我觉得这是⼀个⽬标。
以及我们甚⾄可以在某⼀些⽅⾯超越他们。但是在总体算⼒还是有数量级差距的情况下,全⾯超越是不现实的;但是在某⼀些重点、有取舍的地⽅,我们有⼀些地⽅超越可能是可以的。
明⽩,谢谢梁总。信⼼满满,⼀起努⼒。时间也留给其他的伙伴,谢谢。
感谢刚才的分享。我这边有两个快速的技术问题。在刚才聊技术路线当中,提到了我们这⼀阶段要解决的核⼼问题是持续学习,也是⽬前国外研究的热点,叫 RecursiveImprovement。想请教⼀下,⽬前来看,从技术上最⼤的难点是什么?从您的视⾓来看,这个什么时候可以解决?这是第⼀个问题。
第⼆个问题,同时您刚才提到,先解决持续学习,然后再去做智能。我也想理解⼀下,您这么提背后的技术根源是什么?是不是意味着解决完持续学习问题以后,DeepSeek 后续也会做通⽤智能?这两个问题请教⼀下。
技术问题其实解释起来有点……它的难点在于,我们现在还没有找到⾮常 work 的⽅法。全世界都还没有找到好的⽅法,⼤家都在摸索。所以现在还在摸索阶段,就是不知道谁能摸到下⼀个解决这个问题的⽅法。
现在还在探索阶段。我们有很多思路,有很多现在看起来有前途的⼀些想法,但是都还没有做通。对,这是第⼀个。
第⼆个是,现在我们内部⽐较看重这样⼀个叙事:训练我们的下⼀版模型,我们希望它能够帮助我们⾃⼰的开发。它能够提升 DeepSeek 的效率,我们的模型最⾸先是提⾼DeepSeek ⾃⼰的⼯作效率,让我们开发下⼀版模型的时候,它能够提供更多的帮助。
或者说简单⼀点,我们做的模型,第⼀⽬标不是⼤家⽤得好⽤,⽽是我们⾃⼰⽤得好⽤。⾸先是对我们⾃⼰有⽤。对我们⾃⼰有⽤之后,我在开发下⼀版模型的时候就会更快。
我们内部很多⼈的想法是这样的:⾸先要对我们⾃⼰有⽤,⾸先是给我们⾃⼰⽤。然后这是实现 AGI 最快的⽅法。当我们⾃⼰好⽤,那意味着可能别⼈也好⽤,但是⾸先得保证我们⾃⼰好⽤。
这个叙事有点奇怪,但是确实很多⼈就是这么想的。⽽不是说⽤户⽤得好⽤,我是希望对我们⾃⼰帮助更⼤,这样我们可以实现 AGI,会快很多。所以这个叙事的逻辑是,来帮助我们实现 AGI。
但⾸先是帮助我们实现。我们实现 AGI 需要这个帮助。现在是⾮常确定,我们确实需要⼈⼯智能来帮助我们实现 AGI。虽然说它还不是⾃主地⼯作,它还是只是跟⼈搭配,但是已经很有⽤了。
第⼆个问题,就是刚才提到了,先解决持续学习的问题,然后再进⼊通⽤智能。这是您对后续的⼀个预期吗?想理解⼀下这背后的技术根源是什么?为什么先要解决持续学习,然后再进⼊通⽤智能?您对这块后续的理解。
因为解决持续学习这个问题,可以⼤⼤加快我们的研发进度。如果我先解决了持续学习这个问题,那么通⽤智能这个问题就不在话下了。我有了 AI 的辅助,如果 AI 能够持续学习,它的能⼒应该是⾮常强的。
现在的 Agent 的能⼒受限,是因为它不能持续学习,它不能有效地持续学习。如果说能够先把持续学习做完,那 AI 的能⼒是⾮常强的,它能够⾮常⼤地提升我们⾃⼰研究的效率。
持续学习先做出来,通⽤智能可能就很容易了,⽤它来做就很容易。所以我说这是⼀个我们⽐较希望看到的结果,我们⽐较省⼒,我们就轻松。否则现在你要去⼈⼯做通⽤智能,它是⼀个⽐较累、⽐较苦,是⼀个数据密集、⼈⼒密集的事情,性价⽐也不⾼。
感谢分享。
⼩问题,线上的问题你看⼀下聊天群。觉得 AGI 还需要多久?国内硬件在这个时间能追上吗?
在 Zoom 会议的那个聊天窗⼝⾥⾯。
好,这个我看了。
华为 950,现在华为是给我们⼀万六千卡,这应该是可以公开说的。应该是⽐互联⽹⼤⼚少⼀个数量级。华为也只能给我们这么多,因为这个价格也不便宜。
互联⽹⼤⼚的追求会更⼤,对互联⽹⼤⼚来讲,它更需要。对我们来讲,我们可以买⼀些不合规的卡。所以我们买华为 950 的⽬的,还是希望帮华为把这个⽣态做好。
⼀万六千卡的华为 950,只相当于四千卡的 B 系列。所以说不是⼀个很⼤的量,意义不是很⼤。不够训⼀个下⼀代的模型,它只够训我们现在这⼀代模型,不够训下⼀代模型。但是可以让华为把这个先做好,就是关于华为 950。
然后,AGI 还需要多久?国内硬件在这个时间能追上吗?
我觉得在 AI 这个事业上⾯,在 AI 这个事情上,应该国内⼀两年是能够做到跟国外差不多的,或者可能今年就能做到平替国外的模型。在 AI 这个事情上,就现在的⼀个⽅式、现在这个范式,不是很难的事情,所以今年应该就能做到的。但它还不是 AGI。
[03:05:48]
我⾄少觉得,它得能够持续学习吧。
国产硬件在这个时间能追上吗?我觉得国产⽅⾯可能需要⼀个⼏年的时间。国内⾸先得解决⽣态的问题,因为⽣态是⼀个信⼼的问题。解决⽣态的问题,然后再解决产能的问题,我觉得应该是能够逐步解决的。
我不太相信未来五年之后,我们还卡在产能的问题上。现在肯定是卡在产能问题上,今年、明年、后年,我觉得可能都还是卡在产能问题上,但五年之后,我觉得可能不⼀定,我还是⽐较乐观的。
然后第⼆个问题是,思考未来的组织架构,对⼈员的规划规模。⾸先,我们之前的组织架构是⾮常分散的,因为没有组织架构。但是我们⼈在进⼀步扩⼤之后,这些肯定是需要做出⼀些改变的。
现在只能说,这⾥会需要做很多改变,但现在很难⼀下⼦全部表达出来。最后应该还是要分不同的部门,应该有些部门是我们需要建⽴起⽐较严谨的层级结构的。另外⼀些部门,可能还是会维持⼀个⽐较松散、⽐较扁平的结构。
随着⼈员的增加,我们会做这个调整。应该是我们⻢上就得做这个调整,因为我已经在做这个调整。已经不做这个调整的话,很多事情是没法推进下去的。确实有很多部门,是应该有组织架构的。
然后⼤家还有问题是,CV 是先于它的哪个版本是吧?我觉得我们现在,线上发了这个GCV4 这个版本,还是⽐较粗糙的,然后能⼒⽅⾯还很多都需要时间。
我们⼀般,对我来讲,⼀个⽐较舒适的发版节奏,⼤概是两三个⽉发⼀版。上次发版可能是四⽉底,那么下次发版可能是六⽉底,⼤概是这样⼦。如果没有意外的话,应该还是会⼀版⽐⼀版好的。
在 50B 激活的这个尺度上⾯,我感觉最终我们跟现在的这波开源不会有太⼤差别。就在推理速度跟效果上,我感觉可能就不会有太⼤的差别。
但是跟它那个⼤尺⼨的模型,就它⼀个没公开的模型,应该差距还是⽐较⼤的。那个差距应该是,我们这个激活参数应该是做不到的,这就肯定得是⼀个更⼤尺⼨的模型,可能⽐如说是 150B。
那么 150B,我觉得按照我们现在训练的进度,今年,乐观的是今年年底可以开始去训练,⾄少是明年四……差距还是⽐较⼤的。对,这是跟 OCE 的差距。
你好,我其实有⼀个问题,就是经常您说到这个 AGI,它实现的过程是⼀个渐进式的过程,⽽不是会有⼀个突变。所以我可以理解,这是⼀个没有临界点的过程吗?
它没有临界点,但是它是⾮线性的。我们现在⽐较相信⼀个叙事是,AI 可以加速 AI 的研究,AI 可以加速 AI 的研究。就是说,它不是线性的,因为你可以⽤ AI 来加速你⾃⼰的研究,所以它到后⾯可能是⾮线性的。
明⽩。所以当下您的这个,我理解前⾯的结论可能就是,语⾔模型继续 scaling 是够的,是⾜够的,做到这个状态。
只能说语⾔模型的 scaling,我现在没有看到有上限。我们现在的智⼒⽔平,或造成美国的智⼒⽔平,都没有看到上限。
明⽩。因为我⾮常好奇,就是你说,对美国来讲,800B 激活这个模型,说⽐它能训练起,但它也⽤不起来,所以它只能训练出来,它也很难拿出来给⼤家⽤了,因为确实有点贵。
我之前其实很好奇的⼀点就是,⼈类其实拥有语⾔能⼒就是近⼗万年的事情,然后前⾯可能进化了三⼗七亿年。但在训练 AI 这个事情上,可能是可以,你说那个顺序是可以反过来的,但最终可能还是会进⼊到所谓,也不⼀定叫世界的模型,还是要进⼊到物理模型或者具⾝的那部分,是吧?就是在这个上限之后。
对,我觉得具⾝肯定还是要进⼊,最终具⾝。所以对我们公司来讲,⾃然⽽⾔,可能终点都是具⾝。因为对⼀个正常⼈来讲,他的需求并不是电脑,对不对?因为正常的⼈,他吃喝玩乐、⾐⾷住⾏,他不需要电脑。
他需要的是,所以他还是需要具⾝智能来解决具体⼈⼒的需求。如果说⽬标是解约⼈⼒需求的话,所以具⾝我觉得就是绕不过去的。
明⽩。所以阶段性地讲,假如说到达类似,也不⼀定是临界点,就是可以⾃进化、可以⽐较好的⾃进化,或者接近这个与 SV 的这个上升的到那个时间点上,我很好奇会希望这个状态的 AI 落地的第⼀个让是……
可能跟现在不⼀样。我们是希望它能够,就是直接假如说没有具⾝,那么我们对 AGI 的定义,或者我们希望 AGI 能做什么呢?它能帮我迭代下⼀版模型,能帮我迭代下⼀版模型⼀样。
然后如果有了具⾝之后,我们希望它做的也是,让它来迭代下⼀版的具⾝,它来做下⼀版机器⼈。
我还是很好奇⼀点,就是因为我看之前 DeepSeek 的采访等等,应该是在⼀些重要的⽅向的选择和研究的选择上⾯,品位和直觉是很重要的,⽽不是简单的⼯程优化。那如果之后 AI 可以⾃进化的话,这个品位、taste、直觉这些东⻄还重要,或者说重要的会是什么?
AI 现在不缺品位和直觉,它缺的是持续学习的能⼒。AI 的品位和直觉没有问题。你让它写个⽂章,它的品位和直觉,我觉得没有什么问题。
前⾯还有⼏个问题,我看⼀下那个问题。我看屏幕上谈了⼏个问题,但是我这边看不到了。
梁总,我屏幕上留了个问题,我给您再念⼀下。其实是想请教⼀下,continuouslearning,就是持续学习,您也提到,很多研究员也提到是⼀个还没解决的研究问题。然后那个 coding agent,尤其是追上 MILES,就是
[03:17:47]
Scaling 到这个 Offi ce ⽔平、MIS ⽔平是⼀个⽐较确定的⽬标。对于⼀个还没解决的研究⽬标和⼀个⽐较确定的 Scaling ⽬标,您认为应该怎么分配研究资源,尤其是研究员这块的⼈才资源,怎么样才能达到最好的平衡和效果?
模型 Offi ce 是⼀个⽐较确定的⽬标,但是模型 MIS,我觉得还不好说是确定的,只能说是⼀个⽬标。模型 Offi ce,我觉得应该是⽐较确定的。
CoT 不占资源。做朋友任意研究,他不消耗卡,只需要很少的卡,他需要的是想法;他也不消耗⼈才资源,因为不需要有⼈⼀直在那⾥做。他不是⼀个项⽬,⽽是需要有很多⼈都在那⾥想这个问题。
所以并不需要给它分配什么资源,因为它不需要资源。你要训模型,要做模型、发模型,做模型的效率实验才需要资源。刚才讲的,对⼈、对卡的资源消耗都不多。
所以我们叫这个叫“摸奖”。门槛很低,谁都可以去摸,但是谁能摸出什么来,这个可能我也不知道是看天赋还是看什么。
所以这⾥并不需要我们去分配资源。只是说,我们跟其他公司不⼀样的地⽅,就是我们会花时间去讨论这个问题,会去想这个问题,然后把它当做⼀个重要的事情。
在公司⾥,它是⼀个重要的问题,是⼀个我们会花时间去思考的问题,但是并不需要花很多资源去做。
然后下⾯我还看⼀个问题:⼤模型的幻觉问题⽐较影响⽤户的体验。幻觉问题也是有⼀个⽅法可以解决的,但是这是⼀个⻓命题。幻觉问题可以认为是⼀个可以通过更好的 Post-training 解决的,是⼀个能解、能够改善的问题。
只是⼤家没有花很⼤的⼒⽓去做。或者说,对我来讲,幻觉是⼀个问题,但我们归结可能是产品问题。我们会去解决它,但是不是重点的问题。
前⾯还有⼀个标数据的问题。我们在数据标注⽅⾯,这跟我们的资本投⼊有关。以我们这个资本投⼊的结构,⽀撑不起那么多⾼质量数据标注的成本,因为成本很⾼。
美国数据标注的成本跟中国数据标注成本没有什么区别。中国去标数据并没有成本优势,尤其是标⾼端数据上并不会有成本优势,使得我们很难投⼊去像美国这样标数据。这条路在中国是很难的,因为标数据实在太贵了,不管是我们外标还是我们⾃⼰标,都很难受。
所以现在基本上是两条腿⾛路。并不是说我们完全不能标,⽽是因为标数据有⼀些成本低,有⼀些成本⾼。我们先标成本低的。
所以你也可以认为,现在我们公司有⼀半的⼈在标数据。有⼀半的核⼼研究员,最重要的⼈,有⼀半在标数据。我们就集中在标数据。解决 AI 这个问题,在现在这个阶段靠的就是标数据。你只要看就是⼀个数据。
梁总,谢谢你。你讲得特别地,我们⾮常有感受,⾮常好。感谢你。我请教⼏个问题。
第⼀个问题,您刚才讲,中国的模型⽐美国的模型在效率上肯定是强的。你讲的还有⼀些其他⽅⾯,未来也有可能会⽐美国强。你觉得是哪些⽅⾯,我们在智能或者在其他⽅⾯会⽐美国强?
我觉得在很多体验⽅⾯,有可能我们是能⽐美国做得好的。即不说⾃⼰的体验,⾃⼰的产品体验觉得挺好的,我觉得我们在⽤户体验⽅⾯不⼀定会⽐美国差。
在产品⽅⾯,产品能⼒上不⼀定会⽐美国差。成本应该也会⽐美国低,所以有可能中国还是会有竞争⼒的。
其他⽅⾯,如果说有结构性的优势,我觉得可能也没有。但是在成本和产品这两⽅⾯,我觉得确实是有⼀定的结构性优势的。
成本这个很好理解,是因为他们都不⽤做,所以他们就不发展这个能⼒。他们肯定没有我们重视这个事情。我们可以把它当做⼀个⾮常重要的事情,但对于他们来讲,这个是不重要的。
产品也是,原⽣通过很多公司,产品能⼒还是可以的。所以我觉得这两⽅⾯可能是有结构性优势的。
好的。第⼆个问题,请教您,您刚刚讲到后训练,我们投⼊相对成本⼜⾼,像 Anthropic和 OpenAI 都投⼊巨⼤的⾦额。这次融资以后,您觉得我们会在后训练⽅⾯加⼤投⼊吗?
差距主要是在⾼质量数据的标注上,然后主要是在 AI 研究⾥⾯。肯定会加⼤投⼊,但是像⾼质量数据的标注,典型不是资本投⼊。
⾼质量数据标注的瓶颈,我觉得是时间,就是需要时间。因为对 OpenAI 来讲、对国外来讲、对 Anthropic 来讲,他们都更早,然后资本更多,卡也更多。
这种情况下,我们国内可以认为是最近半年才开始做,所以在时间上,我觉得是需要更多时间的。这个跟资本投⼊关系不太⼤,因为哪怕没有更多的资本投⼊,原来的资本也够它以最快的速度在扩张了。
但是这个速度是有上限的,瓶颈不是说我能够⻢上有更多的⼈,并不卡在钱上,也不卡在卡上。但是它确实是在⼀个快速扩张的过程。
所以我们觉得⼀年之内,⾼质量数据这个问题做得⽐较好,我觉得国内应该是可以预期的。我觉得⾯可能没有那么冷,但它确实是需要时间。
谢谢。然后第三个问题,就是我们看到 Anthropic 他们⽤⾃⼰的模型做⾃⼰的产品,推出了很多纵向的⾦融、法律……
[03:29:17]
甚⾄未来要往医疗⽅向⾛,您觉得在这种纵向应⽤⽅⾯,某个阶段我们也会考虑吗?
我还没有想得很明⽩,未来我们国内的商业模式是怎么样的,或者说最顺利的路径是怎样的,我们还没有到那个阶段。国内情况和国外情况不⼀定⼀样,国内到时候是什么样,我觉得现在还⽐较难判断。
国内我们现在以⽬前的情况来看的话,我觉得最合理的做法应该是全⼒做通⽤的 Agent,其他的 Agent 优先级应该更低,包括⾦融、医⽣这些 Agent。要先做 Coding,因为Coding Agent 能够做到很多,还有很多垂直的 Agent。现阶段我们觉得最重要的,应该还是 Coding Agent。
讲得很清楚,谢谢您。还有⼀个问题,我们也想请教您。其实我们做 DeepSeek,也很佩服您,⼀直在以⼀个⾮常纯粹的科研⽅式来做 DeepSeek。
但现在这个⾏业确实也⾛到了资本市场,⾛到了资本化这条路上。您⼜是⼀个⾮常负责任的⼈,⽆论是对⼩伙伴还是对投资⼈,您也都是⾮常负责的。那么,在纯粹科研、纯粹做AGI 的⽅向和资本市场之间的平衡,您未来肯定还要⾛资本市场,肯定还有公众股道,您觉得以后怎么 balance?这个您是怎么考虑的?
我现在觉得应该是能够做到的,就都要。假如说我今年能够有⼏个亿美⾦的 B 端收⼊,再加上我们 C 端有⽤户,那么这本⾝就已经有⼀定的商业基础。以明年我们 B 端有收⼊,如果这个需求可以再增⼤的话,公司离净利润已经不远了,可能就已经是净利润了。
可能就已经不是⼀个纯烧钱的阶段了,所以我感觉后⾯能做的、能操作的动作应该还是⽐较⼤的。或者说,最坏情况卖 API,可能都能够⽀撑⼀个上市公司。就如果说技术后⾯没有新的进步了,我们的技术就冻结在这⾥了,那么最后我们就全⼒卖 API,把这些服务做好,我觉得也够的。
所以我觉得还是有信⼼的,确实没有那么难。因为确实是在⼀个杠杆⾼的地⽅,⼜在⼀个发展⾮常快的领域,它可能就是没有那么难。只能讲,我们希望有更⼤的梦想,但是我们也有保底可以拿出来的业绩。
谢谢您,讲得很好。问题问完了,谢谢。
感谢您分享。前⾯提到⼀些问题,想跟您再问⼀下。因为我觉得 DeepSeek 其实最⼤的和其他公司的区别在于,我们的组织跟其他⼈不⼀样,或者说组织形式不⼀样。
但组织形式既跟我们的⽬标相关,可能也要去考虑组织⾃⾝的边界和效率。我不知道,从宏观的⾓度考虑,我们这个组织形式会有⼀个好的学习对象吗?历史上可能 Bell Labs,还是⼀个什么样的形态可能是⽐较理想的?还是说我们⾃⼰觉得也没有理想的,更多还要靠我们逐渐去探索?
可能在⼀个新的时期,只能靠我们⾃⼰来做探索。因为我们的组织形式其实跟美国的⼏家公司肯定都不⼀样,对吧?三家公司⾃⼰也不⼀样,但他们⾄少会从⼀个商业公司的⾓度出发去探索。
我可能主要想再问⼀下组织这个问题。
⾸先,我们没有模仿的对象。每⼀步都是我们从实际情况出发,实事求是,根据实际情况来做决策,找到我们应该怎么做。所以它是⼀个时代的产物,或者说是现实情况的⼀个反应,它并不是⼀个模仿的结果。
就是说,在这个情况下,我确实最优解可能就是这样,或者说我⾃⼰认为,我们⾃⼰选的路就是这样。每⼀步我们肯定都是思考过的,肯定都是选过,反正选的结果就是这么选的。它并不是因为看到谁这么选,我们这么选,⽽是因为我们分析了利弊⽽这么选。
那么在未来可能也是⼀样,我们并没有去模仿谁。我觉得我们跟 Bell Labs 还是不⼀样的,因为它明确是不需要有商业化的,因为它是个……但是我们明确是要有商业化的。我们最终还是要能活下去,我们毕竟是⼀个公司,政府不会给我⼀分钱。
所以我们可以有⾮常远⼤的使命,但我们归根结底是⼀个公司,我们要考虑怎么活着。所以 B 端对我们肯定是重要的,因为可能以后可能得靠它活着。只是说现在不重要,因为它现在是个成本线。
所以我觉得这个还是不⼀样的,跟 Bell Labs 还是不⼀样的。我们本质上还是⼀个公司。历史上也有很多公司,它也有利润以外的追求,但并不能说它有利润以外的追求,它就不是个公司。
很多公司做得很伟⼤,因为它有⼀种利润以外的追求。那个追求最后不但没有影响到它的商业化,反⽽能让它商业化得更好。我们本质上还是⼀个公司,只是说我们在考虑赚哪些钱、什么时候赚钱、赚多少钱、靠什么赚钱,只是说我们有取舍。
梁总,我有两个⼩问题,快速跟您请教⼀下。⼀个是说,您刚刚其实有提到 MILOS 的这个,可能不是⼀个很确定的⽬标,但是肯定会往这个⽅向去做。然后您也提到激活参数可能⽐如说……
[03:41:02]
下⼀代可能会是在 150 到 250 B 左右的⼀个情况。这种情况下,您觉得 150 到 250 B 是对标 O4.7,还是可能会对标到别的?这是第⼀个问题。
第⼆个问题,您前⾯也提到了,我们现在在整个 inference 上⾯⽤了⼀些除了 CUDA以外的编译语⾔。我理解原来咱们基于英伟达的⽣态,可能会⽤ PTX 这些⽐较多。现在⽤上更多类似您刚提到 TileLang 这些的话,是不是会⼤幅降低我们在 inference 上⾯的⼀些效率,或者短期降低效率?
我不知道您会怎么看编译语⾔的这种变化带来的效率损失,还是说⻓期其实是⼀个可以补充的状态,是提⾼效率?
是提⾼效率,是⼤幅提⾼效率。
OK,反倒没有什么负⾯的影响?
对,是⼤幅提⾼效率。所以说这是⼀个机遇。相当于以前你是离不开 CUDA的⽣态的,现在我们可以抛弃它的⽣态,⽤⼀个更简单的⽅法,就⽤ TileLang。它是⾼级语⾔,写那个程序也是很快的,要写的代码量很⼩了,我可以把它重写⼀遍。
明⽩。所以这两个都其实是⼀个,像您提到的 AI 带来的⽐较⼤的机会,不是⼀个可能短期需要去弥补的缺点。
对,它是技术发展的⼤机会。它不是 AI 的机会,因为我们还有⼀个项⽬,我们在⽤ AI 来写 TileLang。
那是不是更快?
现在所有 TileLang 都是⼈写的,但是它已经⽐原来写 CUDA的要快很多了。
明⽩。所以哪怕是对于硬件底层的执⾏效率,您觉得也是没有影响?
损失 1% 到 2%,我觉得是可以接受的。
OK,明⽩,理解了。好的,谢谢您,很清晰。
其他⼈还有没有什么问题?
没问题,我们今天就先这样。
好的,谢谢。
⾮常感谢⼤家的时间,谢谢梁总,谢谢。
拜拜。
拜拜。