开场0:00
There's something there.
我们最近聊了很多跟模型 、 算法相关的人 ,因为这块也非常热嘛 , 所以今天很开心请到 Evolvent AI 的联创 , 繁青 。
可以给大家先简单介绍一下 ?
OK, 非常感谢曲老师邀请 。 我是孟繁青 , 我是 NUS 的博士生 , 同时我也是 Evolvent AI 这边的联合创始人, 然后我主要在我们这边是 focus 在 RSI 这个 research 的方向 。
我之前是在 Kimi 有过一个比较长时间的实习经历 , 然后当时的话主要去做 Agent 还有 RL 这块 , 然后主要是偏 Infra 的方向 。
然后在 Kimi 的话 , 主要的一些工作就包括像 Kimi Linear 以及 K2.5 这样的一些重要模型的发版 。 那么从 Kimi 之后呢 , 我是跟一些朋友去 , 我们就合伙创业 , 就是这个 Evolvent AI 这个公司 。
对于这个公司 , 我们目前的一个大的 scope 就是说我们主要是 focus 在 RSI 这条线上 。
创业视角1:15
我觉得你的背景其实是很典型的今天的一批特别热的创始人, 和大家喜欢的画像 , 对吧 ? 就是非常年轻 , 然后 PhD 毕业 , 甚至还没有毕业就开始创业 ,而且是做的跟 ,因为你之前在 Kimi 做的也算 Post-training 嘛 , 对吧 ?
我觉得这批人现在出来创业的也非常多 。 所以你最近一年的 , 包括你创业算半年, 小半年吧 。
对 , 差不多半年左右 。
你实际的感受怎么样 ?
我会觉得其实在大厂跟在创业公司做事情会比较有不同 。 比方说一个很典型的点就是 , 我在 Kimi 其实主要是去训技术模型 ,但是事实上可能我到后期我会觉得说 , 训技术模型这件事其实在大厂内部它是一个相对比较工程化的事 。
那么可能我主要的工作也会去做一些合成数据 , 相当于因为其实整个一个训练啊 , 包括推理的流程已经在内部是很稳定的了 。
那么我们可能来到这种创业公司以后, 我们肯定是就不训鸡模了 , 然后我们就需要找到一些与这些模型厂更正交的一些切入点 ,以及就是相当于我们需要去从零搭建一些像平台类的这种方便内部使用的一些 Infrastructure。
这个是一个比较大的不同 , 就是说我们可能并不是 focus 在推进模型治理 ,而是说我们是去做跟模型治理正交的 ,但是可能是实际应用更有用的东西 。
嗯 , 我发现做 Post-training 的人现在创业的是比较多的 ,Pre-training 的好像很少 。
对 , 这个其实很好理解 ,因为其实做 Pre-training 的帮人 ,他们可能每天基本上打交道的要么就是 Data 本身 ,其实这块也比较少 ,因为 Pre-training Data 现在已经相对比较饱和 。
那他们其实可能每天打交道的大多数一些模型架构啊 , 包括是优化器这样的事 。 那么其实搞这种东西的话 , 它是相当吃资源的一件事 , 所以出来创业的话 , 初创公司也比较难 cover 这一块成本 。
就他做的一切事情是在卡在技术之上的嘛 , 对吧 ? 那 Post-training 的人出来创业 , 你觉得他是比较擅长和适合的是做什么呀 ?
从目前来看 , 整个 Pre-training 它基本上是跟一方面就是合成数据嘛 , 就合成数据是 Post-training 很重要的一块 。 就它相比于预训练 , 合成数据我们对它的要求是希望它更精细 , 就 Pre-training 的数据量不会像预训练那么大 , 所以这一块 。
那么还有一块其实就是做平台类的 , 平台类可能听起来稍微比较抽象 ,其实我给它说白话就是做 Bench, 这个 Bench 发展到现在 , 它已经不是说像我们可能 24 年、25 年看到的那种有很多的难题让模型去回答 ,而是说这个 Bench 呢 , 它本身就是比方说像 Post-training Bench 这种 。
那么模型可能就是需要在它提供的这个环境里做非常长时间的一个探索 , 去完成这样一个任务 。 那么现在 Agent 的 Bench 很多都变成了这种 。
那么这种呢 , 它其实相比于我们刚刚说的预训练 Research 那边的一个研究模式 , 它就更加更偏落地一点 。
因为其实就是当我们这个 Bench 做出来以后, 一般一个足够优秀的对于 Agent 的 Bench, 它是说一个工程上实现就会比较好的 , 相对而言它转成一个可以落地的商业模式也会更简单 。
所以我觉得这就是为啥 Pre-training 这帮人 ,他们大多数搞 Agent 还有搞 Bench, 它本身就是离这种落地更近的 , 所以他们这个创业也会更多 。
嗯 , 哎 , 我觉得你说这个 Bench 的白话还不够白啊 , 就是所以到底今天的 Bench 你觉得跟之前的区别是什么 ?
之前的 Bench 我们可以理解为就是 , 嗯 , 类比的话就是做数学题 , 就是我有一个很难题 , 然后我让模型直接去回答 。
相当于它就是一个考生 ,但是这个考生它并没有它在日常生活中的一个环境 。 举个例子 , 比方说就白领 ,其实我们在日常工作中我需要完成事 , 我不仅仅是靠我的大脑 , 之前的 Bench 大多数是只测模型的大脑 , 我还需要去动手去操纵像飞书啊 , 像 Notion 啊 , 各种各样的软件 。
那么其实现在的 Bench 呢 , 就相当于把这一块给它模拟出来了 。 比方说是白领的话 , 我们会建一个就是模拟白领这种工作软件的这样一个整体的环境 , 然后让 Agent 在里边去完成某些任务 。
那么这样的话 , 它就是不仅仅说我需要有做数学题那种强大的推理能力 , 我还需要有我去跟这些工具进行交互的一个动手能力 , 最后才能把这件事给做出来 。
哎 ,但你看之前的那个就是做题这件事情 , 包括 Coding 这件事情 , 它的可验证性其实我理解是更强更简单的 , 对吧 ?
就是你最后对一下结果 , 对就是对 ,不对就是不对 。 那你说我建一个环境 , 最终怎么评判这个结果的好坏呢 ?
这块其实就会相对于原来更复杂一点 ,因为其实原先的话 , 比方说我们出题 , 那首先我需要保证这个题是对的 。
现在的话其实也是类似的 , 就是当我们造了一个这种环境以后, 我们需要确保就是我们造的这个环境跟这个真实的环境是有 LINE 的 。
一个比较简单的例子就是说 , 这个环境里我们造了一个 Notion, 当然真实世界里有一个真实的 Notion。 那么当同一个输入下, 这两个输出是不是一样的 ?
如果一样的话 , 就可以证明我们造这个环境是对的嘛 。 那么还有一块就是 , 呃 , 我们出的题以及对于这个题配套的一个检查 。
就是现在来说的话 , 一般这个检查就不会像之前数学题那样那么简单 , 就是说可能就是一个判断是不是相等。
那么现在检查它大多数都会分非常多的一个维度 。 就我们可以看到就是现在的很多 Benchmark, 像我们之前搞的 Crawlmark, 或者是目前可能大家都在测的一些像 Automation Bench 这种 , 它的检查都是分为非常多的那种小的得分点的 。
那么这些小的得分点呢 , 目前是它还是比较去依赖于一个人的一个精细的设计 。
所以最后还是需要人来做这个检查嘛 , 对吧 ?
其实也是人跟 Agent 一起去 check 了 。
数据门槛7:12
嗯嗯 , 明白 。 哎 , 我最近听了一个说法 , 就是有人会讲说 Post-training 的人其实每天主要就是在做数据 。
确实 ,因为就是像我刚刚说的 ,其实目前模型厂它对于整个 training 这块生态是很完备的 。 它就不像可能比方说这些大厂之外的人 ,他如果他想去训练 SFT 一个模型 , 那他可能说我要去 GitHub 上拉一个仓库 , 然后我要找到一些 GPU, 我要配一个环境 , 然后把我的数据整理好 , 然后去训一个模型 。
就是模型厂内部的话 , 它就是如果我一个研究员我想去 SFT 的模型 , 我根本不需要这么复杂 ,因为相当于它把这一套生态给它做成了一个服务 。
这个服务的话就是说形式上就是我仅仅去提交一个请求 , 然后这个服务就会去处理我的请求 , 再远程去去 SFT, 然后我这边最后就拿到结果 。
相当于对我来说 , 就算我是一个什么也不会 , 我根本不知道 SFT 是什么的人, 我要做的就是把这个数据做好 , 然后我就可以直接走完这一套完整流程 。
对 , 所以会有人讲说那 Post-training 是不是其实相对是比较枯燥无聊的工作 , 就是认真的把数据做好 ,以及说那是不是现在所谓的这个训模型这件事其实门槛没有大家想的那么高 。
嗯 ,其实对于后者我是认可的 , 就是训模型这件事的门槛确实是有很大程度降低的 。 当然这个是对大部分 Researcher 来说 ,因为你比方说你要搞 Infra 的话 ,其实相当于你是去构建那个服务的人, 这块还是有比较多的坑的 。
但如果说是大部分普通的算法 Researcher, 确实门槛是会降低的 。 但它到底是不是枯燥乏味呢 , 这件事反而还真不一定 。
因为其实所有东西按照它的一个发展的看 ,其实我们都会发现 ,不管是模型架构它为什么最终到了 Transformer, 还是说在 RL 的时候 , 为什么最终就过渡到了 DeepSeek 当时提出的那个基于可验证的 rule-based 的那种 RL 的方式 ,其实就是他会发现这个事物的发展规律一定是发展到越来越简单 , 越来越直接面向结果 , 最直接这种形式 。
所以其实我觉得后训练这块也是这样的 , 就是它也是发展到我可能不去关心具体算法上面设计的一些 tricky,而是直接关注最本质的 , 就是给模型的数据这样一件事 。
所以这一块我觉得它发展是正常的 。 然后本身造数据的这个过程其实也是比较难的 , 确实是不同人他就是能造出来数据是不一样的 。
并且的话 , 我们最近也有一些工作 , 我们去做了一个 RSI Bench, 然后我们在这个 Bench 里我们也去讨论了就是 Agent 它到底能不能直接完成去造数据 , 然后迭代起来训模型这件事 。
就目前我们可以看出来就是 ,其实 Agent 它还是只能做一些比较机械化的事 , 比方说我训练这一批数据导致这个模型的回答的格式就错了 , 然后我后面发现 Agent 要修改 , 它可以完成这样一件事 ,但它是无法提出一些造数据的所谓的 insight 的 。
我们可以发现其实现在模型厂的研究员 ,他在造数据上他是有非常多的一些他们自己的 know-how 的 。 那这个其实也就是目前的一个核心能力吧 , 所以也不能说这件事本身是枯燥乏味的 。
嗯 , 哎 , 所以你看同样的人 ,他做出来的数据的结果不同 , 好坏大概体现在什么地方 ? 有没有一个某一个具体的例子 ?
其实这块目前来看它还是比较量化的 , 大概分为两个维度 。 因为目前的话 , 造数据这件事一般也是针对给定的一些 Bench。
那么其实最简单的一个量化标准就是说 , 我在这个 Bench 上到底能不能在没有任何作弊或者说叫 hacking 的情况下完成一个提点 , 就是在这个 Benchmark 上的效果可以提高 。
对 , 这个就是最直接的一件事 。 然后当然它可能也会有一些其他的考虑 , 比方说我这个模型 , 我在一些代码的 Bench 上我去合成数据 , 然后去训练它 , 它会不会在一些比方说写作这种偏文科上面的事情上去有一些性能的降低 。
但你说的这个是结果上的评判吧 ? 对 , 我就说是什么造成了不同的这个结果呢 ?
主要就是他们合成出来那个数据的质量上 。其实对于目前就是当我们没有去训的时候 , 我们去评判这个数据的质量 ,其实它还是相对比较难的 。
就是我们其实评判它 , 我们只能用一些量化指标去评判它 , 比方说这个数据的一个正确性 。 因为我们这个数据一般是说我们有一个问题 , 然后有一个模型轨迹 , 最后有一个答案嘛 。
那么其实一方面就是说 , 我们看这个模型轨迹里到底有没有出现类似作弊这种情况 , 还有一方面是说对于我们合成这份数据 , 它是不是一个难度是适中的 。
比方说如果太简单数据肯定没有用 , 那么太难的数据的话可能也学不到什么东西 。
所以我能不能换个角度理解 , 就是现在数据的质量它仍然是一个比较难评判的事情 。
对 , 比较难评判 。
就是你最后还是得训了 , 就是结果好就是好 ,不好就是不好 , 就再改 。
对 , 就是其实很多对于数据质量检测这种指标 , 它只能做一些像初筛 , 就正儿八经看它到底能不能 work, 还是得去训练 。
所以对于一个模型来讲 , 就是我们只说后训练部分 , 它的 Infra 的好坏跟数据的好坏 , 你觉得这个重要性占比大概是怎么样 ?
目前来看是数据的好坏更重要 ,因为 Infra 已经发展到一个比较稳定的程度 。
国内模型12:48
OK, 所以我们刚才讲的很多我觉得是相对比较介绍型的 。 就我觉得我们可以讲到说那今天 ,因为你正好也从 Kimi 出来不久 , 对吧 ?
然后现在 Kimi 啊 ,Mini Max 智谱什么的都竞争的还蛮激烈的 , 大家最近也都在陆续的在发行模型 。 所以你在你的视角看来 , 今天尤其是国内的这些模型 , 大概是发展到一个什么阶段 ?
大家在拼的是什么东西 ?
其实我觉得目前国内的模型 , 就是相比于国外的模型 , 差距也是一个在缩小的过程 。 比方说我们可以看到 K3 在国内这种卡可能只有国外 1/10 的情况下 ,但是发展到了一个接近就是 FABO 这种 。
当然就是你具体跟国外差多长时间这块 ,其实也比较难估计 。 因为其实像国外那些厂 , 它都会有自己一些存货 , 它可能没有发出来 ,但是从他们 release 出来看的结果是在接近的 。
那么我觉得这块它主要是来自于应该是主要是预训练这一块 。 就像我刚刚说的 , 国内的模型厂它有的一个计算资源是远远少于国外的 , 就是导致了他们需要用这些更少的资源怎么去完成一个比较好的后训练 。
那么这块它在国内我感觉基本上可以分成两种 , 一种就是就像 Kimi 跟 DeepSeek, 它会有一些架构上底层这种创新 , 比方说像 Kimi Linear, 它是一个线性注意力机制 , 然后像 DeepSeek 有那个 multi-layer attention,也是一种注意力机制 。
就这种的话 , 它说白了就是相对于原始的那种 attention, 它更省计算量 。 像这样的话 , 它就可以用更少的训练资源达到一个更好的效果 , 同时它也不会太损失性能以及推理速度 。
那么这个是一块 , 相当于国内这些模型厂它在有限资源下, 它去逼出了一些底层这种 pre-training level 的一些架构上创新 , 然后拥有了一个至少不会落后太多的 pre-training 模型的一个水平 。
然后另一方面就是在后训练上 ,其实国内的话 , 后训练我觉得可能相比于国外后训练要稍微弱一些 。 当然这块弱并不是体现在一个基础实力上 ,而是说就是国外这些像 Cloud 的 OpenAI 这些厂 , 它在数据上积淀就是天然比国内的可能要甚至早个半年 。
那么国内的话 , 数据这块它会积淀相对较少 , 所以它可能目前绝大部分数据会来自于说去蒸馏 , 去补足一些这种数据上的短板 。
对 , 哎 , 你说这个其实跟我本来预想的还蛮不一样的 。 就是啊 , 你讲的是其实现在是 pre-training 国内更有特色 , 然后 post-training 反而是弱的是吗 ?
跟海外比起来 。
对 , 我个人觉得是这样的 。
因为我会觉得说 , 大家会觉得 pre-training 部分海外的可能它算法的一些人才密度会更高一点 , 它的卡肯定也远多于国内 , 然后 post-training 的反而是更偏工程上的东西 。
理论来说是国内更应该有优势的部分 。
当然我觉得是这样 , 就是其实现在我们可以看出来 , 就是在模型的架构上, 就不仅仅是国内 , 就是全球范围内比较好的架构也就是 Kimi 跟 DeepSeek 做的 。
那么其实国外比方说像 Mamba 对吧 , 根本没有什么人用嘛 。 然后像 Kimi 跟 DeepSeek 这个架构 , 就是确实他们至少已经在自己的公司去证明了它这个是具有 scale 能力 ,但像国外一些架构像 Mamba, 它其实一直就没有证明它有一个 scale 能力 。
明白 , 所以你觉得这个观点是就是 AI lab 内部大家公认的一个点吗 ? 还是是你个比较个人的一个看法 ?
这块是不是公认我倒不清楚 ,但是我可能跟我一些朋友我们聊过 , 我们都还是比较反映这个观点的 。
OK, 嗯 , 明白 , 这个蛮有意思的 。
对 ,而且我个人觉得可能从现阶段来看 , 后训练它是一个比预训练 , 就像您说的 , 它是一件更工程的一件事 。
那么工程它基本上就是说我的一个时间上的差距可能会更难弥补一些 , 可能国外就是更早有数据积淀 , 它确实就会做得更好 。
然后我们现在因为数据积淀这件事上, 本身它是一个比较拼人力啊 , 或者是一个组织架构这样的事 , 它优化起来相比于可能靠研究员那种大家的聪明才智相对更难的一件事 。
嗯 , 我觉得 pre-training 部分有点像一种资源倒逼创新的感觉嘛 , 对吧 ? 就是海外其实它可能就本来也没这个动力去做这些事情 。
对 , 我觉得是有道理的 。
那你觉得今天比如说 K3 出来 , 大家都能看到它的各种搒单评分 , 包括大家反馈都很好嘛 。 然后在这个之前呢 ,其实是智谱肯定是一路领先 , 对吧 ?
那你看起来后面这些模型商会怎么变化 ? 就大家会是一个交替领先的一个情况吗 ? 还是怎么样 ?
基本上来说 , 肯定是某某一家发一个大的版本的模型 , 那么这个大的版本模型至少是在开源社区里面是 top one 或者 top two 的 。
然后当然它可能几个月以后, 我另一家模型发一个大的版本的模型 , 它就会超越掉 。 应该是一个这样的局面 。
对 , 所以就不太存在说某一家能够因为什么独特的原因就一路领先 , 对吧 ? 就因为这个点 , 我包括 Code 你刚才讲的 , 就是你看 , 就虽然 Kimi 跟 DeepSeek 它有自己的一个 pre-training 的可能一个新的架构之类的 ,但是可能比如智谱发下一版还是能够超过它 ,是吗 ?
对 ,但这块可能也是就是我们只看那种 Bench 上的结果 。 如果说真正的体感 , 那可能也不一定 。
但从真正体感来讲呢 , 确实 GLM 是长期领先的嘛 。 或者我们这样 , 我们挨家讲一下, 对吧 ? 你刚才其实提了 DeepSeek 和 Kimi, 我们都可以理解 , 就它确实可能人才密度比较高 , 对架构上做了一些创新 。
然后这个我想补充问一点 , 就是 Kimi 因为它 K3 讲的是它是做了一个非常大参数的嘛 , 你觉得这个对它的模型实际的贡献有多大 ?
我觉得这个显然是贡献很大的 ,因为就是从 scaling law 这个角度 , 你 scale 模型参数在目前数据规模下就确实能达到收益 , 这块不仅是国内海外也是这样 。
但其他家看到以后也能很快追上吗 ? 还是因为 Infra 或者各种架构的原因 ,其实没有那么容易去效仿 ?
是能追上 ,但是肯定就也有时间上的 gap。
那所以我们在讲到智谱 , 你觉得智谱 , 当然我们在很多场合都跟人探讨过 , 我们自己也之前也聊过 ,但我好奇你的视角 , 你觉得智谱之前一段时间 GLM 就是他们的 coding 方面一直领先的核心原因是什么 ?
我其实不是太了解智谱这个公司 ,但是我可能跟朋友交流起来 , 我会觉得就智谱在 coding 数据上面它做得比较好 。
更偏 pre-training 还是 post-training?
Post-training。
Post-training 的部分嘛 , 对吧 ?OK, 嗯 , 明白 。 字节其实一直 coding, 至少到目前还没有追上嘛 , 对吧 ? 但你觉得这个是不是也是一个时间问题 ?
嗯 , 这块怎么说 , 就是它如果说追上现在的 Frontier model, 那肯定是时间问题 ,但它到底能不能跟现在 Frontier model 的一个差距再缩小 , 那这块感觉其实也不太好说 。
但你看我们最近也聊了很多人, 然后我现在有个感觉啊 , 就是在人才密度上 ,其实大家只要肯花钱都能找到人, 对吧 ?
我们发现最近混元进了很多非常优秀的人, 就这个趋势是非常明显的 , 对吧 ? 他们挖人也很厉害 , 然后数据上呢 , 反正只要也是肯花钱肯下功夫 , 可能大家没有特别本质的区别 。
那最后是不是还是拼卡 , 长期来看的话 , 或者中长期来看的话 , 那如果中长期是拼卡的话 ,是不是还是大厂是优势最大的 ?
甚至于说像今天的这些 ,不管是 Kimi 还是智谱还是 Mini Max 等等 ,其实长期也是仍然有非常大挑战 。
我个人会觉得可能是这样 , 就是拼卡当然是一个很直接的原因 ,但我觉得还有一层原因就是整个一个组织架构上, 比方说可能从这个混元例子就很容易看出来 , 像可能之前他们那边没有改架构之前 , 可能就是做得比较差 ,但是现在其实就突飞猛进嘛 。其实这一块我觉得它可能更多来自于一个组织架构上面的一个设计 , 就是它到底是不是比方说划分的更合理
。 举个比较简单的例子 , 就是多模态这个部分 , 它到底应不应该单独画出来 ? 事实上现在大家都不把它单独画出来 ,而是把它去跟 pre-training 进行合并 。
所以今天你觉得各个模型大家在拼的是什么 ? 是比如说架构的创新 , 还是数据 , 对吧 ? 还是 Infra, 还是等等什么东西 ?
就是从技术上来说 , 这几块肯定是都有的 。 架构相当于是你能不能在你现在有限资源内炸出更多的东西 , 然后数据的话就是相当于可能是说 , 我能不能在这些 benchmark 上达到一个更好的效果 , 然后像 Infra 就是说其实是保证你内部迭代的一个速度嘛 。
然后技术上的话 , 大家肯定都会拼 , 然后更底层的可能就是一些你公司内部的组织架构这种 。
你觉得目前市场有没有一个共识 , 说下一个阶段最核心的是哪个点 ?
我觉得有 , 现在共识我觉得是做 auto-research, 或者说把它叫 RSI。
自进化21:50
对 , 我们听到过非常多词 , 对吧 ? 叫 Self-Evolving 自进化 , 然后 AI for AI, 对吧 ? 然后就是你刚才说的 RSI, 对吧 ?
这些也是最近开始的 。
对 ,他们其实都是一件事 。
对 , 这个正好也是你们现在在做的事情嘛 。
对对对 。
你能不能给大家先解释一下这几个词到底是个什么东西 ?
明白 , 就是不管是说 Self-Evolving 还是说 RSI, 还是说 auto-research, 它其实说白了形式化上就是说我们给模型一个工作的环境 , 还有一个目标 , 它到底能不能在这里面去持续的一个操作 , 然后拿到结果反馈以后修改自己之前的操作 , 然后在上面达到一个突破上限的一个事 。
对 , 我理解这件事其实有几层可以做啊 。 就首先从最终的这个产品侧的结果输出来讲 ,其实之前大家就有人在做 , 对吧 ?
就是我输出个结果 , 我先不给用户 , 然后我先自己让它 , 比如换个模型的话怎么样的 , 再测一遍 , 然后再出 , 对吧 ?
这个是最上层吧 , 我们可以说最表层的 。 然后中间 harness 部分其实大家也一直在做 , 对吧 ? 就怎么样能让 harness 让它自己能够转起来 , 自己去做很多事情 。
然后以及就是我记得 Anthropic 什么大家都在讲的 , 就是什么时候最终真的是模型层 AI 能自己去训 AI, 对吧 ?
就这几个你理解都算 RSI 吗 ? 还是怎么样 ?
我个人理解是都算 , 当然可能目前大众上来说 , 我们会把 RSI 这件事更偏向于说是模型去自己迭代自己 , 得到一个更强的模型 ,而把这个 auto-research 这件事呢 , 可能是说就是我们现在已经有一个很强大的模型 , 它能不能比方说写出一个好的 GPU kernel, 相当于它在写 GPU kernel 的时候有一个持续的迭代嘛 。
但是其实他们殊途同归吧 ,因为他们都可以形式化成就是我给模型一个环境 , 然后一个目标 , 然后让它在里边去进行一个持续的进化 。
但听起来真的是让它能自己训练自己 , 这个应该是最难的了 , 对吧 ?
对 。
这个算是 pre-training 的部分了吗 ? 是不是 ?
这块其实它可以做成一整套 , 就是不管是 pre-training 还是 post-training 都可以做到里边 。 因为我之前就我听过一个观点说 ,AGI 的一个概念是说你这个模型到底能不能从零复刻出一个自己 , 那其实这个就是一个很清晰的说 RSI 的一个过程 , 只不过它最终这个模型没有超越自己 。
如果说它能够复刻一个超越出自己的模型 , 就是它在自己的基础上达到一个更强的模型 , 那它就是实现了一个 RSI。
嗯 , 哎 , 我想再捋一下, 就是我们刚才说的那几层里面 ,在最表层去迭代 , 我觉得这个是一个挺简单的东西 , 对吧 ?
甚至就是一些基础的工作 , 甚至于 prompt 可能就能完成 。 然后 harness 这个我想理解一下 ,因为也有很多人在讲说现在模型其实是倾向于把 harness 一起训进去的 , 然后可能未来几年呢 , 就没有 harness 层这个事情了 , 就都是模型的事情了 。
我不知道你怎么看这个 。
这块我觉得倒不是说未来会没有 harness,因为其实现在我们可以看到模型厂它基本上都有自己的 harness, 像 Kimi 的话它会有 Kimi Code, 然后像 DeepSeek 他们内部也有一个自己的 harness 嘛 ,但是还没有 release。
那么它一般都会把自己的模型跟自己的 harness 一起发版嘛 ,是因为就是在后训练的时候 , 我这个模型的输出是经过 harness 的 。
那么我在后训练的时候呢 , 我经过反向传播 ,其实我会导致我这个模型越来越适配我这个给它写的这个 harness。
所以就是这两个东西它会一个配套出现 ,而不是说就是 harness 会没有 。 当然我会相信 harness 会越来越简单 , 这是肯定的 。
所以你觉得未来几年还会有第三方 harness 存在的空间吗 ? 或者说比如说我真的是一个做应用的创业者 , 我未来几年还需要做更多的自己的 harness 吗 ?
还是其实我这个责任也交给模型厂商了 ?
嗯 , 可能会是这样 , 就是它可能分两种情况 , 一种是就是像一些 general 的领域 , 比方说 coding, 那这块确实没有第三方 harness 存在的一个必要嘛 。
但是像一些垂意的场景 , 那么垂意场景它可能一方面说我根本没有必要用模型厂那么强大的模型 , 那我当然也没有必要用他们配套的 harness。
我用一个相对弱一点的开源模型 , 配上一个比较简单的一个 workflow, 这样就可以完成我的一个需求 , 然后它的消费更少 , 速度更快 。
那么这时候它确实是我觉得有自己的 harness 存在的一个必要 。
嗯 ,但我觉得这里一直我会有个疑问啊 , 就是因为你也在做 RSI, 你肯定是相信这件事的 , 对吧 ?
我觉得如果真的是相信 RSI, 相信 AGI, 相信这件事几年内能到达的话 , 那既然模型都能训自己 , 它还有什么不能写的呢 ?
对吧 ? 就是我就让它写一个垂直等于的 harness 就好了嘛 。
对 ,是可以写的 , 就写完以后相当于你就用这个垂直等于的 harness 呗 , 就不需要用它本身自己的那个 harness 了 。
对 , 所以如果真的到那天的话 , 那就仍然是模型吃掉一切的逻辑吗 ? 还是垂直等于还是会有什么价值跟壁垒 ?
我个人觉得是这样的 , 就是用一个强大的模型写 harness 是没毛病的 ,但是问题是垂直等于 , 我本身 harness 背后的模型 , 我到底需不需要用这个强大的模型 , 这个确实是未必的 。
因为就是我们可以看出来 ,其实随着现在 Cloud 的一次又一次发版 , 普通用户其实非常难体感到这些模型这个强弱上的差别了 。
就我们可能只能看 Bench, 然后这些 Bench 其实已经有点脱离我们日常使用了 。 那么对于一些垂意来说 , 那更是这样 。
所以它可能就是说我根本不需要用那种非常强大的模型了 , 我需要是说我能不能用那种强大的模型来去指导一个比较小的开源模型在我这个场景上进行一个迭代嘛 。其实这也是一个所谓 Self-Evolving 的一个过程 ,不过 Self-Evolving 的呢 ,是我这个小的模型 , 然后去得到一个好的垂意模型 , 然后我后面就只用这个模型了 , 就不需要用像 Cloud 这种大的模型 。
嗯 ,但这样的话我还是在想 , 最终模型商的价值会怎么变化 ? 就像你讲的 , 可能现在的一些基础模型它已经足够实用了 , 然后未来呢 , 它肯定会不断的降价 , 就不管是因为开源 ,因为 Kimi、DeepSeek, 还是因为什么 ,因为今天我看那个 GPT 也刚降价 80%, 然后后面它应该就会持续降 , 然后直到有一天 , 就我觉得可能会在不远的将来 , 就大家发现就那些足够
我使用的 , 它已经接近于免费了 。
对 , 这块我觉得是这样 , 就一方面他们降价也不是说我真的是砍很多 , 我成本低了降价 , 它也是说有商业模式的这个考虑在里边 ,因为开源社区确实太厉害 , 然后又有竞争对手 , 所以它不得不降价 。
如果未来说真的是出现一两家垄断这种情况 , 它价格也未必说会一直降 , 这是一块 。 然后还有一块就是说 ,其实很多这个垂意它是有一些数据隐私的需求的 , 所以它不一定有很强的意愿去用 Cloud 的 GPT 这种模型 。
对 ,但我觉得一两家独大 , 好像目前看起来不太会发生 。
嗯 ,不好说 。
嗯 , 明白 。 然后还有另外一个这个我也没想明白的 ,而且对于你们 , 尤其你们在做 RSI 的 , 我觉得可能会相对 challenge 的一个问题啊 。
当然现在市面上其实有蛮多讲所谓的 New Lab 呀 、RSI 或者 Self-Evolving 做这件事的人嘛 。 那我就在想 , 如果真的能够让它自己研发自己的话 , 首先为什么不是说你直接瞄准我要做更好的机模 , 对吧 ?
我要做一个比 OpenAI 更好的一个模型 ,因为它既然都自己能研发自己 , 自己能进化自己了 , 那就让它迭代就好了 , 对吧 ?
这是第一个点 。 另外一个点就是 , 那为什么不是模型厂商自己做出来呢 ? 对吧 ? 因为这个应该也是现存的所有的大模型本身很看重的一块 ,是它的一个在它的主路径上的 。
这块我觉得它的一个逻辑是这样的 , 就是首先对于 RSI 机模这块 , 就我最近也思考了一下, 到底这种东西跟模型厂它是不是就是正交 , 或者说它是不是就重合了 。
我最后是觉得就是 RSI 机模这件事 ,其实就是模型厂自己在训的一个机模 , 当然这个原因可能比较复杂 。
然后我觉得目前这些创业公司他们在做的话 , 比方说就以我们来为例 , 就我们考虑的 RSI 并不是说我们要去训一个 RSI 机模 , 或者说我们需要出一套 RSI 所谓的 harness, 这两块我觉得都没有意义 ,而是说我们要做一些介于这个模型厂和应用层之间建模这个 RSI 通道 。
嗯 ,OK。RSI 这件事的实现 , 你觉得最核心的它的点是什么呀 ? 我能不能理解就是其实机模的 AI coding 能力只要越来越强 , 它慢慢就能做到这件事情了 ?
是这样的 , 当然可能我说的会比较抽象 ,因为就是我现在对于 RSI 的思考是这样的 , 就是现在有非常多人去做所谓的 Self-Evolving 的一些方法 , 或者说在 harness 上, 那么形式上来看 , 它可以看作一个更聪明版本的 DFS。DFS 就是一个算法嘛 , 相当于它一直往里面探索 , 比方说走迷宫 , 它走到这个死路的时候 , 它又回溯到上一个点 。
那么为什么说目前这些人做 RSI 的方法是一个更聪明版本的 DFS 呢 ? 因为其实现在模型在做 , 比方说写 GPU 的 kernel, 然后我写完一个 kernel, 然后我给那个 kernel 评分的那个程序去评分 , 然后我得到一个分数 , 然后我根据这个分数呢 ,其实我就相当于拿到一个反馈 , 就是类似于我们玩迷宫的时候 , 我可能有时候会走到一条死路 , 比方说反馈不好 , 然后它会
根据这个反馈去回溯到某一个节点上 。 那么在 RSI 或者说 Agent 里边 , 它这个回溯实际上就是由我 LLM 去判断的 ,而不是说在 DFS 里通过代码去判断的 。
所以说我觉得现在做 RSI 的这些方法 , 它本质上都是在做一个更聪明版的 DFS, 它是在 DFS 里边加入一些剪枝 。
那这样的话 ,其实它就是说我不会去探索一些一开始可能是没有用的路 ,而是我会把我最多的精力放到一些更有可能的路上, 这样相当于是提高了 RSI 的一个效率 。
那么这件事的话 , 我会觉得它其实本质上来说 , 我们要做剪枝 , 相当于说我们需要去预判我做的一些操作带来的未来的一个状态 ,以及说我带来未来这个状态所给我的一个收益 。
那么从技术上来说 , 这件事情就是一个 world model 加 value model。 那么其实这两件事情在大模型本身预训练的时候就已经被内化了 , 所以我个人觉得就不存在 RSI 基础模型这样一件事 , 就是模型厂自己在预训练模型的时候 , 它已经把 RSI 这件能力给内化进去了 。
那么之后 RSI 它会变强 , 它的一个本质上来源就是说我到底有没有把我这个 world model 知识给内化的更好 。
然后还有一个事就是说我模型的 context 窗口 , 就目前模型 context 窗口可能最高到 1M, 这个变得更长 , 这个其实很好理解 ,因为就是我能记住了更多的东西 , 我可以回溯到一个更远的一个地方 。
那么我觉得 RSI 可能就是来自于这两块 。
嗯 , 所以你按照你讲的 , 就是你其实更看好的是现有的模型自己去做 RSI 这件事情 , 你觉得对于 New Lab 来讲 , 它做这件事的机会可能没有那么多 。
嗯 , 对 , 就没有 RSI 基础模型这个说法 。
嗯 , 然后我们假设 ,也不叫假设吧 , 就现在大家肯定都在往 RSI 去走 , 对吧 ? 你去看各种海外模型的说法 , 包括国内模型 ,其实都在往这条路去走 。
然后我们假设它真的有一天走到了 , 然后它算法能够自迭代 、 自进展 , 对吧 ? 然后呢 , 卡反正放那放着 , 那数据这件事情会不会就是又反而变成瓶颈 , 还是到那个时候其实数据它也能自己去赚起来 ?
我个人觉得是可以的 ,因为其实就我们最近那个 RSI Bench 其实也是 focus 在数据这个 level 的一个自进化上, 我们确实可以发现目前 Agent 呢 , 已经在数据这个层面有一定自进化 , 自己去合成更好数据的一个能力了 。
所以理论来说 , 当然我们今天讲的很多可能是一个这个 , 如果你真的是按照逻辑推理 , 可能最后会得到一些非常有意思的结果啊 , 就比如我们按照刚才这个讲的 , 那最后最后有可能模型公司最后只剩比如就 10 个 、20 个人就够了 。
可能从结果上是的 ,但是实际各个多方面考量也不一定会这么极端 。
明白明白 。 然后最近很多人都知道合成数据这件事 ,在国内现在也比较热嘛 , 你们也有在卖一些合成数据的东西嘛 , 对吧 ?
你觉得这个东西就按我们刚才讲的 , 它是一个 RSI 的其中的一个结果产出 , 还是它的一个过程的量 , 还是怎么样 ?
就这两件事的关系是怎么样 ?
因为我们说最终意义的一个 RSI 就是说我模型训练得到一个更好的自己 , 那么它在这个过程中的改进可能就已经包括像数据 、 像算法呀 、 像架构啊 。
那么数据的话 , 可能就是 RSI 这件过程中的一个中间产物 。
嗯哼 , 对 , 数据你看我们经历过几波啊 , 第一波是 Scale AI 那一波 , 对吧 ? 其实就是它是普通人标注数据就 OK 了 ,因为那个时候呢 , 数据量本来就很小 , 然后后来是以 Moko 这种专家标注数据为第二代吧 , 我感觉 。
数据演变35:29
然后合成数据现在可以理解成是当下的第三代大的趋势吗 ?
我觉得是的 , 当然这个其实也可能在趋势的中后期 。
嗯哼 , 这三个现在是并行吗 ? 还是会有一个替代的关系 ? 然后以及说 ,因为我知道现在大家其实也挺缺真人的数据嘛 。
对 。
也会有人去买一些真人的数据 , 那这个真人数据跟合成数据之间又是一个怎么样的关系 ?
首先就是像 ChatGPT 那一代数据 ,其实可能现在来说更 for 预训练了 。 它可能都是一些所谓的 raw data, 就是它 noise 比较多 , 那这块确实需求不多了 。
然后像专家数据的话 , 它现在也有需求 ,但不会像之前 , 比方说可能 25 年年初的时候 , 专家数据会需求很多 ,因为其实当时是 O1 出来了 ,O1 的话会带来这个模型的一个像是它推理的能力的一个跃迁 。
所以当时大家都非常希望有一些数学物理的专家呀 , 去有一些他们那种的数据 ,但是现在这块确实也会在变少 。
它主要的原因是模型确实太强了 , 我对专家要求也变高了 , 原来我可能只要求专家去做题 , 现在我还要还要出题 , 我还要要求它出的这种题呢 ,不能跟市面上所有题有重合 , 就这块就太难了 。
那么所以现在可能说合成数据 , 然后就是合成数据 。 那么合成数据它出现主要是因为模型它从一个一开始的那种 chat 的一个 bot, 然后发展到 O1 那种一个超级推理能力很强的一个做题的东西 , 然后再发展到从 Claude Code 出现以后, 模型开始成为真正一个你的同事 , 它是一个 agent。
那么 agent 它就是相当于我们变成要需要有 agent 的数据啊 , 然后 agent 数据的话 , 就像您刚刚说的 , 它分成两种 , 一种就是我通过合成数据 , 就是合成数据的话 , 就是说我们需要去造很多的环境 , 然后在这个环境里呢 , 去让一个模型 , 当我们需要给它一个目标 , 让它去探索 , 让它去完成任务 , 然后把这个轨迹保存下来 , 就是叫所谓的合成数据 。
那么还有一条就是说真人的数据 , 那么真人的话可能就是说它是需要那些真人在他自己的那些工作环境里的一些交互轨迹 。
那么这块就是说 for agent。 对 , 目前整个数据我觉得它大概是这样几个情况 。
嗯 , 就那现在合成数据跟真人数据之间的价值关系是怎么样的 ?
真人数据的话 , 就它也是会 noise 比较多 ,也是需要去有一些像清洗啊这种事在 。 然后合成数据的话 , 相当于它可能本身就是说我直接就能拿来训练 。
哎 , 你能不能给大家讲一下, 就是我觉得最清晰的感知 , 就是比如说一条普通标注的数据和一条专家数据和一条 , 我不知道这个怎么定义 , 你们是一条还是一个什么合成数据 ?
对 , 和一个真人的数据 , 现在大概分别是多少钱 ?
合成数据这边贵的能卖到好几千 , 像那种做题那种专家数据可能也是一两千这种这种量级吧 。 然后像那种正儿八经的真人操控轨迹 , 这块它就有时候要走量了 , 就没有什么单条的说法 。
你说的合成数据好几千 ,是它的一个单位是什么呀 ? 就它们好几千买的是一个什么样的东西的 ?
哦 , 就是那种非常长程的那种任务 。
嗯 ,但就是一个任务 。
对 。
嗯 , 哎 , 合成数据这个事情听起来其实就是模型厂商应该自己也能做嘛 , 它为什么不自己做 ,而是也要就首先我知道它自己肯定也做 , 对吧 ?
但那为什么它在自己做之外还要去外面去采购呢 ?
所以说合成数据的单子以后也肯定会越来越少了 。
哦 , 对 , 你刚才也提到这个点 , 就它首先它为什么一开始会多 , 然后又发生了什么变化会越来越少 ?
就是就数据这块现在还是一个多多益善嘛 , 就是我自己造了一批 , 我可能是有我自己人的那种 bias 在里边的 , 我肯定希望它这个分布 bias 越少越好嘛 , 所以我可能从外面我也会收一批质量比较高的进来 , 然后去补一下分布这块事 。
但很合理啊 , 为什么后面你觉得又会变少呢 ?
呃 , 怎么说呢 , 这一方面是目前的 bench 越来越少了 , 就是可能我们之前 bench 非常多样 , 然后我一个模型我测 n 个 bench, 然后我 n 个 bench 都要刷 , 那样的话就相当于你的需求就会很多嘛 。
但是可能现在因为模型越来越强 , 你做一个好的 bench 的难度也非常高 , 然后 bench 可能也收敛到就是我模型厂我可能只测那几个做的最好的一些 benchmark, 那其实我模型厂我就有更多的精力 , 我就去造只 focus 在这些 benchmark 上了嘛 。
那相当于它可能说就需求对于其他就会比较少了 。
明白 , 所以它其实就是一波一波的嘛 。
对 。
但你看它会有下一波吗 ?
我觉得会有 。
下一波会是什么呢 ?
可能短期来看就是所谓的 RSI 的数据 。 举个比较简单的例子 , 就我们这边有做 , 就是说我有一个模型 , 我去后训练另外一个小模型 , 然后把这个小模型的效果给它提上来 , 这样一条轨迹 。
那么这个轨迹其实本身就已经超脱了目前可能大部分数据的一个范畴 ,因为这一条轨迹可能我在产生的时候我都需要跑十几小时, 甚至说一天 。
那么这种轨迹它就是一个相当宝贵的一件事 。
这个就一定是是有模型训练背景的人才能做的事情了 。
对 , 就是数据这个行业背景也在提高嘛 。
嗯 , 哎 , 你觉得如果因为很多用户他自己平时就是在用 AI 嘛 , 对吧 ? 然后他可能产生了很多数据 。
对 。
但这些数据首先它在它用的那个中转站跟模型里面 。
对 。
但如果是他自己个人想卖 , 你觉得合理吗 ? 能卖出去吗 ?
卖不出去 。
卖不出去是吧 ? 就是你刚说太脏啊什么那些问题嘛 ,是吧 ?
对 。
OK。
然后也有合规问题 。 对 。
嗯哼 , 所以你们现在就是我理解其实是这些半年吧 , 包括你们 , 包括有一些其他的家其实卖数据赚了很多钱 , 对吧 ?
一下子其实收入涨得蛮快的 。 但你觉得这一波其实已经在你看来是快进入尾声了 ?
对 , 这一波可能说普通 agent 像 Sleep Bench 那种 agent 数据就确实已经接近尾声 。 所以说就数据整个行业它变化非常快 ,也对你这些数据厂商会有一些筛选 。
可能说之前我大部分是走重人力的专家标注的公司 , 可能就很难活下来 , 反而说你这个数据公司里你需要有一些在一线 hands-on 的 researcher, 可能更能追得上数据它一个变化的一个潮流 。
嗯 , 所以就是你们现在也在往 RSI 的数据走 , 然后所以你们出的那个 RSI 的 bench。
对 , 当然数据是一方面嘛 , 就是也不是说我们会只做数据 , 数据总的来说一方面它会有现金流 , 另一方面它也会反哺我们的一些认知 , 让我们去有更多的一些 know-how 去做 RSI 这件事 。
但你要做 RSI 就讲回来像你刚才提的 , 就是你必须是自己真的去训模型了 。
对 ,但是事实上就是现在训模型的话 , 你基本上可以把它约等于成造数据 , 然后我们本身造数据的话 , 我们也会跟模型厂商有合作嘛 。
哎 , 对 , 我记得最近有一个蛮流行的一个说法啊 , 叫做那个算法就是数据 , 数据就是 infra,infra 就是算法 。
我不知道你怎么看这个 , 就是它戏谑之中好像又带着一点真相的感觉 。
对 ,其实没啥毛病 ,因为算法就是数据这块 ,是因为本身就像算法它会收敛到最简单的形式 , 比方说 RL 收敛到 PPO, 我们大家如果都用 PPO 的话 , 那就是说我变成什么数据了 , 然后数据就是 infra。
对 。
呃 ,其实这也比较好理解 , 就是相当于你怎么训的更快嘛 。 就比方说我现在我有一批 RL 的数据 , 那么其实 RL 它训练慢主要原因是说推理的时候我会有很多的一个呃 , 这个专业名字叫长尾 , 就是因为现在 RL 一般是说这批数据我推理完以后, 然后我再整理整理格式 , 然后导入到训练 。
当时我在推理这批数据呢 ,有时候呢可能 100 个数据 , 前 99 个我在一分钟内推完了 , 然后最后一个数据呢我要给它推 100 分钟 。
那么我在这个过程中呢 , 我这些卡的资源相当于闲置了嘛 , 然后也很慢 , 我都在等那玩意 。
所以这时候就需要你 infra 上有些改进 , 去帮助你这批数据给它训得更快 , 然后 infra 就是算法 , 它也更好理解啊 。
比方说我们就以 SFT 这个算法为例 , 当我们现在需要去训练那种很大尺寸的模型的时候 , 我是需要有非常多的 GPU 的层面的 , 或者说模型 context 层面的一个并行的 , 那样我才可以训这么长的轨迹嘛 , 确实没毛病 。
然后呢 , 从现在的观点来看呢 , 算法还稳定了 ,infra 呢基本层面上也是稳定啊 , 当然它是一个跟着需求走的过程 。
如果说我后面我的 RL 过渡到就我推理到数据 , 我都需要一天甚至好几天 , 那它 infra 层面 , 包括算法层面 , 它都会有一些修改 。
所以说数据是它们的一个驱动 , 更难的数据我会带来需要算法上进行一些创新 , 或者说带来我 infra 层面上需要做一些更 efficient 一些的设计 。
我个人觉得是这样的 。
嗯 , 那数据你觉得未来大家还会往更高数据量去走吗 ? 或者说大家肯定希望 ,但是不是还有那么多的数据呢 ?
或者说是不是就是合成数据 , 那合成数据是不是未来会慢慢的变成一个类似于无限数据的感觉呢 ?
呃 , 无限数据倒不太可能 , 就是当这个数据目前来说它量确实是在提高的 ,但它不会说就那种毫无节制的提高 。
高质量数据我一直会有 , 一直会在提高的 ,因为其实就是你目前来说也不至于说数据是完全枯竭了 ,因为一方面是说 agent 它合成数据是一个新的来源 , 然后并且呢 , 当我这个 agent 用的人越来越多以后, 就像我刚刚说的 , 我这个商源是在提高的 , 它会反哺我合成更多更好的合成数据 , 然后这块去反哺模型的一个训练 。
所以说数据的量我个人觉得它一定是会增加 ,因为模型尺寸在增加 , 同时呢它的质量也会是在一个逐步提高的一个过程 。
合成蒸馏46:11
嗯 , 然后当大家聊到合成数据的时候 ,其实难以避免的会聊到蒸馏的这个问题嘛 。 因为很多人其实我理解就是合成数据跟蒸馏是绑在一起去看的 。
呃 , 我不知道你怎么理解解释现在这种情况 。
呃 , 对 ,因为合成数据里面其实我们也需要就像我刚刚说的 , 我们有一个环境 , 然后有一个问题 ,以后我需要有一个 agent 在里面去探索嘛 。
那么探索的这个 agent 它有时候就可以是一些外部模型嘛 , 像 Claude, 当然我们也可以用内部模型 。 那如果是用外部模型的话 , 可能就是我们现在大家说的一个蒸馏的观点 。
那这时候它到底是所谓的硬蒸还是说有技巧蒸 ? 那硬蒸的话 ,其实说白了就是说你这个环境太简单了 , 比方说就是做那种非常普通的数学题 。
就是只给呗 , 对吧 ? 类似于啊 。
对 , 我这个题我老师直接做不了 , 拿过来抄 。 那像我刚说的 , 如果我这个环境足够复杂 ,并且我对应的这个题 , 还有我这个题的一个评分是正确的 ,并且足够高质量 , 本身这一套就是一件很有难度的事了 。
如果有这一套以后, 我当然是能够搞出来更好的一个所谓的合成数据 , 或者说蒸馏数据 。 那么这块就是说有技巧蒸嘛 。
所以能不能理解说合成数据这件事情 , 如果用好了 , 对于相对落后的模型来讲 , 价值是远高于领先的模型的 ?
这件事是肯定 ,因为它学习的 margin 会更多 。 嗯 ,但是对于领先模型也是有用的 。
哎 ,但我再理解一下, 就是如果比如说我已经是最领先的模型了 , 我造了一个环境 , 然后我用我今天的模型自己去做 , 那不是出的结果跟现在是一样的吗 ?
啊 , 这个就是完全说就是 RSI 这件事 , 就是因为你其实本身来说 , 当你造出来这套足够复杂的环境 , 还有那些题以后, 就算我模型我自己本身我在里面去探索 , 然后拿到一些正确的轨迹出来 , 我去训我自己也是可以提点的 。
这件事情是已经被证明了 。
这个是有什么原因的吗 ? 还是其实仍然是一个比较黑箱的一个状态 ?
呃 , 这块其实说白了就是 RL 做的事 , 比方说 。
技术路线48:18
就就是不断强化的一个过程 。
对 。
OK, 哎 , 现在你觉得整体的模型状态 ,AI lab 的状态 , 就目前大概在一个什么空间上啊 ? 因为我记得说在之前可能大家经历过 , 就觉得 scaling law 是不是撞墙了呀 , 对吧 ?
有这种时期 。 那你觉得现在对做 AI 的人来讲 , 尤其 AI lab 的人来讲 , 是一个觉得空间很大 , 我们继续做目前的路线 , 就还能持续的提升 , 还是说觉得哎 , 现在这些可能快穷尽了 , 我们仍然需要新的架构 , 新的一些技术路线啊之类 ?
我觉得这块是这样的 , 就是一方面可能说也不说老吧 , 就是 coding 这一块 ,coding 这一块就是从年初到现在 , 一直都是最重要发力的方向 , 就这块一直在搞 。
因为 coding 其实是一个智力的一个基础 , 相当于它要去持续的提高它这个模型智力一个上限 。 然后呢 , 这一块虽然它这个增长还是很迅速 ,但是可能它整体的 pipeline 是相对可能稍微稳定一些 。
所以说这些 AI lab 也会说去探索一些嗯其他的技术路线 , 就像 Auto-Research 这种 , 比方说您看像 Claude, 像 OpenAI,他们都会在 Auto-Research 上去搞 , 然后他们的 Auto-Research 可能说是我要去服务一些 AI for Science, 这里其实就相当于是一些新的技术路线了 。
哎 , 对 , 我不知道 AI for Science 你们有在接触吗 ? 最近其实这个东西也蛮火的嘛 , 对吧 ? 尤其是你看字节 Seed 最近出的那个 100 科学家的计划 , 对吧 ?
对对对 。
然后 Anthropic 什么他们也在搞 ,但理论来说 AI for Science 好像似乎跟模型本身不是在一个完全重合的一层上 。 对 , 我不知道你怎么看这个问题 , 为什么大家开始在这上面发力 ?
因为现在其实大家也开始提 Auto-Research, 就是您可以看到现在像千问啊 , 像 Kimi 他们的 release 的那个报告里 , 都会有一个它完成一个非常长 , 然后不断改进任务的一个过程嘛 。
然后他们可能大部分都是说去写 GPU kernel,AI for Science 也是类似的嘛 , 就是比方说他们会要求这个大模型去设计一些分子结构啊 , 蛋白质这种东西 , 这个其实一方面就是也是他们一个体现模型智力的一个手段 , 一方面这也是一个相当于比较直接的一个应用 。
对 , 我看 GPT 最近在 PR 什么新的模型嘛 , 然后流出来的就是说 GPT。
做数学题 。
对 , 就解决哪些什么数学猜想啊 , 什么这些层面的东西都已经是 。
因为他们仅从 coding 这个层面无法体现这个模型的智力啊 。Science STM 这个领域 , 它本身是一个你衡量模型的智力的一个很直接的一个东西 。
对 , 就是已经从 outside 转到 Nobel 那个 。
对对对 , 这个其实都是在 for 模型智力这一块 。 这模型厂其实他们需要找到这些场景去 PR 这些东西 。
嗯哼 , 所以你整体上是觉得目前 AI lab 的状态还是说未来有非常大的空间的 , 对吧 ? 大家就是继续做就好了 , 就不会就像 24 年大家需要 RL 一样 , 就现在不太需要这种东西是吧 ?
呃 , 这块我我觉得是这样的 , 就是模型厂的模型增速是一直在的 ,但是这个模型增速背后, 比方说到底需不需要这么多 researcher, 或者说现在 researcher 一个高薪能不能维持 , 这个可能倒不一定 。
对 ,因为我现在听起来也是大家很多东西已经确定了 , 相对对吧 ? 就是在既有的路线上继续做就好 。
呃 , 一定程度上是确实是这样 。 嗯 , 比方说 coding 确实是这样 。
嗯 , 明白 。 嗯 , 所以长期来看有什么 , 就是我们如果把字节 、 腾讯 、 阿里这种卡很多 、 资源很多的大厂分为一类 , 然后另外所有的这些新的 AI lab 分成一类的话 , 你怎么看未来这两类公司的发展 ?
竞争未来51:40
我个人可能还是比较 prefer 初创公司这一挂的 ,因为技术其实一直在公司与公司之间流通 ,其实可能大家技术水平的差异上不会说特别大 。
那我觉得可能它背后就在人这里 , 就也不是说大厂直接从初创挖人, 然后过去就直接很厉害 。
但按我们刚才讲的 , 就是你会看到技术路径虽然会不断的迭代 ,有新的 ,但它会在比较短的时间内大家就统一 , 对吧 ?
就是形成共识 , 然后最终是不是就是平卡 ?
哦 , 我觉得其实也未必 。 我反而觉得最后可能就是划归到一个组织的形态上 ,因为当你技术大家都懂的时候呢 , 你这个组织设计怎么让你这个公司作为一个整体跑得更快 。
我之前可能没感觉到 ,但我现在感觉还是一个比较有学问的事 。
OK, 明白 。 就是你刚才提的那个 , 比如 Domo 它要不要分出来啊之类的 。
啊 , 对 , 就是这种组织架构的一个设计上 。
嗯 , 现在也有很多人在讲 , 比如说会有人讲说智谱 coding 做得好 , 就是因为他们没有分很多精力去做多模态啊等等那些事情 。
然后也有人会说就是多模态 , 甚至于包括世界模型等等 ,其实不是在智力主线上的 , 对吧 ? 它其实做那些事情并不提升模型智力 , 只有 coding 啊 , 数学啊什么这些是提升模型智力 , 这个你咋看 ?
这块我觉得可能也有点绝对吧 。 我并不觉得这个多模态不重要 , 然后我也觉得它应该放到主线上 。
嗯哼 , 只不过就是现在也是基于资源考虑 , 它不能说我进行一个全模态这种优化 ,因为就是多模态的话 ,其实它的发展相比于文本要慢特别多 。
因为文本的话 , 它一个信息是经过一个高度的一个压缩的 , 所以它本身学的也会比较快 。
明白 。
但是多模态的信息就是噪声会比较多 。 嗯 ,但是其实呃 , 我会觉得多模态之后也会变得比较重要 ,因为当你这个 AI 想进入一个物理世界 ,其实它就已经不仅仅是视觉了 , 它甚至还有说听觉啊 、 触觉啊 , 各种各样的一个东西 。
嗯 , 明白 。 最后我问一下, 可能相对敏感 , 你觉得蒸馏这件事情对于国内模型 , 它追赶的意义到底占比有多高 ?
国模追赶53:58
呃 , 那我这么说吧 , 就是我不说具体占比 , 我觉得蒸馏不是国内模型变强的一个决定性因素 。 因为就像我刚刚说的 , 国内模型的变强 , 一方面是来自于它一个底层架构的一个创新 ,因为其实现在我们大家比较共识的一个观点是说预训练去学知识 , 后训练是在这个预训练的分布上做一些这个分布的一个 shift 吧 , 然后相当于它可能或者我本来之前有会了 ,
然后我现在通过后训练 , 我答对它的一个正确率更高 。 所以这样看的话 , 它一个智力的基础是来自于预训练的 。
那么其实预训练的话 , 我个人觉得国内是做的比较好的 ,因为它有非常多的一个像 Kimi 的梦优化器啊 , 各种各样的一个东西 , 我个人觉得它是一个追赶最主要的因素 。
OK。
然后后续我个人觉得蒸馏是国内公司的一个加速手段 ,也不是说没有 Claude 的 API 它就做不出这个事 。 因为没有 Claude API, 它一方面它自己模型也很强嘛 , 就是它可以在自己的模型去做这种合成数据 , 然后另一方面其实国内因为本身人也这么多 , 它想搞数据积淀的话 , 它真下狠心也不见得搞不出来 。
OK, 嗯 , 对 , 那挺好的 。 就是说能蒸最好 ,不蒸也行 。
对 , 就蒸馏只是说因为现在国内公司竞争很激烈嘛 , 它也作为一个加速手段嘛 ,但它并不绝对 。
对 , 所以比如说因为现在你尤其是 Anthropic 啊什么的 ,他总说国内模型蒸馏的问题 , 对吧 ? 所以按照你的说法 , 就是哪怕有一天他真的把所有的蒸馏的那个门路都封掉了 ,其实也不影响国内模型追赶 , 只是更费劲一点点而已 。
对对 , 我个人是这么觉得的 。
嗯嗯 , 那蛮好的 。 那再多问一个问题 , 那如果这么讲 , 为什么字节一直就是不愿意蒸 , 或者说一直对外讲说我们就不蒸呢 ?
就蒸的坏处是什么呢 ?
蒸馏的话 , 相当于你是一个抄近道嘛 。
嗯 , 你可能会遗失到你那条主路上, 你可能会发现一些 inside 的 。 我觉得他们可能这个考虑了 。 嗯 , 所以仍然我觉得像你讲的 , 就是它是一个工具 , 对吧 ?
公司展望56:11
在于看你怎么把它用好 ,而不是就它本身其实没有什么问题 。 嗯 ,OK, 然后基本的我觉得聊的差不多 , 然后最后再讲一下你们现在正在做的事情吧 , 就基于我们 ,因为我觉得我们今天就聊了很多新的模型啊 、 数据啊 , 包括一些敏感的蒸馏的问题啊等等 , 就是把整个的现在可能 AI lab 面临的各种情况问题讲的是比较清楚了 。
然后你可以最后再讲讲 , 那你们现在在做的这件事情 , 然后包括未来的一些规划 。
我们公司的话是一家初创公司 , 然后名字叫这个 Evolvent AI, 基本上跑了半年左右了 。 目前的话团队也是主要以这种 00 后的 researcher 为主 , 然后我们可能目前来说主要是 focus 在两块 ,但是其实并不割裂 。
一块就是说是一些合成数据 , 那么这块可能就是有一些合成数据的合作啊 , 或者商单这样的 , 包括我们其实在做合成数据的时候呢 , 我们自己也会做一些 bench, 这块也是相当于我们也有一些学术界上面的一些探索吧 。
然后还有一块就是长期来看 , 我们会去做 RSI 这件事 。 那我们做 RSI 呢 , 相比于其他做 RSI 的公司会有一些不同 , 就是我们可能并不会去 focus 在说我们要去做 RSI 专用的技术模型 , 或者说是我们要去做一些 RSI 的方法 。
具体原因就是刚才跟曲老师也讨论过 , 最终是我们想做的一件事 , 是一个桥接模型厂与应用公司的一个中间的一个东西 , 包括我们最近出了一个 benchmark, 叫这个 RSIbench-Data, 那么它其实也是说是在这个平台内针对于 data 这个事进行 RSI 的一个初步的一个探索 。
大家有问题也可以跟我们交流 。
嗯 , 你们现在那个有在比如什么招人啊这种诉求吗 ?
对 , 招人的话我们就一直都开放的 , 反正就是有任何兴趣其实也就直接给我发邮件就行 。
你觉得现在同样是 researcher 来讲 , 什么样的画像呢 ? 是最值钱的 ,是你觉得你们特别喜欢的 ?
啊 , 对 , 对 , 对 , 对 , 对 , 对 。 对于 researcher 来讲 , 我们可能并不会看一些量化指标 , 比方说发了多少论文啊 , 还有那个有多少引用这种 。
我们可能比较关心的一个事 , 就是他这个工程能力怎么样 。 我现在个人会觉得就是说 , 一个有比较好的工程能力的人 ,是比一个学术能力很强的人就是更好的一件事 。
嗯 , 好呀 , 感谢感谢 , 感谢繁青时间 。
感谢感谢 。
ああ 、 痛くなったら 、 また光のサインで
遠回りになるけど 、 ただ二人に時を見つけてあげるのは、 見つけてあげるのは二人と
。
