# 一个人、两周、数百美元，如何训出登顶 Hugging Face 的模型 | 对谈研究员逯雨鑫

42章经 · 2026-08-29

<https://42.podhood.com/0da19193-ce86-4917-8b77-acb1e738b899>

某 AI Lab 研究员逯雨鑫向曲凯和陈皮复盘了他以个人开发者身份训练两个小模型并登顶 Hugging Face 热榜的过程：仅用一张 5090、QLoRA 和 200 美元的 Cloud Max 月费，花约两周、总计数百美元，基于 Gemma 与 Fable 微调出模型；第一版用了 5 天，第二版 2–3 周，其中绝大多数时间在整理和审核数据。他并非 AI PhD，强调卡点几乎都在数据而非训练——合成数据效果有限，真实数据约占 60%–70%，总量几千到一万条，需人工审核；还要应对'老师太强、学生太弱'的 Capacity Gap，因此选择 SFT 而非 RL，并推荐 Qwen 作为坑最少的开源底座；他定义的'好蒸馏'是锚定真实使用方向，而不是 Benchmark 分数。他对应用公司的成本估算是一个小模型几千到 1 万元人民币（不含 serving），并认为训练会一步步商品化，应用公司将成为 Neo Lab，AI Lab 的价值集中到前训与研究；数据是稀缺资源，AI Lab 重金买数据就像早期字节砸钱买用户。他还看好 Local AI 成为 PC 级机会，隐私与成本会推动本地部署（如 Hugging Face 曾遭攻击后改用国产模型本地解决），但主流用户仍会用豆包这类够用的模型，而非执着于 SOTA。

## Questions this episode answers

### 逯雨鑫训练这两个模型花了多少时间和多少钱？

逯雨鑫介绍，第一代约5天左右，第二代约两到三周；用一张5090加QLoRA，再配合200刀的Cloud Max订阅来合成靶向数据。真实训练只有十几个小时、几版迭代，硬件成本不超过100刀，总计几百美元。

[3:23](https://42.podhood.com/0da19193-ce86-4917-8b77-acb1e738b899?t=203000)

### 个人训练模型的完整Pipeline是怎样的？

逯雨鑫说，先明确目标，再选底座模型（中文任务建议选千问等，Jama 42B中文差），然后做数据管线；训练方式上他推荐SFT而非RL。之后一版版迭代、跑Benchmark并从错题中找问题，最后发布。整套流程第三方开源工具齐全，真正难的是数据。

[6:08](https://42.podhood.com/0da19193-ce86-4917-8b77-acb1e738b899?t=368000)

### 合成数据效果到底怎么样？真实数据和合成数据怎么配比？

逯雨鑫表示，合成数据其实并不很好，只能靶向解决特定问题，比如治疗过度自信；最好多采用真实使用和社区贡献的数据。他做数据时真实数据约占60%到70%，其余为靶向合成数据；总量做到小一万条，剔除后实际用几千条即可。

[11:45](https://42.podhood.com/0da19193-ce86-4917-8b77-acb1e738b899?t=705000)

### 如果用户最终追求的是SOTA级智能，Local AI还会有未来吗？

陈皮问用户最终是否只想要SOTA智能；逯雨鑫承认本地模型目前使用率不高、不如SOTA，但在网络安全、生物等数据敏感领域，本地部署能保护隐私并省钱。他认为未来电脑和手机能跑更强模型后，很多人会为隐私和成本转向Local AI。

[40:20](https://42.podhood.com/0da19193-ce86-4917-8b77-acb1e738b899?t=2420000)

## Key moments

- **[0:00] 开场**
- **[1:34] 非典型背景**
- **[3:23] 训练成本**
  - [3:35] Q: 一个人训出登顶 Hugging Face 的模型要花多少钱和时间？逯雨鑫：复训 Jama 42B 用了 1 张 5090 加 QLoRA、200 美元 Cloud Max 订阅，硬件成本不超过 100 美元
  - [4:54] 逯雨鑫：复训后的 Jama 42B 在 Agentic Benchmark 上从 15 分提升到 55-60 分，但其他 Benchmark 会下降
  - [5:56] 逯雨鑫谈训练模型：“大家没有做呢，我觉得最主要的原因是在于觉得这个东西非常非常复杂，实际上并没有这样。”
- **[6:08] 完整流程**
  - [7:03] 逯雨鑫踩坑：Jama 42B 中文很差，12B 量化版大部分时间在说粤语，所以中文场景他建议选千问
  - [8:32] 逯雨鑫：“Reinforcement Learning 被吹得很神，其实我觉得效果是没有 SFT 好的，所以说我最后只选择了 SFT。”
  - [9:40] 逯雨鑫：训模型整套流程的真正难点只有数据端，他 95% 的时间都花在做数据上，而不是训练
- **[11:34] 数据与蒸馏**
  - [11:45] 逯雨鑫：合成数据其实并不好，只能靶向解决 Jama 42B 过度自信这类错题，大部分数据要靠真实使用
  - [13:48] 逯雨鑫：他的第二个模型两周里 12 天在做数据——5000 条要人工审 500 条，AI 合成数据质量太差、得一遍遍改
  - [15:06] 逯雨鑫：模型数据配比是 60%-70% 真实数据加靶向合成数据，总数小一万条，实际用几千条就够
  - [16:20] 逯雨鑫：把 3T 参数的 Fable 5 蒸到 12B 小模型会遇到 Capacity Gap（老师太强学生太弱），大量能力学不到，只能一版版测
  - [18:36] 逯雨鑫：判断蒸馏好坏不看 Benchmark，锚点是你的目标方向；只要把模型分布往目标方向拉就是好蒸馏
- **[20:01] 性价比与避坑**
  - [20:24] 逯雨鑫：应用公司训练自己想要的小模型成本几千到 1 万人民币，大模型要花十几万到 20 万以内
  - [21:46] 逯雨鑫：因为想找好看的武侠小说找不到（除了金庸没几本好的），他开始自己微调小说模型
  - [22:22] 逯雨鑫：千问模型是目前小模型里坑最少的；扎马 4 和 Muse 这类架构不主流的模型训练起来非常复杂
- **[23:44] 标配与商品化**
  - [24:04] 逯雨鑫预测：未来中大型公司会设 3-4 人小团队训自己的模型，预算就是这几个人工资加部署和显卡费用
  - [26:04] 逯雨鑫：把模型训练做成商品化服务是趋势，海外已有 unsolved 和 Hugging Face Job 在做，但 Infra 还不成熟
- **[27:01] 新Lab分工**
  - [27:46] 逯雨鑫预测：AI Lab 会减少，小应用公司前期可把训练外包给 AI Lab，等做到几百万用户后再自建 AI 团队
  - [30:49] 曲凯转述红杉观点：最新 AI 应用公司未来反而会变成 New Lab；应用公司的场景、用户数据和商业闭环才是壁垒
- **[33:39] 数据争夺战**
  - [33:56] 曲凯：AI Lab 现在砸钱买数据，就像移动互联网早期字节砸钱买用户，越早买越便宜
- **[35:25] AI Lab之选**
  - [35:32] Q: 一个已经自己训出榜一模型的人，为什么还要去 AI Lab？逯雨鑫：因为前训才是 AI Lab 的价值，应用公司做前训要 128 卡甚至 264 卡跑好几个月
- **[36:59] 本地AI机会**
  - [37:10] 曲凯类比：AI 会像大型计算机变成 PC 一样，从几家大模型走向人手一个跑在端侧的模型
  - [37:41] 逯雨鑫预测：未来每个人都会有自己的 Local AI，因为调 API 数据会被上游看见，中转站甚至会卖你的数据
  - [38:53] 逯雨鑫预测：2027-2028 年苹果会出 2T RAM 统一内存电脑，能本地跑 GRN 5.2，不用再调上游 API
- **[40:20] SOTA之争**
  - [40:20] Local AI vs SOTA：用户真会放弃前沿模型吗？逯雨鑫：日常聊天仍用大模型，但网络安全和生物领域数据敏感只能 Local AI，写小说还能省几千到几万
  - [43:48] 逯雨鑫举例：Hugging Face 被攻击后只靠中国国产模型本地部署解决，所以很多公司会偏向自建模型
  - [45:46] 曲凯：大多数人最终看的还是性价比，隐私不是用户个人选择，而是苹果这类应用公司在推动

## Speakers

- **曲凯** (host)
- **逯雨鑫** (guest)
- **陈皮** (guest)

## Topics

模型, AI创业

## Mentioned

Hugging Face (company), Kimi (company), Model School (company), 智谱 (company), B300 (product), Claude (product), Cloud Max (product), E2B (product), Fable (product), GPT (product), H200 (product), Jemma (product), LLaVA (product), QLoRA (product), 千问 (product)

## Transcript

### 开场

There's something there.

**曲凯** [0:21]
我们今天很开心请到了雨鑫 ，因为雨鑫之前一段时间最有名的一件事情就是它自己做了一个基于 Jemma 跟 Fable 微调的一个模型 ， 然后当时是在 Hugging Face 里面排名开源模型的搒一 ， 然后超过了众多大家耳熟能详的这些模型 。

然后雨鑫来简单介绍一下 。

**逯雨鑫** [0:40]
我叫陆雨鑫 ， 然后我之前呢是做过一阵 Data Engineer， 然后后来呢因为也对这个 AI 方向比较感兴趣 ， 读了一个关于 AI 方向的研 ， 目前呢也是在一家 AI Lab 做一名 AI Researcher。

**曲凯** [0:56]
嗯对 ，但我的了解就是说你是做完了你自己的这个模型才加入的 AI Lab， 对吧 ？

**逯雨鑫** [1:02]
嗯是的 。

**曲凯** [1:03]
对所以我觉得特别有意思的就是 ， 我觉得今天大多数人还是觉得训模型是一件非常难的事情 ， 就大家不知道这里面都有哪些步骤啊 ， 该怎么做这件事情 ，以及呢大家印象当中的训模型的人一般都是什么各种 PhD 啊 Researcher 啊之类的 ，但你的背景呢听起来不像是一个典型的能训模型的人， 对吧 ？

就是你之前也没有在 AI Lab 做过 ， 你其实没有参与过实际的这些训模型的事情 ， 然后你至少目前的这个 Title 你还是一个 AI 的研究生 ， 对吧 ？

你也不是一个 PhD。

**逯雨鑫** [1:33]
嗯是的 。

### 非典型背景

**曲凯** [1:34]
对所以我想就有几个简单快速的问题啊 ， 就第一是你为什么能做这件事情 ？

**逯雨鑫** [1:41]
第一点啊就是我也是一开始的时候对 AI 很感兴趣 ， 就是我是从 2022 年到 23 年左右 ， 然后 GPT 第一次对外开放的时候 ， 然后我使用上了 。

使用上以后呢的确我发现了很多很有意思的事情 ， 然后后来呢做 Data Engineer 的时候呢也遇到了很多 AI 行业的一些目前是领军人物 ， 之前的时候也是一个研究员或者是一个研发者 ， 然后跟他们也是聊了很多 ， 对自己也是包括对这个行业也都更加了解 。

所以说呢我最后去选择了 AI 这条路线 ， 然后其实这条路线的话呢我个人觉得并没有多难 ，并没有大家想象的就是必须得很厉害大牛啊各种名校毕业的 PhD 什么的 。

呃我个人觉得呢如果说你要是搞学术方面的 ，因为其实 AI 方面其实有很多种 ， 一种就是工业级的 ， 一种就是学术级的 。

学术的话呢就是帮助这些工业的人士更拓展一下思路 ， 然后包括一些新的方法呀新的研究领域什么的 ，但是呢其实真正能使用到让大家就是可以训模型的其实就是工业界的 。

那工业界的呢其实就是两种方法就是比较出名的 ， 一个就是 SFT 一个是 RL。 所以说呢只要把基础补好 ，其实每个人慢慢的也都可以做到 ， 尤其现在还有这么多这么强的 AI 伙伴 。

**曲凯** [3:07]
嗯所以其实就你的这些东西完全是自学的是吧 ？ 可以这么理解吗 ？

**逯雨鑫** [3:12]
最基础的东西是我自学的 ， 后来也是上研究生帮我夯实了一下基础 。 我觉得研究生更能提供的是一种方向 ， 只要你走对方向呢自学是完全 OK 的 。

### 训练成本

**曲凯** [3:23]
嗯这个模型你能不能快速给大家讲一下， 比如大概花了多少天 ， 花了多少钱的成本 ， 或者用了多少卡之类做出来的 ？

**逯雨鑫** [3:35]
我个人呢这个项目呢是 Jama 42B 的一个复训 ， 时间成本就 5 天左右第一代 ， 然后第二代可能多一点 ， 第二代可能用了两三周左右的时间 。

金钱上成本其实非常低 ， 我之前的时候整个项目是用了就一张 5090， 然后用了 QLoRA， 再加上一个 200 刀的这个 Cloud Max 订阅会员 。Cloud Max 订阅会员呢用于这个合成一些我想搞的领域的一些靶向数据 ， 然后加上呢我又在网上尤其是 VR 的时候 ，在 Hugging Face 的这个很关注我这个模型的一些粉丝吧或者说群众 ， 然后给我提供了很多关于 Fable 5 的一些珍贵 Rail Trace 的一些非常好

的数据 ， 然后帮助我去做成了这个 VR。 所以说我觉得如果说你只是想单纯的在特定领域上提升的话 ， 只要花费可能很少的钱 ，因为其实我的 5090 现在目前我看无论是国内啊还是美国啊租卡都非常便宜 ， 好像一两美金吧可能就一个小时， 然后真实训练的时候呢其实也就是十几个小时的事情 ， 可能几版迭代 。

我估计硬件成本的话也绝对不会超过 100 刀的 。

**曲凯** [4:45]
嗯所以总的算起来其实你就花了也就是几百刀 。

**逯雨鑫** [4:49]
对 。

**曲凯** [4:50]
嗯然后训出来这个模型最后的效果大概是怎么样的 ？

**逯雨鑫** [4:54]
目前呢我这个在 Agentic 领域里面 ， 尤其是对比 LLaVA 3 的这个 Benchmark 上， 然后原版是差不多好像是 15 分 ， 然后我提升到了 55 分到 60 分的这一个水平 。

但是呢目前呢对很多个人还有应用公司呢只能说往特定的领域去提升 ， 然后其他 Benchmark 上或多或少都会有一些下降 。

**曲凯** [5:16]
嗯哼就我能不能简单理解 ，其实你是用所谓 Teacher 的这个更高级的模型 ， 然后做了合成数据 ， 然后做了 SFT， 蒸馏出了一个特定领域的小模型 ， 然后结果就是这个小模型在某些特定领域的表现是要强于原来的模型的 。

**逯雨鑫** [5:32]
是的 。

**曲凯** [5:33]
嗯哼哎但这件事情就是听你讲起来好像很简单 ，而且就是我们刚才一直有在讲的 ， 就是你的背景也不完全是一个多 fancy 的这种 AI Research 的背景 。

嗯所以这件事情现在为什么不是一个大众化的事情 ？ 或者就首先我确认一下说你觉得你身边做这件事的人多不多 ？

是我们有盲区其实大家已经都在做了还是确实不多 ？

**逯雨鑫** [5:56]
呃我觉得你们的预测很对 ，其实就是大家都是没有做 。 大家没有做呢我觉得最主要的原因是在于觉得这个东西非常非常复杂 ，其实实际上并没有这样 。

### 完整流程

**曲凯** [6:08]
嗯哼哎所以你能不能给我们大概完整的讲一下说从你想做这个模型开始 ， 到把它做出来 ， 中间大概是分了哪几步 ， 然后你是怎么做 ， 中间可能遇到哪些问题怎么解决之类 。

**逯雨鑫** [6:23]
首先我觉得你要明确自己要做什么 ，因为其实对于很多个人开发者来说 ， 上来就想说哎我要拿热度 ， 现在什么火做什么 ，其实现在什么火竞争对手也非常多 。

所以我觉得先明确目标 ， 比如说我是在应用公司可能搞这个 Business 的 ， 那么就围绕着 Business 你去想一下你想要做什么 ， 你对于这一点先有一个明确的想法 ， 然后呢就可以进入到第二步了 ， 找一个底座模型 。

找底座模型的话呢这个里面也有很大的这些问题 ， 比如说一些架构啊什么这些东西 ， 我觉得也得需要具体的去看一下哪个方面适合你 。

比如说 Jama 42B 我遇到最大问题 ， 包括我现在没有解决的问题 ， 就是它的中文非常差 ， 尤其是在 12B 模型的情况下， 无论是哪种量化版本 ， 大部分的时间都在说粤语 。

所以说如果是你是一个偏中文向的 ， 那么你就要选择一个类似于千问这样一个模型 ， 然后等你选好底座模型了 ， 我觉得就可以开始专心的去想一下这个数据管线该去怎么做 。

那么数据管线的话呢目前呢就是有几种 ， 第一种就是合成数据 ， 你可能扮演一下用户 ， 然后 AI 帮你生成 ，也可以说你用两个模型 ， 第一个模型呢是比如说 GPT 5.6 可以当作为用户 ， 然后另一个模型呢可以当做这个真实使用的这个模型去合成数据 ， 然后也可以选择呢去网上 。其实现在对开源社区非常友好 ， 它有很多好的数据 ，在 Hugging Face 上也好 ， 还有我没记错

是 Model School， 就是国内的一个非常出名的一个也是类似于 Hugging Face 的一个平台 。 然后这些好的数据拿到以后， 或者是说你自己做好以后， 我觉得就可以下一步了 ， 就是考虑一下你想怎么做 。

现在其实在工业界非常流行的就是两种做法 ， 一个是 SFT， 简单来说就是蒸馏 ， 把你的老师模型 ， 比如说 Fable 5 也好干嘛也好蒸下来 ， 然后把数据呢喂给你的小模型 ， 这样的话呢就会有一个很明显的提升 。

但是呢这个具体的也得看你的数据质量是怎么样的 。 然后还有一种呢就是 Reinforcement Learning，也就是 RL， 被吹的很神 ，其实我觉得效果是没有 SFT 好的 。

所以说我最后只选择了 SFT， 当然这期间呢还有很多别的方法 ， 比如说 OPD 啊什么这种 ， 我觉得目前来说对于很多应用公司 ， 对于个人来讲 ， 只有第一种是比较实际的 ，因为后两个的成本会非常高 ， 然后之后就是一版一版迭代 ， 包括你做完以后这个模型了 ， 你需要看一下效果好不好 ， 比如说你有一些特殊的 Benchmark， 你可以跑一下看一下这个效果如何 。

如果说不好的话 ， 那你可以从中看一下这个到底是为什么不好 ， 从错题里面 ， 然后从这些里面你再去迭代 ， 到最后就可以发布了 。其实整个流程就非常简单 ， 我觉得如果对于一个比较了解这个流程的 ， 可能也就只需要几天 ， 然后如果不了解流程的 ， 我觉得也很快 。

我之前学到的很多基础知识 ， 我觉得其实对大部分人来讲是没有必要的 ， 比如首推 MRP 开始啊什么 ，其实都没有必要 。

我觉得真正的难点就是在整个这套流程下来 ，其实就一个 ， 就是数据端 。 很多人都会觉得这个 AI 啊可能是有很难 ， 比如说在 Infra 啊什么乱码七糟 ，其实这些问题你自己多看看书 ， 自己多搞搞 ，其实是很快就解决的 。

真正的卡我的 95% 的时间 ， 我都用在了这个做数据上 。 所以说真实的问题 ， 我觉得就是对于数据的一个洞察力 ， 这也是最难的一点 ，也是目前 AI 所有领域里面遇到的最大的卡点 。

**曲凯** [10:17]
嗯哼这里面你刚提到那些流程里面 ，是不是大多数都是有第三方的开源的一些工具啊架构啊什么的 ，是可以直接用的 ？

**逯雨鑫** [10:24]
对其实整套流程全部都有 ， 包括训练的脚本啊 ， 然后包括已经公开的一些好数据啊 ，Benchmark 这些全部都是公开开源的 ， 你可以在任何网站上拉下来你想要的代码 ， 然后你可能用 Agent， 然后加上自己去学习一下， 很快就可以改成你针对你自己模型的这个东西 。

**曲凯** [10:46]
嗯然后这个过程当中， 你所有的都是用的 Cloud 或者 Codex 这种吗 ？

**逯雨鑫** [10:51]
呃对我这个个人项目全部都是用 Cloud 去完成的 ， 然后 Codex 的话呢其实我不是很喜欢 ，因为 GPT 现在这个模型啊有点不太适合去做规划 ， 它适合做去执行去写代码 。

**曲凯** [11:06]
嗯嗯明白 ， 然后大家经常在讲就这个训模型 ，其实挺重要的是说你我要有环境啊 ， 要有自己的 Benchmark 啊之类的 ，但我听起来其实还是你刚才强调的 ， 如果只是一个工业级别的去使用的话 ， 这些可能也不是特别重要是吗 ？

或者就直接用第三方的就 OK 对吧 ？

**逯雨鑫** [11:24]
对对对很多时候都是有第三方去搞定的 ，其实大部分人环境啊 ， 都是可以在网上很便宜的价格去买 ， 比如说 E2B 之类的 。

**曲凯** [11:34]
嗯然后你刚才也提到说整个环节里面 ， 你觉得最重要的还是数据这一部分是吧 ？

### 数据与蒸馏

**逯雨鑫** [11:38]
对哎但我我的理解是 ， 你的所有数据是不是都是蒸馏的 ， 就都是合成数据吗 ？ 还是你也加了一些别的哦 ？

你刚好提到你有些是个社区贡献的是吧 ？ 对我觉得数据啊 ，其实我很大的一个经验就是合成数据其实并不是很好 ， 它只能去帮你靶向去处理一些问题 ， 比如说举个例子 ， 我记得比如 Jama 42B 它这个小模型 ， 它有个什么问题呢 ， 就是过度自信 。

就简单来说呢 ， 跑这个 Benchmark 的时候 ， 尤其是 TA3 的时候呢 ， 我发现在很多题里面 ， 它的最容易错的问题就是你没有完成 ，但是它就宣布了哎我完成了 。

那么你怎么去找到这些 ， 就是专门去治这个病的数据呢 ？ 这就公开数据啊 ， 还有你自己比如真实使用下来 ， 这样其实是找不到的 。

所以说这些你可以合成一些靶向数据 ，但是大部分的数据 ， 我觉得最好是一些你自己使用下来 ， 还有现在比如说公开一些 ， 比如 Fable 5 真实使用的一些数据 。

然后这期间呢 ， 还分了 thinking 和 no thinking， 就是代不代推理去蒸馏的时候一个问题 。 个人觉得这个对于个人项目特定领域提升的话 ， 我觉得都可以 。

所以说大家也可以去多关注一下这个公开数据 ， 然后包括自己有一些好的数据啊和 AI 交流的 ，也其实可以提供给 Hugging Face 啊或者 Model School 这种平台上， 然后帮助更多人去完成自己的小模型或者大模型一个后训 。

**曲凯** [13:05]
嗯所以你实际过程当中啊 ， 你觉得做数据这块到底具体的一些难点啊 ， 一些复杂的地方在哪 ？ 然后你大概是遇到哪些问题怎么解决的 ？

**逯雨鑫** [13:16]
啊首先我觉得最重要的问题是现在模型还不够 ， 包括其实目前最流行的 RSI 也是在说这个自己合成数据什么的 ， 然后去去搞 ， 然后自我提升嘛 ， 自我迭代 。

但实际上现在这个模型还是无法做到合成数据就是非常好的 ， 经常会有各种问题 ， 比如说就是得需要大量人工去负荷 。

然后包括我之前这个个人项目时候 ， 我也在这个 Hugging Face 的首页上提到了 ， 为什么我花了很多的时间做这个 V2 呢 ？

主要原因就是在于审核数据 ， 这个审核数据我基本上比如说我的数据量是 5,000 条 ， 那么我可能自己审就得需要审 500 条 ，因为 AI 目前合成数据还是非常差的 。

我觉得很多的病也都在里面 ， 比如说我说让它去帮我做一些治疗过度自信的数据 ， 你如果说只跟 AI 这么说了 ， 它做的数据其实完全是不对的 ， 你真的需要自己去审 ， 然后包括一遍一遍和 AI 来去确定你的目标 ， 比如说你觉得这一版是有什么问题 ， 你就告诉它 ， 然后它再重新去一版一版改 。

所以说我觉得这个是最耗费时间的一个事情 。

**曲凯** [14:27]
嗯对你看你第一版是花了几天 ， 对吧 ？ 第二版是两周 ， 然后这里面大概有多长时间是在做数据这块 ？

**逯雨鑫** [14:35]
第一版三天左右在做数据 ， 然后训练也就差不多一天 ， 然后第二版的时间呢 ， 我觉得差不多两周的话 ， 我得用 12 天在做数据 。

所以说大部分时间都是在搞数据 ，其实训练非常快 ， 只要你有好的显卡 ， 尤其像你这种小模型 ， 自己微调一下的话 ， 非常非常快 ， 几个小时一版 ， 几个小时一版这样 。

**曲凯** [14:57]
嗯你测起来就觉得说到底是多少条的数据是比较合理比较好的吧 ？ 以及这里面到底真实数据跟合成数据的比例是怎么样 ？

**逯雨鑫** [15:06]
真实数据的话 ， 我差不多用了 60% 到 70% 左右 ， 然后剩下的是靶向的去帮助这个模型去解决一下它自己的一些错题的问题 。

数量的话呢 ， 我做是能得做出差不多可能小一万条这样的数据 ， 包括那个整合呀 ， 包括一些好的轨迹什么的 ，但实际上真实用到的话还得剔除一大部分 。

所以我觉得真实使用下来 ， 就是几千条的一个这个量级就可以了 。

**曲凯** [15:34]
嗯你刚才其实我听你讲的时候 ， 中间提到过一个点 ， 就是说你得先去真的训练一遍 ， 去测一下结果 ， 然后再去反回头来改嘛 。

我们之前交流的时候 ， 大家也提到过类似问题 ， 就是好像大家很难纯靠看数据本身来知道结果 ， 对吧 ？

因为你训出来之前 ， 大家也不知道怎么样的数据是好的 ， 它最后效果到底会怎么样啊 ？ 我们这块你的经验是怎么样的 ？

**逯雨鑫** [15:59]
我觉得其实这一块没有什么太大经验 ， 就是一版版来测 ， 你只能在做之前的时候 ， 你看到这个数据是有问题的 ， 你就能明白你这一版训练是错误的 。

但是如果你的数据 ， 包括 AI 帮你去校对啊 ， 然后包括自己去亲自采样去看了 ， 你觉得很好 ，但是你训出来还是可能会有问题 。

这就涉及到一个非常重点的一个这个知识 ， 叫 Capacity Gap， 就是所谓的老师太强了 ， 学生太弱了 。 因为你想这个 Fable 5， 它的真实的这个体量应该是在 3T 左右以上的这个模型 ， 然后结果呢 ， 你要把它的一些真实的一些轨迹啊 ， 什么真实的一些作答 ， 你蒸到一个 12B 的小模型里面 ， 中间会有一个非常大的一个能力你就学不到 。

所以真实的情况呢 ， 就得一版一版测试 ， 然后看一下是否真的会有一些明显提升 。 如果没有的话呢 ，是否是老师太强了 ， 模型太弱了这一类的 。

然后其实我觉得整个数据里面最重要的就是在于一版一版迭代 ， 就是不要觉得一版做的没有自己想的好 ， 哎我就放弃了 ， 我不适合 ，其实并不适合 。

所以说这方面就是得需要有耐心就可以了 。

**曲凯** [17:18]
嗯然后蒸馏 ，因为你实际做过嘛 ， 大家过去几年一直有各种讨论 ， 觉得说这个什么软蒸啊 ， 硬蒸啊 ， 聪明的蒸 ，不聪明的蒸 ， 你觉得你这种现在算是怎么个蒸法 ？

**逯雨鑫** [17:30]
蒸馏它有很多种 ， 一种就是属于 OPD， 然后也就是 on policy， 一种是 off policy。其实 on policy 的话呢 ， 我可以明确跟大家说 ， 我是用几台 H200， 这一台就是 8 卡 ， 那这样我去做大量实验 ， 蒸馏是最强的 。

然后其他的话呢 ， 包括 OPD 也好啊 ， 包括 reinforcement learning， 都是在锦上添花 ，而不是说真正解决问题 。SFT 的话呢 ， 包括靶向数据啊 ， 公开的一些好的数据啊什么 ， 我觉得算是一个好的蒸馏吧 。

**曲凯** [18:02]
这个好坏到底是该怎么定义 ，是按结果去定义吗 ？ 还是什么 ？ 因为我觉得还是因为我特别同意你强调一个点啊 ， 就是大家今天在讨论这个问题的时候 ，其实都是从 AI Lab 的角度去考虑 ，但实际从工业级角度去考虑 ，其实就是怎么有效 ， 怎么成本低怎么来嘛 ， 对吧 ？

**逯雨鑫** [18:20]
对 。

**曲凯** [18:21]
那就是就是最基础简单的所谓的硬蒸 ， 我也不管那些东西 ， 就是最好的一个方式 。

**逯雨鑫** [18:27]
啊我觉得这个里面 ， 我可能明白你想讨论的一个问题 ， 就是我觉得好蒸和不好的蒸馏方法呢 ， 就是你的锚点是什么 。

我觉得和你的目标不同的话 ， 那就是不好的蒸馏 。 那比如说我就是锚点 Benchmark， 然后我蒸了很多关于 Benchmark 的一些衍生变体啊 ， 类似于这种东西 ， 然后结果呢 ， 实际上你的目标是什么呢 ？

是我只是想提升一下安全边界 ， 那这就是不好的蒸馏 。 我觉得只有是比如说你想做什么 ， 然后你真往这个模型它的分布往这面拉了 ， 我觉得才是好的蒸馏 。

不管它 Benchmark 是掉分了也好 ， 还是说任何也好 ， 只要跟你的方向是一致的 ， 我觉得都是好蒸馏 。 然后数据的话呢 ， 这面只要跟你方向一致的数据 ， 它都是好数据 。

**曲凯** [19:15]
嗯嗯对 ， 就除了那个头部的那几家 AI Lab，其实因为其他人大家也不承担 AGI 的责任 ，也不用想说我怎么训出来一个更好的高智商的模型 ， 对吧 ？

其实就是很实打实的 ， 我只要用起来更好用就 OK 了 。

**逯雨鑫** [19:28]
对对对这也是其实我这个项目能成功的原因 ，因为其实现在大家更多的是用 Agentic 和 Coding， 然后我的个人项目就锚点就是在这两个领域里面 。

所以说自然而然就很多下载量 ， 然后很多人去用 。 所以说我觉得关注一下大家真实的一些使用 ，是比锚定 Benchmark 是强的 。

当然了对于很多 AI 公司来说 ，Benchmark 只是一个考试 ， 所以说他们的目标和大众的 ， 还有应用公司的目标其实是完全不同的 。

### 性价比与避坑

**曲凯** [20:01]
嗯嗯是 ， 所以我觉得现在大家在讨论应用公司 ， 反正分 AI Lab 自己去研发的时候 ， 核心的一个点 ， 就除了我们刚才讲的一些表现上的东西啊 ， 另外最主要的点就是从成本的角度考虑吧 。

就你最后测起来 ， 你觉得你自己做的这个成本能降到多少 ， 跟那个其他那些同等级表现的模型去比的话 ？

**逯雨鑫** [20:24]
啊几千到 1 万人民币以下吧 ， 我觉得对一个应用公司来说 ， 应该就能训练出一个自己比较想要的模型了 。

当然我说的是小模型 ， 如果大模型的话 ， 那卡量还是需要上去的 。 所以说可能大模型的话 ， 应用公司可能得花十几万或者 20 万以内 。

**曲凯** [20:44]
嗯但这里面就是 ， 如果考虑到后续用户真的去调用跟使用 Token 的成本呢 ？

**逯雨鑫** [20:50]
这个就很贵了 ， 那你就是 Serving 端了 。Serving 端的话呢 ， 就有更多的坑了 ， 比如 S3 랑和 VLAN 架构啊什么的这样 。

当然这些的话 ， 成本上的话呢 ， 比如说应用公司吧 ， 如果想搞这个的话 ， 你要看一下部署的模型是什么 ， 那也得看你有用户多少 ， 对不对 ？

然后这需要去核算一下 。 但是我觉得架小模型 ， 如果是单纯的几并发或者是十几并发这种特别小的一个需求量的话 ， 我觉得一台 H200 几万块钱就可以搞定你基本上可能十几个员工的使用 。

**曲凯** [21:23]
嗯明白 。 那再问一下 ，在整个这个过程当中， 还有什么你觉得有什么坑是大家需要去注意的 ？

**逯雨鑫** [21:31]
呃我觉得其实就是别放弃 ， 然后每一个地方都会有很多坑在等着大家 。其实我也是 ， 包括我最早时候公开的一个微调模型啊 ， 就是搞小说的 。

然后我做这个小说模型呢 ， 当时是纯粹的是满足一下自己的想法 。 比如说举个例子 ， 我很喜欢武侠小说 ， 那么武侠小说的话 ， 除了金庸 ， 好像还有几本就是特别好的 ， 剩下的时候就没有了 。

那么我看完以后呢 ，其实我再想找一个好的小说 ， 那可能就很难 。 所以说呢 ， 我就开始自己做这个微调 。

这期间呢 ，也踩过很多坑 ，但是我想说其实千问的模型是坑最少的 ， 包括后来训练呀 ， 包括 Infra， 包括一些脚本啊什么部署什么的 ， 我觉得千问的模型目前来说是小模型里最好的 。

大家可以重点去搞这千问的 ， 像扎马 4 啊 ， 包括前一阵出的这个好像是叫 Muse 这个模型 ，30B 的 ，其实都是架构非常不主流吧 ， 然后所以导致的训练起来会非常的复杂和非常麻烦 。

然后具体的每一个训练的时候遇到的这个问题 ， 我觉得目前公开的开源的都太多了 ， 去教你去怎么做了 。

只要不要太相信 AI， 及时去查询 ， 然后看一些大家真实的做法成功的案例 ， 我觉得其实都可以的 。

**曲凯** [22:55]
嗯哎你觉得今天啊 ， 就是整个市场上面 ，有你这个能力 ， 就一个人能 SFT 出来一个类似你做那个模型的人， 大概会有多少人 ？

**逯雨鑫** [23:05]
呃我觉得其实现在还是挺多的 ，但是呢 ， 这个东西我觉得就是很多人把它想的太复杂了 。其实我觉得并不难 ， 对 ， 然后我觉得未来可能通过这次的播客 ， 可能会有更多人去搞下这个东西 ， 我也非常支持 。

因为只要有更多的人搞 ， 社区才能更建大 ， 然后其实也让大家知道 AI 这个东西并不难 。 大家如果感兴趣的话 ， 可以抽出自己的 ， 比如说课后时间或者是业余时间 ， 可以去专门去玩一玩 ， 成本也不贵 ， 然后搞一搞 。

我觉得如果成了呢 ， 对不对 ， 可能真的可以按照你的想法去部署去做这件事情 。

### 标配与商品化

**曲凯** [23:44]
嗯所以你觉得未来啊 ， 训模型这件事情 ， 会变成一个像互联网 、 移动互联网时代的一个每个公司有一个标配的那么一个团队跟配置吗 ？

就是几个人， 然后每家公司都能有这么个团队 ， 都会训自己的一个小模型啊 ， 或者说一个基于开源模型去做一些事情 。

**逯雨鑫** [24:04]
嗯我觉得可以的 ， 尤其是一些中型的或者大型公司 ， 可以直接整一个三四人的一个小团队 ， 就完全可以了 。 它不需要说有很大的一个开销 ， 然后只需要可能预算就是这几个人的工资 ， 然后加上部署啊 ， 包括加上训练的一些 ， 包括显卡呀一些费用 。

而且我觉得目前来说呢 ， 现在这个显卡还有内存呐 ，RAM 啊在一个特别高的一个点 ，因为其实很多厂商也都没有预测到 AI 能火成这样 。

所以说呢 ， 现在是有一个非常明显的一个短缺的一个情况 ，但之后如果说供应一旦上来了 ， 之后我觉得就会像当初咱们买的这个手机流量一样 ， 最早时候可能是 30 刀 ，不是 30MB， 现在就是在美国嘛 ， 还有我听很多国内朋友也说 ， 现在无限量使用了 ， 对不对 ？

其实我觉得未来也是一个这个方向 ， 只要显存价格下来的话 。 所以说呢 ， 我觉得很多中大型公司的成本在未来很有可能是会大幅降低 ， 所以肯定是会有一些自己的部门 。

然后小公司呢 ， 我觉得如果是没有专门的这个预算的话 ，也可以去找一些未来还会存在一些 AI Lab， 然后去做一些商谈 。

到时候我估计肯定是价格是比现在是砍了非常多 ，因为之后的这个 AI Lab 成本也会大幅降低嘛 。

**曲凯** [25:25]
嗯明白 。 哎但我我在想啊 ， 就像你说的 ， 现在可能每个环节都有些第三方的解决方案和开源的解决方案 ， 我不知道现在有没有啊 ， 或者为什么没有人做一整套的 Pipeline 把这些结合起来 ， 提供一个完整的服务 ， 说让每个人可能不需要自己去做和学每个环节 ， 你就直接跟着我这个走 ， 最后你就自己能训出来一个小模型 。

**逯雨鑫** [25:47]
你的这个想法呢 ，是目前也是我觉得除了 RSI 以外， 所有的这个公司都在想搞这个事情 。 但实际上呢 ， 比如说举个例子 ， 比如说 AI Lab 提供一个应用 ， 然后你可以直接选择模型 ， 然后选择自己的数据 ， 然后进行微调 。

目前有一家公司已经做出来了 ，在海外也就是 unsolved，在 Hugging Face 上比较出名啊 ，但是价格其实也挺贵的 ， 我觉得 。

然后目前呢 ， 很多国内的公司也都打算做这个 ，但是这面呢 ，其实对于 Infra 的话可能会有一些难 ， 还有包括 Serving 端呢什么的 ，但是我觉得未来的确这将是一个趋势 。

**曲凯** [26:26]
对听起来之前几年大家讨论的是这些 AI Lab 的模型会不会商品化 ， 然后我们聊到现在 ， 我感觉就是未来训模型这件事都会变成一个商品化的事情了 。

**逯雨鑫** [26:35]
对对完全是可以做到的 ，因为我之前是在 Hugging Face 上有一个平台叫 Hugging Face Job， 它是专门去做这个事情的 。 但是目前呢 ， 坑比较多 ，因为现在 Infra 还是搞的不是很好 ， 这面无论是国内厂商还是海外厂商都在去搞这个东西 ， 就是把这个训练做成一个商品化的一个事情 ， 让大家每个人都可以更简单的方法去做到 。

### 新Lab分工

**曲凯** [27:01]
嗯那你怎么看未来这些 AI Lab 跟应用公司之间的一些关系跟发展 ？ 因为你看最近我们也看了蛮多文章 ， 尤其是海外的 ， 大家开始有些迹象啊 ， 就是有几件事情 。

第一呢 ，是大家开始强调所谓的主权 AI 这件事情 ， 就是我要用自己的数据训自己的模型 ，而不是直接用那些 AI Lab 的模型 。

然后呢 ， 我们也看到说美国那边 ， 包括做数据标注的也在自己训模型 ， 对吧 ， 像 Modeco 这种公司 ， 然后像 Harvey 这种自己做应用的也在训自己的模型 ， 然后像 Fireworks 啊等等 ， 这些做 Infra 的也在训自己的模型了 ， 对吧 ？

就未来是不是大家其实都是模型公司 ， 或者就没有这个概念了 ？ 就大家每个人都是模型公司 ，也都无所谓是不是模型公司 。

**逯雨鑫** [27:46]
呃我觉得 AI Lab 的确会减少 。

**曲凯** [27:49]
哎我我确认一下， 你说的 AI Lab 会减少 ，是说它的价值是吧 ？

**逯雨鑫** [27:53]
价值可能还是有一些 AI Lab 是不会很高的 。 为什么呢 ？ 其实我觉得还有一些 ， 就像我所说的这个小型的一些应用公司 ， 比如说才发布了自己的第一个产品 ， 比如做了一个简单的 APP， 然后研究一下健身打卡呀什么这一类的 。

那么如果说呢 ， 这时候他们直接来一个 AI 团队的话 ， 这个公司的话成本包括效益 ， 我觉得是并不是很高的 ，因为完成自己的主业才是重点 ， 对不对 ？

然后你像这种的话 ， 我觉得很多 AI Lab 就可以在前期的时候去承接 ， 然后等这应用呢彻底的起来了 ， 可能变已经变成了几百万几千万用户了 ， 然后这时候再发展自己的这个 AI 的团队 。

所以我觉得未来的确会留下一些真正强的一些公司 ， 然后做一些这类的一些这个 service。

**曲凯** [28:45]
嗯对 ， 我感觉你这个还是按照今天这个状态在讲的 。 如果按我们刚才逻辑推理的啊 ， 就是后面会有一个非常成熟的平台化的 ，不管是一个第三方公司还是个开源的解决方案 ， 那似乎就是应用公司 ， 就像他今天要做一家应用 ，他就要有个后端 ， 要有前端 。

哦当然 AI 时代也许不知道啊 ， 会怎么变化 ，但我就说这个门槛可能会降的比你刚才讲的还要低 ， 对吧 ？

然后我的感觉是 AI Lab 现在很明确的方向 ， 就是在追求更高 level 的一些事情 ， 对吧 ？ 去解决一些科学的问题啊 ， 诺贝尔的问题啊 ，for science 的问题啊 ， 或者具身的问题啊 ， 然后基础的那些模型能力 ，其实在当下的 benchmark 上已经都找完了 。

所以开源模型可能就已经完全足够解决日常大家的很多问题了 。 所以那些 AI Lab 我觉得在我们还是说回到像他去探索更高的智能和解决 AGI 这块 ，是有很高的价值的 。

然后或者说他做的模型更好 ，他还能解锁一些我们现在没想到的场景 。 但是很多日常的场景和这些应用公司今天在做的事情 ，也许未来真的就是他自己基于开源去做一个内部的模型 ， 就把这事干掉了 。

**逯雨鑫** [29:53]
对其实是的 ，因为现在的确是 ， 包括很多就像你说中大型企业就已经开始搞这个东西了 ， 的确是未来很有可能这个 AI Lab 他们主要是搞的是研究 。

我觉得还可能还会做一些 serving 这个服务 ， 提供给一些小型的公司做一些 ， 比如说就像提供一个平台 ， 然后你们把这个训练呐 ， 这个脚本呐 ， 这个数据啊 ， 我自己上传 ， 然后自己去搞 ， 或者是说呢 ， 直接有一个开源的一个项目 ， 然后直接是把所有的 Pipeline 全整合在一起了 ， 关于一个模型的 。

但是其实我觉得未来可能对小型的公司直接去搞这个 AI 还是有点不友好 ，因为其实现在训练啊 ， 我自己观察来看 ， 就是还是数据是最重要的一环 ， 这个东西可能得需要 AI Lab 去搞一下 。

然后对于中大型这面都有自己的团队 ， 那自然而然是没有问题的 。

**曲凯** [30:49]
嗯嗯对 ， 我最近看应该是美国红杉他们发了一篇文章 ， 说最新的 AI 应用公司其实未来反而会变成 New Lab。

**逯雨鑫** [30:58]
有可能 ， 比如说行业一些比较领先的 ， 比如说 business 吧 ， 比如说大模 ， 那可能很多公司就会继承大模的这些模型 ， 然后反而去成为一个新的 New Lab。

**曲凯** [31:12]
嗯就像我们当年看推荐算法时代一样 ， 就最终其实是自己的先有的应用 ，有的场景 ，有的商业化的闭环 ，有的用户数据 ， 才有了更好的推荐算法 。其实你去看 ， 没有一家所谓的第三方中立的公司说我就是做个推荐算法 。

**逯雨鑫** [31:30]
对我觉得的确是 ， 之后的 Lab 就会偏向于这些应用公司更多一些 ， 然后很多新兴的一些小型公司可以直接拿他们的模型去做一些自己的事情 ，而不是说 AI Lab 去包揽了所有的领域 。

**曲凯** [31:46]
对因为像我们包括刚才跟你聊 ， 然后跟一些 researcher 聊 ， 我觉得大家其实有一个共识是说数据还是最重要的 ， 对吧 ？

数据是决定模型表现的 ，而最终还是真的跟客户接触的 ， 跟用户接触的公司有第一手的最真实的最好的数据 。

**逯雨鑫** [32:03]
对这些数据的确是最宝贵的资源 。

**曲凯** [32:07]
嗯是我的体感就是 ， 你看像最近你可能也知道 ， 就是至少国内大家比较流行的论调是 " 模型知道一切 "， 然后应用公司呢 ， 现在是非常非常的冷的一个时候 。

然后我们前几周还做了一期播客讲这件事情 ， 然后当时呢 ， 我其实也是整体有点偏悲观的 ，但这几周聊起来 ， 我反而觉得就是我们刚才说那句话 ， 应用公司其实才是下一个 New Lab。

现在的这些 AI Lab 和 New Lab 肯定仍然是上升的啊 ，在未来一段时间也仍然是上升的 ，但是应用公司的价值也是在上升的 ， 就这两个其实是在同步上升 。

然后在未来的某个时间点呢 ，也许会发生一个转变 ， 就是模型的价值慢慢的往应用公司去让渡吧 。

**逯雨鑫** [32:47]
对我觉得在未来真正能存活下来的 AI Lab，其实是往就像你说的这个 research 啊 ， 然后往更高的层面上去发展了 ， 包括做一些前沿的开发呀 ， 然后包括整体的一些模型的这个前训什么的 ， 可能后训呢 ， 就会发放到很多的应用公司里来了 。

因为应用公司他们并不想把自己一些数据分享给别人嘛 ， 然后可能更能想帮助自己在这个行业里面占住地位 。

所以我觉得的确会发生一次反转 ，但是这个反转呢 ， 我觉得是 AI Lab 往上走了 ， 就是完全是不去碰后训这一块的这个东西了 ， 然后应用公司反而去接管 ， 然后用着自己的这个模型 ， 然后包括可能很多小型公司会跟这些中大型应用公司去调用啊 ， 然后包括买一些 API 啊 ， 就可能中型应用公司就有一些 tooken plan 了 ， 对不对 ？

### 数据争夺战

**曲凯** [33:39]
嗯嗯是 ， 所以我我其实反过来就有点理解 ， 为什么大家所谓的 AI Lab 愿意花这么多钱去买数据 。

我感觉现在可能很多人还没有意识到数据的价值啊 ， 它有点像移动互联网早期 ， 像字节那个时候 ， 就大家都觉得为什么要花那么多钱去买用户 。

嗯那个用户获取成本其实挺高的 ， 然后后来大家发现说一开始的时候其实反而是最低的时候 ， 后面会越来越高 。

我觉得数据可能也是一样的 ， 对吧 ？ 就现在 AI Lab 就是要花更多的钱 ， 把能买的数据先都买过来 。

**逯雨鑫** [34:09]
对因为其实包括你可能平时的时候让 AI 去 ， 比如举个例子 ， 你用 GPT 5.6， 你可能说帮我去写下一个播客的稿子 ， 或者是去调整一下这个东西 。

那么这期间呢 ，其实你的数据就是非常宝贵的 ， 你和他聊天的时候 ， 这就是你真实使用体验下来 ， 然后 AI 帮助你真正解决问题了 。

所以整个这一条数据其实就已经值钱了 。 那么你看 ， 可能说这个现在 AI Lab 现一直在搞数据嘛 ，在买数据也好啊 ，其实就是因为想看 AI 真正帮助你解决的问题 ， 它是怎么完成的 ， 包括你的真实问题会是什么 ， 这些都是对于这个 AI 提升非常有用处的一个东西 。

就包括其实嘛 ， 我记得每次发模型的时候 ， 可能会有些公司说 ：" 哎 ， 我们现在免费使用这个模型 。" 那么你免费使用下来呢 ， 那 AI 公司人家这个成本多高 ？

他们 serving 的话可能加起来很多 B300， 那 B300 一台对于他们来说 ， 无论是租还是买 ， 都是个非常大的数目 ， 可能几十万几百万这样一个级别 。

那么他们为什么做 ？ 不仅是在宣传自己的模型 ， 让你真实体验一下 ，也其实在从中在收集好的数据 ， 来去帮助自己去迭代下一代模型 。

**曲凯** [35:25]
嗯嗯哎 ，但我就是我们聊到这 ， 我有个很好奇的问题啊 ， 就是你最终为什么你还会选择去了一家 AI Lab？

### AI Lab之选

**逯雨鑫** [35:32]
因为其实就像我说的 ， 我觉得肯定还是会有 AI Lab 是赢家的 。 那么真正你去选一家 ， 还是有很大希望 ， 可能往 research RSI 这方面搞的 ， 做到像我之后说的 ， 可能就是直接搞 research 级别了 ， 然后做一些前训啊什么这一类的 。

包括其实我觉得目前 Kimi 啊 ， 智谱啊这些公司啊 ，其实最大的价值就是前训 ，因为你目前应用公司也好 ， 什么也好 ， 你真的无法去做到前训 。

如果你想前训一个模型的话 ， 我可以给大家估计一下这个价格 ， 那就加一个 B300， 或者就不是加一台 ， 可能加 128 卡 ， 加上更高 264 卡 ， 然后去做这个前训 ， 还得做好几个月 。

所以说这块肯定还是 AI Lab 占主导 。 但是其实还有一点 ， 我觉得是未来的一个非常大的问题 ， 就是如果 AI Lab 没有人开源了 ， 那可能对应用公司来说 ，其实也是一个比较毁灭性的打击 。

那么这期间呢 ， 就需要从很多之前开源的模型里面去拿出真实好的 ， 然后自己去做后训 ， 然后自己去迭代 。

所以说其实我觉得现在很多中大型应用公司 ， 如果有足够预算 ，其实想要搞下去 ， 就得从现在就开始自己的去迭代模型了 ， 对后训 。

**曲凯** [36:50]
嗯我但我觉得至少从今天看 ， 未来相当长一段时间应该就只要有竞争 ， 应该就是会有开源 。

**逯雨鑫** [36:58]
对对对 。

### 本地AI机会

**曲凯** [36:59]
嗯明白 。 哎最最后我想问一下， 就是你觉得未来 ，因为之前大家有过一个类比跟讨论啊 ， 就是在计算机刚出现的时候 ，是那种超大的 ， 对吧 ？

一间房子都放不下的一个大的机器 ， 那大家会觉得说 ，是不是全球只有那么几台机器 ？ 就有点像今天的全球就那么几家 AI 的 Lab， 然后最后呢 ， 它慢慢的演变成了每个人一台 PC 的这个时代 。

那这里面就是从 IBM 变成了微软和苹果这样公司的机会 。 那嗯 ，AI 会不会未来也是会往这个方向走 ？

从几家大的模型变成说未来人手一个模型 ， 就是跑在自己的电脑上 、 自己的手机上 、 自己的一些端侧产品上 。

**逯雨鑫** [37:41]
一定的 ， 现在已经有这个方向发展了 。 因为简单来说 ， 你调用 API 的时候 ， 你的数据就是可以被你的上游看见 。

很多人用这个中转站 ， 很多人说 ：" 哎呀 ， 很便宜啊 " 什么的 ， 就是可能几十块钱包月 。 为什么我不支持中转站呢 ？

因为很多中转站啊 ，不仅是比较灰色的地带 ，其次呢 ，他们会卖你的数据 。 目前呢 ， 已经看到过太多太多的案例 ， 我包括我身边朋友 ， 包括有一些其他的 AI Lab， 都遇见过一个问题 ： 被黑客威胁 ， 为什么你的数据泄露了 ？

所以未来呢 ， 大家为了保护自己的数据 ， 一定会往这个 Local AI 上靠 。 而且呢 ， 随着这个英伟达呀 ， 包括还有国产的比较出名的芯片 ， 那么他们几个都会做大做强做更好 ， 然后基本上我觉得每个人手都会配有自己的这个 Local AI， 然后这个 Local AI 的话呢 ， 数据就是永远保存在自己的电脑上 ，不流行任何地方 。

所以我觉得这绝对是一个非常大趋势 ，也是为什么千问它一直在发小模型的原因 。 然后之后呢 ， 随着电脑的升级 ， 可能就像我之前看到的报道说 ， 马上 2027 年、2028 年， 苹果要出 2T RAM 了 ， 统一内存的电脑了 。

那 2T 的话呢 ， 相当于可以跑到基本上现在的 GRN 5.2 是都没问题了 ， 就相当于自己有一个非常强大的 Local 模型 ， 你再也不需要去调用上游的 API 了 。

所以这绝对是一个非常好的趋势 ， 这也是未来每一个人都希望盼有的一天 。

**曲凯** [39:11]
嗯好呀 ， 最后你还有什么想要补充的 ， 或者跟大家分享的吗 ？

**逯雨鑫** [39:17]
我觉得最重要就是 ， 如果现在大家包括应用公司想要去搞 AI， 那就不如从现在就开始 。 因为其实之后呢 ， 开源可能会受到一些重创 ， 比如说你看这位千问 ，在 3.7 模型的时候 ， 就并没有发任何的小模型 。

如果他没有发的话 ， 那大家怎么办呢 ？ 大家可能说 ：" 哎 ， 那我们只能自己去搞自己的后训了 。" 就已经直接把路堵死了 。

而且很多人呢 ， 完全不会 ， 只会说 ：" 我就部署在我的电脑上， 我用我的显卡去部署个小龙虾什么的 。"

这样那么这种情况下的话呢 ， 我觉得就是一个非常大的一个阻塞 ， 然后可能未来也会遇到这个问题 。

所以我觉得不如说 ， 很多应用公司现在就可以开始专门去搞这个事情 ， 然后很多可能学 CS 的 ， 就主动去往 AI 方向靠一靠 。

这样的话呢 ，他们可以在未来 ， 尤其是在闭源的情况下， 可能会有一些更好的发展 。

**曲凯** [40:14]
嗯明白 。 好呀行 ， 那谢谢今天就不好意思 ， 我想再补一个问题 。

啊你说 。

**陈皮** [40:20]
呃 hello hello， 我是陈皮 ，在四沙张京做内容 。 嗯我的这个问题就是 ， 现在有一部分人 ，他们的说法是 ， 用户最终对智能的需求可能还是要到达 SOTA level。

### SOTA之争

**陈皮** [40:31]
那假设比如说像 OpenAI、Anthropic 这样的公司 ， 就一直在发最最最前沿的模型 ， 那用户就真的会愿意用自己的本地模型吗 ？

因为本地模型可能离 SOTA 还是有一些距离 ， 就哪怕这个差异 ， 可能对大家日常生活啊 、 工作来说 ， 已经没有那么重要了 。

**逯雨鑫** [40:50]
呃我觉得这个问题非常非常好 ，也是我觉得很多人都面临的这个问题 。 就是 Local AI 的话呢 ， 我自己的使用率其实目前来说并不高 ，因为 Local AI 还是会有一些错误 ， 可能没有这些 SOTA 这些模型啊 ， 包括最前沿的这些模型好 。

但是呢 ， 我觉得就像我说的 ， 很多人做的事情 ，他可能对数据非常敏感 。其实我这回发这个 Hugging Face 的上， 很多人都反馈 ，其实很多人还是愿意用这个 Local AI 的 。他们就是很多人对数据非常的敏感 ， 尤其像我做的最多反馈的是 Cybersecurity 这一方面的话呢 ， 你包括还有生物领域 ， 这个飞波舞全是巨大 。

那如果碰到这种巨大的情况下， 你只能去考虑 Local AI 这种模型 。 然后还有一点 ， 可能日常聊天 ， 大家更愿意用这些大模型 ， 可能因为在手机上目前阶段 ， 还是无法部署一个非常满意的模型的 。

但是未来很有可能会发展到部署一个自己比较满意 ， 比如说 27B 模型 ， 可能会放在手机上了 。 如果是达到这种程度的话 ， 我觉得很多人可能问一些简单问题 ， 就靠自己的手机 。

因为其实这个对于大家来讲 ， 这就是沉没成本嘛 ， 对不对 ？ 我手机已经买了 ， 我去搞这个东西 ， 我天天问这个 AI， 那我相当于什么 ？

我是免费的 。 但如果调 API， 我就每个月可能得花 20 刀 、30 刀去买这些公司的这个 API 的这个服务 。 那么对于我来讲 ，也是一个额外的开销 。

然后第二点呢 ， 就是所谓的这个安全性问题 ， 大家可能会更关注一点 ， 包括很多人写小说 。 小说这一点是因为我是以前专门做这个模型的 ， 所以我非常了解写小说的这个情况 。

那么这一块 ， 这个图文的消耗量是非常恐怖的 。 做完这一版小说的话 ， 可能我得需要花几千甚至几万人民币的一个价格 。

但是如果 Local AI 去帮我做 ， 然后我自己可能再做一些调整 ， 这样一个情况 。 所以说我觉得未来还是更偏向于 Local AI，因为大家更想保护自己的隐私 ， 省钱 。

然后加上呢 ， 很多领域大模型巨大的情况下， 我觉得可能会更好一些 。

**陈皮** [43:00]
好的我也想再追问两个小问题啊 ， 就是 Local AI 它的成本更低和速度更快 ， 这块我觉得是比较好理解的 。

但是关于隐私这部分 ， 我不确定它是不是一个真需求 ， 或者说就我们当然都希望保护自己的隐私 ，但实际上就比如我们现在用的很多 APP， 对吧 ？

就他们可能都在想办法的去获取我们的数据 ，但我们可能用着用着也就无所谓了 。 这是第一个问题 。

然后第二个小问题就是刚刚您也有提到 Cybersecurity， 然后我们最近也有看到一些公司在做这方面的事情 。 那比如这种公司 ， 它加上 SOTA 模型 ，是不是就能够一定程度上解决大家在隐私方面的顾虑 ，而不是人人可能到最后都要选择一个 Local AI 的解决方案 ？

**逯雨鑫** [43:48]
这个就是有一个非常好的一个案例出现了 ， 就是 Hugging Face 啊 ， 被这个嗯 OpenAI 的对被这个攻了 。 然后最后呢 ， 它解决问题是只用了咱们中国的国产模型 ， 然后本地部署 。

因为呢 ， 无论是 Claude 还是 GPT 都在巨大 ， 所以未来我觉得很多公司可能真的会偏向于自己的这个模型 。其次呢 ， 这个隐私问题呢 ， 的确是可能很多人不在意 ，但是其实还有很多人也是在乎的 。

那关于这个 Cybersecurity 的时候呢 ， 就算是目前很多 SOTA 这些模型场合 ， 说我们把这个 Cybersecurity 问题可能融合了一下， 就是说解决这个问题不巨大了 ， 或者任何情况 ，但是还会有很多其他的领域出现问题 。

还有一种就是生物领域 ， 很多人在做 research 阶段的时候 ，Fable 一直在巨大 。 那么这时候呢 ， 你就无法拿到这个 SOTA 模型 。

那已经巨大了 ， 然后可能还有几个其他选择 ， 反正都不是最 SOTA 的 ， 那我就选个中等的自己部署 ， 然后自己把这些数据都保留下来 ，是不是更好呢 ？

**曲凯** [44:53]
嗯你要不补充一下， 我觉得一个是说所谓的 SOTA 到底多 SOTA 才算 SOTA， 还是说后面慢慢的大家会觉得说今天用的已经够了 ， 你用更好的 ， 就是它从性价比角度来讲 ， 可能总归有个点就不太 make sense 了 。

就像是有很多人觉得可能 4G 就够用了 ， 我没必要用 5G， 或者 5G 肯定就够用了 ， 我没必要再用 6G 的 ， 实施类似的 。

**逯雨鑫** [45:16]
呃但是我觉得刚才陈皮啊 ，他刚才说的这个点是很对的 ， 就是大家一直在追求着最先进的 ，其实不管它有没有用 ， 对不对 ？

就很多人都是在搞这个心态 。 所以说就是大家不管自己的需求 ， 简单来说是盲目追求最强的 。

**曲凯** [45:32]
嗯没没有 ， 我我是觉得怎么讲 ， 就是最后肯定还是豆包的用户是更多的啊 。 就是你们现在讲的呢 ，其实还是小众的一个人群 ， 只是这个小众人群在今天 AI 里面相对话语权比较强而已啊 。

嗯大多数人其实是不 care， 或者不会这么选择的啊 。 大家还是最终是看性价比的 ，以及就是最终你们说隐私那问题 ， 我觉得不是用户个人去 care 和选择 ，是从应用公司的角度来说 ， 会自然的推动这件事情 。

因为应用公司和模型公司 ， 天然是一个有点竞对的一个状态的 。 就最终你如果用的个人模型 ， 可能是因为苹果在推这件事情 ，而不是个人的选择 。

**逯雨鑫** [46:10]
是的是的 ， 我觉得未来以后也是差不多是这样的一个情况 。 就像你说的 ， 豆包用户其实是最多的 ，因为它是最方便的 ， 然后它也不用去多骚他 ， 它只要能解决掉大家的问题就可以了 。

**曲凯** [46:25]
嗯好呀 ， 今天聊的很开心 ， 然后我觉得提供了蛮多非共识吧 ，但和我们最近看到的一些趋势是蛮吻合的啊 。

然后非常感谢雨鑫的时间 。

**逯雨鑫** [46:36]
嗯好的好的 。

---

本节目库由 PodHood（https://podhood.com）提供支持——播客网站平台。
