主播
节目简介
来源:小宇宙
活动预告🥳:9 月 12 日,我们会请到雨鑫做一场线上活动,大家记得翻到 shownotes 末尾查看报名信息!
最近硅谷有了新热点:主权 AI 和 Personal Intelligence。简单来说,就是很多人开始相信,未来会有越来越多的应用公司和个人,训练自己的模型。
对绝大多数人来说,训练模型仍然是一件听起来遥不可及、门槛很高的事,但我们这期节目的嘉宾逯雨鑫却认为,它非常简单,简单到他此前没有 AI Lab 的经历,也不是 AI PhD,只用了 2 周和数百美元,就后训练出了两个登顶 Hugging Face Model Trending 榜首的小模型。
他具体是怎么做到的、摸索出了怎样的 Pipeline?过程中踩过哪些坑?以及无论对个人还是公司来说,训练模型最大的卡点都是数据,那么他是怎么攻克这个难题的?在蒸馏路线、数据来源上,又有哪些 secret sauce?
节目后半段,我们还进一步讨论了主权 AI、Personal Intelligence 和 Local AI 相关的各种问题,比如这些事情普及开来的门槛在哪里、未来 AI Lab 和应用公司的分工与价值会有什么变化等等。
就在一个月前,我们还在讲 AI 应用遭受的冷遇;但录完这期,我们好像又看到了应用的曙光。也许在不久的将来,越来越多的应用公司都会成为 Neo Lab,Local AI 也可能成为一个 PC 级别的机会。而拥抱模型训练和 Local AI,最好的时间可能就是现在。
希望雨鑫摸索出的实践路径,能给应用公司和个人带来一些启发。如果你还想了解更多,也欢迎报名 shownote 末尾的线上活动,来和雨鑫直接交流(尤其欢迎应用创业者!)
【人类博物馆】
导游:曲凯,42章经创始人
52 号珍藏:逯雨鑫,Mind Lab 研究员;以个人开发者身份、数百美元成本微调的模型两次登顶 Hugging Face 热度榜;focus 在 post-training(蒸馏、SFT)与数据工程,近期方向为 continued pre-training
【时光机】
Part 1 训模型的实操经验
* 01:33 非 PhD / AI Lab 背景,凭什么能训出榜一模型?
* 03:23 训这两个模型的成本具体有多少?
* 06:08 个人训模型的完整 Pipeline 和避坑经验
* 11:33 最大的难点和卡点:数据
* 11:48 合成数据效果并不好?
* 12:16 数据从哪来、具体要用多少、如何配比?
* 15:34 数据难以提前预估效果的原因:Capacity Gap
* 17:18 简评蒸馏的各种路线,以及到底什么叫「聪明地蒸」?
* 20:01 自己训、自己用,性价比真的更高吗?
* 22:10 坑最少的开源模型是?
Part 2 对主权 AI 的思考
* 23:44 自己训模型会成为应用公司的标配吗?
* 25:25 训模型可能会成为一件商品化的事情?
* 27:01 应用公司反而可能会成为 Neo Lab?
* 32:07 AI Lab 和应用公司之间的分工可能会有什么变化?
* 33:39 现在 AI Lab 砸钱买数据,就有点像移动互联网早期字节砸钱买用户
* 35:31 如果主权 AI 真的兴起,AI Lab 的价值会有什么变化?
* 36:59 Local AI 会不会成为 PC 级别的机会?
* 40:17 用户最终会不会还是希望用上 SOTA 级别的智能,而不是 Local AI?
【活动预告🥳】
9 月 12 日,我们会请到雨鑫做一场线上活动,感兴趣的朋友欢迎点击链接或扫描下面的二维码,一起来认识&交流!
【The gang that made this happen】
* 制作人:陈皮
* 剪辑:陈皮
* 片头:Mondo Bongo - Joe Strummer & The Mescaleros
* 片尾:Spacemen 3 - Set Me Free (Reprise)
最近硅谷有了新热点:主权 AI 和 Personal Intelligence。简单来说,就是很多人开始相信,未来会有越来越多的应用公司和个人,训练自己的模型。
对绝大多数人来说,训练模型仍然是一件听起来遥不可及、门槛很高的事,但我们这期节目的嘉宾逯雨鑫却认为,它非常简单,简单到他此前没有 AI Lab 的经历,也不是 AI PhD,只用了 2 周和数百美元,就后训练出了两个登顶 Hugging Face Model Trending 榜首的小模型。
他具体是怎么做到的、摸索出了怎样的 Pipeline?过程中踩过哪些坑?以及无论对个人还是公司来说,训练模型最大的卡点都是数据,那么他是怎么攻克这个难题的?在蒸馏路线、数据来源上,又有哪些 secret sauce?
节目后半段,我们还进一步讨论了主权 AI、Personal Intelligence 和 Local AI 相关的各种问题,比如这些事情普及开来的门槛在哪里、未来 AI Lab 和应用公司的分工与价值会有什么变化等等。
就在一个月前,我们还在讲 AI 应用遭受的冷遇;但录完这期,我们好像又看到了应用的曙光。也许在不久的将来,越来越多的应用公司都会成为 Neo Lab,Local AI 也可能成为一个 PC 级别的机会。而拥抱模型训练和 Local AI,最好的时间可能就是现在。
希望雨鑫摸索出的实践路径,能给应用公司和个人带来一些启发。如果你还想了解更多,也欢迎报名 shownote 末尾的线上活动,来和雨鑫直接交流(尤其欢迎应用创业者!)
【人类博物馆】
导游:曲凯,42章经创始人
52 号珍藏:逯雨鑫,Mind Lab 研究员;以个人开发者身份、数百美元成本微调的模型两次登顶 Hugging Face 热度榜;focus 在 post-training(蒸馏、SFT)与数据工程,近期方向为 continued pre-training
【时光机】
Part 1 训模型的实操经验
* 01:33 非 PhD / AI Lab 背景,凭什么能训出榜一模型?
* 03:23 训这两个模型的成本具体有多少?
* 06:08 个人训模型的完整 Pipeline 和避坑经验
* 11:33 最大的难点和卡点:数据
* 11:48 合成数据效果并不好?
* 12:16 数据从哪来、具体要用多少、如何配比?
* 15:34 数据难以提前预估效果的原因:Capacity Gap
* 17:18 简评蒸馏的各种路线,以及到底什么叫「聪明地蒸」?
* 20:01 自己训、自己用,性价比真的更高吗?
* 22:10 坑最少的开源模型是?
Part 2 对主权 AI 的思考
* 23:44 自己训模型会成为应用公司的标配吗?
* 25:25 训模型可能会成为一件商品化的事情?
* 27:01 应用公司反而可能会成为 Neo Lab?
* 32:07 AI Lab 和应用公司之间的分工可能会有什么变化?
* 33:39 现在 AI Lab 砸钱买数据,就有点像移动互联网早期字节砸钱买用户
* 35:31 如果主权 AI 真的兴起,AI Lab 的价值会有什么变化?
* 36:59 Local AI 会不会成为 PC 级别的机会?
* 40:17 用户最终会不会还是希望用上 SOTA 级别的智能,而不是 Local AI?
【活动预告🥳】
9 月 12 日,我们会请到雨鑫做一场线上活动,感兴趣的朋友欢迎点击链接或扫描下面的二维码,一起来认识&交流!
【The gang that made this happen】
* 制作人:陈皮
* 剪辑:陈皮
* 片头:Mondo Bongo - Joe Strummer & The Mescaleros
* 片尾:Spacemen 3 - Set Me Free (Reprise)
小宇宙热评
曲凯
1周前
北京
10
这期播客希望能为应用触底反弹时刻做一些贡献,我很相信应用公司就是下一代neo lab🧐
陈皮皮屁
1周前
新加坡
8
大概两个多月前,刷到 yuxin 登顶抱抱脸新闻的时候,我就去联系了他。但因为 X 的 dm 有点问题,前阵子才真正建联。不过现在看,这个时机刚刚好。希望 yuxin 个人训模型的完整经验,能在主权 AI 兴起的时候,给大家一些帮助和参考吧~如果大家有更多想交流的,也欢迎报名 shownote 里的线上活动,尤其欢迎 AI 应用创业者~让我们一起助力 AI 应用再迎春天哈哈哈。
Jasonyin4567
1周前
加拿大
7
嘉宾很真诚,很好的一期节目,点赞👍
新回形针
1周前
辽宁
5
听完后自己也要试试后训练,谢谢🙏
庄明浩
1周前
上海
5
27:29 一切皆是neolab了
一只烤鸭七块钱
1周前
湖北
4
好喜欢这期内容!!😇
神经蛙_EsxD
1周前
四川
4
会得不难,难得不会。
微调算力几百美元,知识背景,人脉圈子,数据收集清洗和标记,出圈运气怕是几十万都不一定能解决。
Dumb_M8Dq
1周前
陕西
3
硬货
球面膨胀
1周前
广东
3
非常有价值的一期节目
vnvnkkk
1周前
广东
3
这个挺好的,给了我一个思路:可能现在很多人都在搞 skill、搞知识库。有些场景下,甚至可以直接在内部训练一个小模型,做微调,或者用开源模型做微调,效果可能会更好。
姥姥王
1周前
上海
2
42/52梦幻联动!
AI时代
1周前
福建
2
小模型过度自信,这个倒是很有意思的问题。
Qiumi-
1周前
美国
2
很喜欢这一期!在转ai的路上拼命给自己找借口 其实只需要大胆做了再说就好 42的嘉宾都非常的真诚和接地气
神经蛙_EsxD
1周前
四川
1
本地部署数据真的安全吗?
除非物理隔离,不然以A/的网络能力……
AC1982
1周前
重庆
1
很喜欢知无不言的 Yuxin。我们原本以为小模型能用微弱的智力覆盖一些边缘场景,但是发现真的确定收敛在它能力范围内的情况,还不如写 if else 。我们不用中转站,就是嘉宾说的,数据给巨头还是踏实点。最后,确认训模型数据最难,因为其他 vibe coding 容易很多。
爱吃蔬菜的
1周前
浙江
0
cc 做合成数据不会被封吗?
想飞的大笨象
1周前
广东
0
没想到个人模型这么快就来到了
h10g
1周前
上海
0
17:54 这里听的有点迷,先说OPD最强,又说OPD和RL锦上添花,是口误嘛?
overmind19
1周前
北京
0
juda是什么意思?