Album

灯下白-走进 AI 圈的真实对话

未知 Rosia吴熳
1,780 订阅 51 集 1周前
播客简介
创作者
节目
51.黄啊码:从AIGC到Vibe Coding,他把每一次技术浪潮都变成了下一块积木

51.黄啊码:从AIGC到Vibe Coding,他把每一次技术浪潮都变成了下一块积木

灯下白-走进 AI 圈的真实对话

🎙《灯下白》EP51 黄啊码 嘉宾:黄啊码 创业公司CTO、广东省人工智能协会讲师、AI内容创作者,拥有十余年技术开发与产品实践经验。生成式AI兴起后,先后深入实践AIGC、Coze工作流、Vibe Coding等方向,并持续参与百度秒哒等AI开发平台的产品实践、赛事与商业项目。如今关注AI产品开发、企业交付、个人IP与AI商业化,持续探索普通技术人如何在模型快速迭代的时代建立自己的长期能力。 主持人:吴熳 在得到直播讲过AI应用,在WaytoAGI北京切磋分享,代表中国在英国大使馆文教处国际大会全英发言讲中国AI如何赋能英语教学,AI牛马库导航科普网站 ka21.org 主理人 本节目由人类与GPT共同策划,剪映处理音频中水词,千问处理剪辑时间轴,GPT撰写Shownotes,Banana Pro生成播客logo,即梦生成播客封面,Suno生成片头片尾音乐,同时由声湃和中关村科学城公司提供录音场地,由罗德麦克风提供录音设备。感谢中关村科学城的政策支持! 🪝本期故事 如果把黄啊码这些年的技术路径摊开来看,会发现他其实很少在一个工具上停留太久。 程序开发做了很多年,生成式AI起来以后,他先去研究大模型,又很快进入Stable Diffusion、Midjourney和AIGC视频;做了一段时间视觉创作之后,他发现自己的优势并不在纯审美,于是转向Coze工作流;等Vibe Coding开始兴起,他又把多年程序开发和工作流的经验迁移过去,继续用百度秒哒等平台做产品。 看起来一直在换。 但他自己并不觉得这些事情是割裂的。 因为每一次新工具出现以后,他做的其实都是同一件事:先上手,先做东西,再判断自己真正擅长的部分在哪里,最后把之前积累下来的能力重新装进新工具里。 黄啊码把自己的学习方式形容得很简单: “我的路子比较野。” 他很少等到“完全学会”之后再开始。往往是先碰到问题,再去补能力;做着做着发现一个环节不够,就继续往下研究。多年以后回头看,那些原本散落的知识反而慢慢拼成了自己的体系。 这也是他进入AI以后一个很明显的特点。 ChatGPT刚出来时,他当然研究过基础模型。但很快就发现,真正直接进入基础模型研发,并不是自己最有优势的战场。 那就换一个入口。 Stable Diffusion和Midjourney出现,图片给人带来的视觉冲击非常直接,他开始做AIGC图片和视频,也在这个方向上做出过一些成绩。 但做得越多,他反而越敢承认自己的短板: 审美没有那么强。 模型可以帮你生成一张图片,却不会因为你会写Prompt,就自动把十几年视觉训练塞进你的脑子。 构图、颜色、UI、人物风格和整体体验,这些能力依然需要积累。 所以当Coze工作流开始出现时,黄啊码反而一下找到了舒服的位置。 节点、输入、输出、条件判断、业务流程怎么拆、一个环节怎样连接下一个环节——这些事情,本来就是程序开发长期训练的能力。 过去写在代码里的逻辑,现在变成了更加直观的工作流。 再后来是Vibe Coding。 对很多普通人来说,这是第一次能够用自然语言真正做软件。 可对黄啊码来说,它更像一次新的能力迁移:以前要亲手写很多代码,现在可以把大量执行交给AI,但真正决定产品能不能成立的,依然是需求、结构、逻辑和最后如何验收。 所以他后来在百度秒哒上的一系列实践,并不是突然从天而降。 2025年参加秒哒相关黑客松时,他甚至很坦率地说: 最开始就是奔着奖金去的。 但既然参加,就认真做。 他还邀请塔塔一起参加。因为他很清楚,自己偏技术和产品逻辑,而塔塔在视觉与审美上能够形成很好的补位。 最后塔塔拿到第二名,黄啊码拿到第三名。 比赛结束以后,真正重要的东西才开始发生。 成绩带来认可。 认可带来曝光。 曝光以后,过去那些存在自己电脑里的产品第一次开始进入更多人的视野。 他之前做过小说相关产品,后来继续延伸到漫剧工具,再往后,真的有人带着需求找到他,开始产生定制开发订单。 走到这里,黄啊码才越来越清楚地看见一条商业路径: 积累 → 作品 → 认可 → 曝光 → 变现。 所谓“突然被看见”,很多时候只是别人只看到了最后两步。 真正决定后面能不能接住机会的,往往是前面已经做了多久。 AI确实把很多过程压缩了。 但它并没有取消积累。 💡本期你会听到 一个做了十多年技术开发的人,是怎样进入这一轮生成式AI浪潮的。 为什么黄啊码并没有把自己绑定在某一个AI工具上,而是不断从AIGC、工作流迁移到Vibe Coding。 长期程序开发到底训练了哪些能力,以至于新的AI工具出现以后,可以快速迁移。 为什么他说自己的学习方式“路子比较野”,以及“遇到问题再补知识”为什么也可以慢慢形成一套自己的体系。 早期医疗健康相关工作经历,为什么让他一直对“技术到底能不能真正解决人的问题”保持兴趣。 他怎样尝试让AI帮助梳理自己的健康信息,又为什么反复强调个体经验不能被直接复制,AI的回答也必须经过现实判断。 为什么在AI时代,“会使用模型”和“把判断权全部交给模型”完全是两件事。 ChatGPT出现以后,他为什么没有强行去卷自己并不占优势的基础模型研发。 Stable Diffusion、Midjourney为什么成为他进入AIGC视觉创作的重要入口。 做AIGC图片和视频以后,他为什么反而越来越清楚自己在审美上的短板。 AI为什么可以降低执行门槛,却不会自动抹平人与人在审美、判断和经验上的差距。 从AIGC转向Coze工作流,为什么是一次非常自然的能力迁移。 节点、条件、输入输出和业务流程为什么天然符合程序员的思考方式。 为什么他甚至在使用Coze之前,就已经自己折腾过类似逻辑的产品。 从Coze到Vibe Coding,上一代工具留下的能力怎样继续发挥作用。 为什么Vibe Coding并不等于“不需要产品思维”。 第一次接触百度秒哒时,他为什么没有立刻觉得它会改变一切。 参加秒哒黑客松,最开始为什么只是想拿奖金。 为什么他主动找塔塔组队,以及技术能力和审美能力怎样形成互补。 比赛名次之外,公开比赛真正能够带给个人什么。 从小说产品到漫剧工具,再到真正出现商业定制订单,一项能力怎样逐渐完成商业化。 为什么黄啊码说,很多看起来偶然的机会,往前追都有很长的积累。 个人做AI产品,到底应该花多少钱。 为什么过去他也喜欢研究“怎么白嫖”,后来却越来越发现,有时候不花模型的钱,反而会花掉更多时间。 免费模型、便宜模型和更强模型之间应该怎样做取舍。 个人实验和企业交付为什么完全是两套成本逻辑。 为什么企业客户不关心你调用哪个模型、花了多少Token,它真正购买的是最终结果。 一次为了替甲方降低模型成本的选择,为什么最后反而造成更多返工。 “省钱”为什么有时候是AI交付里最大的隐性成本。 为什么黄啊码认为,AI时代只靠一张传统简历证明自己越来越不够。 当AI可以帮助每个人写出一份漂亮履历,真正的项目为什么变得更加重要。 一个人有没有真正做过项目,为什么只需要向下追问几层细节就很容易判断。 产品、作品、文章和公开表达,怎样逐渐成为个人的新型履历。 为什么做个人IP不意味着一定要当网红。 IP如何降低陌生人理解你的成本,又怎样影响一个人的时间定价。 “我们上班本质上也在出售自己的时间”,那么怎样让同样的一小时变得更值钱? 黄啊码最常使用哪些AI产品,以及他怎样根据不同业务选择不同工具,而不是形成单一模型信仰。 企业交付里为什么“客户使用什么生态”本身也是工具选择的重要条件。 做Vibe Coding时,他认为最重要的产品习惯是什么。 为什么真正的问题往往不是AI不会做,而是人自己一开始没有把需求说清楚。 不断让AI“再改一版”,为什么和过去甲方不停让设计师修改非常像。 一个产品从第一版改到第五版,为什么最后经常发现还是第一版比较好。 什么叫终局思维:先定义最后什么叫“完成”,再让AI决定中间怎样实现。 需求、验收标准和边界为什么应该在人开始Coding之前先想清楚。 普通人用30天学习Vibe Coding,第一步为什么不是做一个宏大的创业项目。 从一个自己真正需要的小产品开始,为什么成功概率更高。 “自己就是第一用户”,对于产品验证意味着什么。 个人网站为什么是一个非常适合普通人的第一款Vibe Coding产品。 为什么一个真正需要用来介绍自己的个人网站,比单纯为了练习开发一个Demo更有意义。 未来的OPC为什么并不等于“一个人把所有工作全部做完”。 一个人的核心能力、AI、合作伙伴和外部专家怎样共同组成新的工作生态。 为什么知道“谁擅长什么”,有时候比逼自己什么都学会更重要。 🔥本期金句 我的路子比较野,很多东西都是遇到问题以后再去补。 AI可以帮你做很多事情,但你不能把自己的判断也一起外包出去。 尽信AI,就等于把脑子也让渡给AI。 做AIGC做得越多,我反而越能看到自己的审美短板。 工具越来越简单,并不意味着真正的能力差距消失了。 你本来就有优势的地方,为什么不用? 我不会强迫自己在别人最强的地方硬卷,我会找自己能力最容易迁移过去的位置。 很多所谓碰巧的机会,前面都有很长的积累。 真正的路径是积累、作品、认可、曝光,最后才是变现。 没有所谓突然成功,很多东西只是别人没有看到前面的过程。 AI时代该花的钱还是要花,有时候你省下的是模型费,浪费的是自己的时间。 企业客户购买的是结果,不是你中间用了多少个模型。 为了给甲方省一点模型的钱,最后反复返工,这个钱其实省错了。 如果这个时代还只靠一张简历证明自己,可能已经不够了。 Title可以包装,项目经历很难经得住连续追问。 个人IP不是单纯追流量,它是在让市场更快理解你到底值多少钱。 工作本质上也是在出售自己的时间。 Vibe Coding最重要的不是Prompt技巧,是你得先知道自己到底要什么。 先确定最后怎样验收,再让AI决定中间怎么做。 普通人的第一个AI产品,最好首先对自己有用。 你自己就是用户,这是一个非常好的开始。 一人公司不是让一个人把所有岗位都干一遍。 AI时代更像围绕一个人重新形成一套能力生态。 我不需要每一项能力都自己做到最好,我要知道谁在这件事上做得最好。 ⏱Shownotes 00:01 黄啊码登场:CTO、AI讲师与长期产品实践者 00:39 从传统程序开发一路进入AI,他的技术路径是怎么长出来的 01:35 具体知识会过时,为什么解决问题的思维可以一直留下 02:42 “我的路子比较野”:非标准化的技术成长方式 04:59 Java、PHP再回到Java,多年技术能力如何慢慢积累 05:22 为什么早期职业经历长期和医疗健康相关 07:04 一次用AI重新梳理个人健康问题的尝试 08:00 AI给出另一种思路以后,为什么仍然需要现实世界的专业确认 09:50 个体经验不能复制:AI辅助判断的边界在哪里 10:16 ChatGPT出现以后,他为什么没有继续硬卷基础模型 11:08 Stable Diffusion、Midjourney和AIGC视觉创作 12:10 做得越多,为什么越意识到审美的重要 13:10 转向Coze工作流:终于回到自己熟悉的逻辑世界 13:45 程序开发和工作流之间为什么高度相通 15:15 从Coze到Vibe Coding,能力如何继续迁移 15:44 百度秒哒进入视野 16:22 第一次接触秒哒,并没有想象中那么激动 16:54 参加黑客松:坦白说,一开始就是冲着奖金来的 17:19 拉塔塔一起参赛:技术与审美怎样互补 17:46 比赛成绩之外,真正重要的是公开认可 18:11 公开曝光如何进一步制造新的机会 18:32 小说工具、漫剧工具和第一张定制开发订单 19:03 积累—认可—曝光—变现,一条路径开始变清晰 19:31 为什么很多“突然成功”只是前面的过程没有被看见 20:16 AI工具到底该不该白嫖 20:41 省了模型费,为什么可能付出更多时间成本 21:02 个人使用和企业交付的成本逻辑有什么不同 21:23 真正开始交付以后,该花的钱省不掉 21:50 AI从业者为什么经常一边用最贵模型,一边熬最深的夜 22:54 技术之外,为什么开始认真经营个人IP 23:14 AI时代,传统简历为什么正在失去一部分证明力 23:51 AI能润色所有人的履历,但项目细节很难伪造 24:35 产品、作品和公开内容怎样成为新的个人名片 24:57 为什么做IP也可以理解成经营“自己这款产品” 25:22 怎样让自己的时间拥有更高定价权 25:46 快问快答:不同AI工具分别在什么场景下使用 26:42 最值钱的Vibe Coding习惯:先把需求讲清楚 27:10 为什么AI产品越改越乱,和传统甲方改设计完全一样 27:29 终局思维:先写验收标准 27:48 企业交付最大的坑之一:为了省钱选择了不合适的模型 28:16 甲方最后买的是结果 28:29 普通人30天入门Vibe Coding,应该先做什么 28:50 先做自己真正需要的一个小产品 29:19 为什么个人网站是很好的第一款AI产品 29:46 未来一年:先把身体和节奏照顾好 30:03 一步一个脚印继续经营自己的IP与产品 30:17 为什么不再追求每个方向都必须自己最强 30:37 一人公司并不是一个人什么都做 30:52 AI时代,一个人如何建立自己的能力生态 📖故事摘要 黄啊码做技术已经很多年。 如果只看今天,他身上有很多AI时代非常典型的标签:AIGC、工作流、Vibe Coding、百度秒哒、AI产品、个人IP、企业交付。 但真正把这些标签串起来的,并不是某一个模型。 而是迁移。 他的技术成长方式一直不算特别标准。 一个问题来了,就去解决一个问题;缺哪块知识,就补哪一块。慢慢做下来,曾经看起来零散的技术、产品和业务经验,反而形成了一套属于自己的方法。 所以ChatGPT出现以后,他没有因为自己是技术人,就默认一定要钻进基础模型。 研究过以后,他很快开始判断: 这到底是不是我的优势? 如果不是,就找下一个自己能够真正动手的位置。 Stable Diffusion、Midjourney等工具出现时,他进入AIGC图片和视频。 视觉生成第一次让普通人以极低门槛进入过去需要大量专业能力才能完成的创作。 黄啊码也认真做了一段时间。 越做,他反而越意识到: AI降低的是执行门槛。 不是审美门槛。 同样一个模型,有人做出来只是“AI味很重的一张图”,有人可以做成完整、有风格、有辨识度的作品。 差别依然来自人。 构图、颜色、UI、视觉判断,以及一个人到底看过多少好东西。 意识到这一点以后,他没有逼自己一定要成为最好的视觉创作者。 他开始重新寻找自己的优势。 Coze工作流出现以后,答案非常明显。 工作流里的节点、输入、输出、条件、变量和业务流程,对于一个做了多年程序的人来说非常熟悉。 过去这些东西藏在代码里。 现在AI和低代码工具把它们重新变成更加直观的结构。 黄啊码甚至发现,自己在正式接触Coze以前,就已经做过相似逻辑的产品。 工具是新的。 思维不是。 到了Vibe Coding阶段,这种迁移变得更加明显。 过去软件开发最大的壁垒之一,是把人的需求翻译成机器可以执行的代码。 现在大量翻译过程可以交给AI。 但这并不意味着人什么都不用懂。 恰恰相反,代码成本下降以后,真正影响产品质量的东西开始继续向前移动: 你的需求清不清楚? 业务结构合理不合理? 产品最后解决谁的问题? 什么叫做完? 怎么验收? 一个人如果连这些都没有想清楚,AI越快,只会越快生成一堆以后还要推倒重来的东西。 所以黄啊码现在特别重视“终局思维”。 先把终点描述清楚。 告诉AI: 我最后需要什么结果。 有哪些功能。 哪些东西必须满足。 验收标准是什么。 至于中间怎样实现,可以让模型参与判断。 这和很多人使用Vibe Coding的方式恰恰相反。 很多人先说: 帮我做一个App。 生成以后发现不满意。 再改。 这个地方调整。 那个地方再换。 改到第四版、第五版,代码越来越复杂,产品越来越乱,最后突然觉得: 好像还是第一版最好。 这不是AI的问题。 而是人类版的需求变更一直没有停止。 黄啊码过去做企业交付时,也踩过另一种很现实的坑: 过度考虑成本。 他曾经希望替甲方节省模型费用,所以选了价格更低但能力相对弱一些的方案。 结果输出质量不够。 甲方不满意。 继续改。 继续调。 再返工。 最后节省下来的模型费用,根本抵不过双方多花的时间。 这件事让他重新理解什么叫B端交付。 客户购买的不是Token。 也不是你中间的聪明操作。 客户购买的是结果。 如果一个更好的模型可以更快交出合格结果,该花的钱反而应该花。 所以黄啊码现在对“白嫖AI”这件事没有过去那么执着。 免费工具当然可以用。 但一个人的时间同样是成本。 模型贵100块,却能帮你省三小时;另一个工具完全免费,却需要反复折腾半天,这两件事到底谁更便宜,得重新算账。 他在百度秒哒上的经历,也让这套“结果思维”进一步延伸到了商业。 2025年参加相关黑客松时,他最开始的目的并不宏大。 奖金。 既然平台办比赛,那就参加。 他还把塔塔拉过来组队。 因为他知道自己技术逻辑强,但审美不是最突出的能力,而艺术背景的塔塔恰恰能形成补位。 最终塔塔拿第二,黄啊码拿第三。 可真正影响后续的,并不是比赛名次本身。 比赛给了作品一个公开的认可。 认可以后,别人开始知道这个人。 过去藏在电脑里的项目被看见。 小说工具进一步变成漫剧方向的产品。 随后真实的定制需求开始出现。 到了这个时候,他才把整条链路看得越来越清楚: 积累。 作品。 认可。 曝光。 最后才是变现。 今天看一个人突然接到AI订单,很容易觉得: 这个风口真好。 但再往前看,他可能已经做了一年、两年,甚至更久。 只是过去那些时间没有被市场看见。 AI时代只是让“被看见以后迅速变现”的速度变快了。 没有取消前面的积累。 也正是因为这样,黄啊码越来越重视个人IP。 AI能够把一份普通简历润色得非常漂亮。 Titles可以写得很好听。 经历可以包装。 但真正做过一个产品的人,一旦被追问细节,回答完全不同。 为什么这么设计? 踩过什么坑? 最开始的需求是什么? 用户用了以后怎么反馈? 模型为什么这样选? 从第一版到最后发生了什么? 问三层、五层,很难装。 所以在他看来,一个人在今天最有价值的履历,越来越不只是PDF。 而是公开存在的作品。 产品。 项目。 文章。 演讲。 真实案例。 这些东西共同组成一个人的市场认知。 所谓做个人IP,也不一定非要追求百万粉丝。 它更基础的价值,是让一个陌生人还没真正和你合作以前,就已经能够判断: 这个人到底会什么。 这样,信任成本会下降。 合作成本也会下降。 一个人的时间定价,可能随之改变。 从这个意义上来说,每个人其实都在经营“自己这个产品”。 上班是在出售时间。 咨询是在出售时间。 开发是在出售时间。 内容也是在出售某种注意力和经验。 真正的问题是: 怎样让同样的一小时越来越值钱? 黄啊码目前给出的答案,并不是让自己变成一个六边形战士。 恰恰相反。 他越来越接受: 我不需要所有东西都做到最好。 有人审美比我强。 有人营销比我强。 有人在某个模型上理解更深。 有人更懂一个具体行业。 我要知道自己的强项,也要知道其他强项分别长在谁身上。 AI则负责吃掉越来越多过去纯执行的部分。 这也是他对“一人公司”的理解。 一人公司并不等于: 这个人没有任何合作伙伴,一个人从早到晚把程序、设计、运营、销售、财务全部干完。 那仍然只是一个非常累的个体户。 真正的AI时代,一个人更像一个节点。 围绕自己连接AI、合作伙伴、专家、平台和客户。 自己保留核心判断。 其他部分不断调用更合适的能力。 这才更接近一个人的生态。 如果普通人今天第一次接触Vibe Coding,黄啊码也没有建议一上来就做一个“改变世界”的产品。 先做小的。 最好做一个自己真的会使用的东西。 比如个人网站。 如果本来就需要向别人介绍自己,那么它有真实用途。 可以拿来展示。 可以持续改。 可以真的收到反馈。 产品不是为了证明“我会用AI”。 产品首先应该有用。 这是AI把开发门槛不断降低以后,反而越来越重要的一条标准。 聊到最后,黄啊码谈未来一年。 他第一个说的是: 身体健康。 少熬夜。 这个答案放在一群天天讨论模型、Agent、Coding和创业的人中间,反而显得特别实际。 技术永远还会有下一个。 今年是这个模型。 明年可能又完全不同。 一个人不需要每次都成为最早的那一个。 真正重要的是,在工具持续变化的时候,还能持续把过去的经验带过去。 找到自己的优势。 做点真实的东西。 让别人看到。 接住新的机会。 然后继续往下一块积木走。 💬听众互动 如果AI已经让“把一个想法做成产品”的成本越来越低,那么你过去真正积累下来的那项能力是什么? 如果把它和今天的Vibe Coding结合起来,你最想做出的第一个真实产品,又会是什么?

32分钟
53
1周前
50.Terry Tang:从巴基斯坦工地到深圳跨境电商独立站,但他还是出来做了OPC

50.Terry Tang:从巴基斯坦工地到深圳跨境电商独立站,但他还是出来做了OPC

灯下白-走进 AI 圈的真实对话

🎙《灯下白》EP50 Terry 嘉宾:Terry Tang 跨境电商创业者、SEO/GEO实战者、AI工作流实践者。大学学习土木工程,毕业后曾参与“一带一路”海外工程项目,在巴基斯坦工作三年。回国后从外贸独立站切入跨境电商,长期深耕海外SEO,后做到SEO负责人,并加入AI SaaS初创公司参与产品出海。如今以OPC方式创业,运营AI工具出海网站、Claude Code训练营及跨境企业AI提效业务,持续探索AI时代的独立站、海外获客与品牌增长。 主持人:吴熳 在得到直播讲过AI应用,在WaytoAGI北京切磋分享,代表中国在英国大使馆文教处国际大会全英发言讲中国AI如何赋能英语教学,AI牛马库导航科普网站 ka21.org 主理人 本节目由人类与GPT共同策划,剪映处理音频中水词,千问处理剪辑时间轴,GPT撰写Shownotes,Banana Pro生成播客logo,即梦生成播客封面,Suno生成片头片尾音乐,同时由声湃和中关村科学城公司提供录音场地,由罗德麦克风提供录音设备。感谢中关村科学城的政策支持! 🪝本期故事 吴熳第一次看完Terry的履历,只说了一句话: “真的是干土木的,啥都能干。” Terry大学学的是土木工程。那个专业在他入学的时候还很热门,等真正走进社会,建筑行业的周期已经开始变化。好在他英语不错,毕业后进入一家中字头企业,参与“一带一路”海外工程项目,在巴基斯坦一待就是三年。 后来为了结婚和家庭,他回国了。 可回到湖北襄阳,他很快面对一个现实问题:原来的土木路径已经很难提供理想的工作机会。 他只好重新找自己身上还能卖出去的东西。 其中一个是英语。 另一个,是大学时期因为爱好自学的建站技术。 他进入一家外贸公司做业务,看到老板主要依靠阿里国际站等平台获客,就主动提了一个建议:做外贸,为什么不自己建网站? 老板问:你会吗? 他说:我会。 于是,一个土木工程毕业生,靠着自己大学里折腾WordPress留下的技术爱好,给公司搭起了独立站。 网站做好之后又有新的问题: 没人来。 为了让海外客户在Google里找到网站,他开始学SEO。从网站速度、页面结构、关键词调研,到英文博客、Landing Page、搜索意图和竞品分析,他一点点进入这个行业。 后来,因为一个QQ群里认识的“贵人”,他从襄阳来到深圳,真正进入跨境电商行业,并一路做到SEO负责人。 所以Terry的人生看起来一直在转行,但其实有一条很明显的暗线。 英语把他带到海外。 建站把他带进外贸。 SEO把他带到深圳。 跨境电商又把他带进AI。 每一次转身,都是上一段经历里那个当时看起来“不太重要”的能力,在几年之后突然派上了用场。 Terry第一次真正感受到生成式AI的冲击,也发生在SEO工作里。 以前做海外SEO,大量成本花在英文内容生产上。一篇专业英文稿件可能需要找海外写手,成本很高。后来他开始使用接入GPT-3.5能力的Jasper AI,只需要给出产品参数,AI就可以迅速完成英文产品描述和内容初稿。 那一刻,他觉得整个行业的成本结构都被改写了。 更戏剧性的是,后来ChatGPT自己上线,Jasper这种曾经让他觉得非常惊艳的工具,很快失去了原来的位置。 Terry亲眼看见了一个产品如何因为基础模型能力跃迁而被迅速削弱。 这也让这一期再次出现《灯下白》反复聊到的那个问题: 所有建立在模型能力缺口上的工程优势,都必须面对下一次模型升级。 但AI没有把SEO直接消灭。 Terry反而认为,只要人还需要寻找答案、解决问题,搜索这件事就不会消失。Google加入AI Overview,GEO开始兴起,搜索入口和答案呈现方式在变化,可“一个人有需求,然后去寻找解决方案”这个底层逻辑没有变。 于是他又从SEO开始研究GEO。 再后来,他加入一家AI SaaS初创公司,参与从0到1的海外业务。 可真正让他决定再次离开的,并不是职业危机。 而是工作突然变得太轻松了。 那时候Terry已经把大量SEO流程迁移进Claude Code,并提前配置了自己的Skills。每天到了公司,他只需要用自然语言告诉Claude Code: 帮我做最近的关键词调研。 看看哪些任务还没完成。 把几篇文章写出来。 检查一下站内优化。 然后AI就在后台开始工作。 Terry起身去泡茶。 等他回来,很多过去需要自己坐在电脑前处理很久的事情,已经做完了。 他后来形容,那一刻首先感受到的不是爽,而是: 无比的孤独和空虚。 因为他突然意识到,自己好像拿到了一把非常好的钥匙,却还待在一个已经过于舒适的位置里。如果继续每天花很少时间完成已经熟悉的工作,这种舒服反而可能变成一种蹉跎。 于是,他从公司出来,开始做OPC。 更有意思的是,他出来以后第一个被市场验证的产品,并不是一个复杂的AI SaaS。 而是一门Claude Code训练营。 最开始,他只是在深圳跨境电商社群里免费分享自己的AI工作流。有人安装都不会,有人不知道Skill是什么,也有人看了很多教程,却依然不知道怎样把Claude Code真正接进自己的业务。 Terry觉得,也许应该有一套Roadmap,从安装开始,一步一步带着大家真正做出来。 他采用了独立开发者非常典型的方式: 先别做。 先卖。 第一期课程连完整内容都还没有,只有大纲。他直接问社群里的朋友:我要做这样一个训练营,2000元,两天一夜,线下,有没有人来? 来了接近20个人。 后来一期又一期,做到了第六期。 这件事给Terry最大的冲击不是“原来培训能赚钱”。 而是: 原来一个人真的可以不上班,也能养活自己。 这是一种完全不同的底气。 公司给你的工资,不一定是你全部的市场价值。真正能够被拿走的,是你积累了多少行业Know-how,有多少人相信你确实解决过问题,以及你能不能把这些经验重新组织成别人愿意付费购买的结果。 现在,Terry依然在运营自己的AI工具出海网站。其中一个网站每天大约有1000名用户访问,也已经能够产生相对稳定的广告收入。 而他正在越来越关注另一个机会: 中国小B企业的B2B出海。 过去,一个非常细分的中国制造企业想自己做海外独立站,成本并不低。建站需要人,设计需要人,SEO需要人,网站运营需要人,英文内容同样需要人。 所以很多企业最后只能依赖平台。 但AI Coding正在把这些成本快速压下来。 如果一个工厂只生产一种非常细分的产品,比如沙发垫、挂绳、某种器械配件,它过去可能因为市场太小,根本养不起一整套独立站团队。 现在,一个人就可能同时完成建站、设计、内容、关键词调研和部分运营。 而越垂直的B2B产品,搜索需求往往越精准。采购商不是随便看看,而是真的可能一次买100件、1000件。一旦在Google或者未来的GEO场景里抓住这个需求,单个询盘的商业价值可能远高于大量普通C端流量。 Terry已经在身边学员身上看到真实案例: 一些极其细分的B2B独立站,每天能够收到四五封来自海外采购商的询盘。 这也是为什么他在节目里忍不住把它称为: “财富密码。” 当然,他非常清楚,从“知道财富密码”到“真正赚到钱”,中间还有巨大差价。 这也是Terry整期节目最稳定的一套方法: 不要上来就写文章。 先诊断网站。 不要上来就做产品。 先查需求。 不要自己坐在那里猜海外用户喜欢什么。 先看关键词、趋势、竞争和搜索意图。 关键词调研在他看来就是“兵马未动,粮草先行”。 SEO的目的也从来不是写文章。 从第一性原理倒推,最后要的是利润;利润之前是成交;成交之前需要流量。 文章只是其中一种获得自然流量的方法。 AI时代,这套逻辑依然没有变。 只是一个人能够完成的环节,突然多了很多。 💡本期你会听到 土木工程毕业的Terry,为什么第一份工作跑去了巴基斯坦,以及英语怎样成为他人生第一次换轨的关键能力。 从“一带一路”海外工程回国以后,他为什么没有继续做建筑,而是在湖北襄阳一家外贸公司重新开始。 明明是土木工程专业,为什么他会搭网站。一个大学时期自己折腾WordPress的爱好,后来怎样变成真正的职业筹码。 他为什么主动说服外贸老板建立独立站,以及当一个网站建出来却没有人访问以后,SEO又是怎样进入他的职业生涯。 从襄阳到深圳,一段QQ群里认识的关系为什么最终带给他跨境电商职业机会。 SEO到底是什么?为什么“SEO=写文章”是一个很大的误解。 网站速度、移动端适配、Google抓取、关键词、页面文案、Landing Page和博客内容分别解决什么问题。 什么叫Thin Content,为什么一个只有产品和广告、缺少足够信息的网站很难获得搜索引擎信任。 为什么Terry认为SEO既需要理科思维,又需要文科思维,而且真正日常工作里文科能力可能反而占得更多。 以前没有AI时,一篇1000多词的英文文章为什么真的需要“手搓”。 SEO的第一性原理是什么:为什么最后要从利润一路倒推到成交、流量和内容。 为什么拿到一个网站以后,第一步不应该马上写文章,而是先做网站诊断。 关键词调研为什么叫“兵马未动,粮草先行”。 Semrush、Ahrefs等专业工具到底在查什么,搜索量、关键词难度、趋势和网站权威度怎样影响决策。 小众、蓝海、高利润的关键词为什么可能比大流量红海词更有商业价值。 Terry过去是怎样学HTML、CSS、服务器和网站技术的,以及为什么他的学习方式一直是“遇到问题,再解决问题”。 英语能力为什么从巴基斯坦工程项目一路影响到他后来的跨境电商职业。 第一次使用Jasper AI生成海外SEO内容时,他为什么觉得行业发生了转折。 过去需要海外写手完成的英文内容,GPT-3.5时代已经怎样开始降本。 Jasper AI后来为什么迅速失去原来的优势,以及基础模型升级怎样改变AI应用创业的生存环境。 AI生成内容越来越容易以后,SEO到底会不会消失。 Google AI Overview、SEO和GEO之间是什么关系。 为什么Terry认为,只要人还在寻找答案,“搜索”作为需求就不会消失。 GEO是不是SEO上面套了一层RAG?为什么现在行业开始发现,两者不能完全画等号。 做到SEO负责人以后,他为什么主动进入AI SaaS创业公司。 每天高强度使用AI超过数小时,一个人的职业方向会怎样被重新塑造。 为什么他最后离开AI SaaS公司,选择自己做OPC。 那杯改变职业路径的茶:给Claude Code下完指令以后,回来发现工作全部完成,为什么反而让他感到孤独。 一个人工作效率变得太高以后,舒适区为什么反而可能变危险。 Claude Code训练营是怎样从一次免费社群分享长出来的。 为什么有人连安装都卡住,而“知道这个工具”与“真正把它跑进业务”之间存在巨大差价。 什么叫预售:课程还只有大纲时,为什么Terry已经开始收费。 第一期2000元、两天一夜、接近20个人,为什么大家愿意为一个当时并不算大IP的人付钱。 培训产品做到第六期以后,最大的流量来源为什么开始变成老学员转介绍。 为什么真正值钱的不是“会Claude Code”,而是Terry多年SEO和跨境电商经验怎样被Claude Code放大。 “原来人真的可以不上班也养活自己”,这句话为什么对一个经历过行业周期的人尤其重要。 35岁危机究竟是什么:一个人的价值到底来自公司平台,还是可以被独立拿走的能力。 为什么Terry认为培训不会是自己长期唯一的业务。 跨境企业愿意为什么样的AI提效结果付钱。 找海外Influencer、批量开发B2B客户,这些重复工作怎样越来越适合Agent完成。 为什么Terry判断,2026年的细分B2B小企业出海可能存在很大的机会。 一个只卖沙发垫、挂绳或者细分器械的中国企业,为什么反而可能适合做海外独立站。 过去做独立站为什么贵:开发、SEO、运营、设计、内容,每一个岗位都是成本。 AI Coding把这些成本压缩以后,小B企业为什么第一次可能真正有能力自己建立海外品牌阵地。 B2B独立站为什么可能比平台更容易抓住精准搜索需求。 每天四五封海外采购询盘,对一个细分工厂意味着什么。 Terry自己的两个AI工具出海网站是怎么做出来的,其中一个为什么已经有每天约1000名访问用户。 如果今天重新拿一台电脑,从零做一个AI出海项目,他最不愿意省掉的两笔钱是什么。 为什么第一笔钱应该花在查词和需求研究,而不是Logo和复杂开发上。 为什么做AI项目必须计算开发、Token、服务器、时间和长期运维成本。 “Terry的美妙工作流”这个名字是怎么来的。 为什么最理想的工作状态,是AI在后台吭哧吭哧干活,人只负责提出目标、验收结果和喝茶。 快问快答里,Claude Code、ChatGPT和Grok为什么成为他最常用的AI工具。 为什么他会觉得Grok在实时海外信息检索上特别有优势。 他认为最值得所有人改变的一个AI习惯,为什么居然只是语音输入。 一个成熟的语音输入法怎样从“识别声音”变成“理解你的表达并自动润色”。 AI网站真正开始有流量以后,他踩过最大的一个成本坑是什么。 为什么Demo部署很简单,但生产环境一旦开始赚钱,就必须重新考虑流量、成本和稳定性。 普通人30天学SEO/GEO,为什么他第一个推荐的不是付费课,而是Google官方文档。 未来一年,Terry为什么希望培训收入占比下降,把更多精力放到跨境独立站AI提效、海外推广和品牌建设。 🔥本期金句 干土木的,确实什么都能干。 英语是我当时赖以生存的一个技能。 SEO不是写文章,写文章只是SEO的一种方法。 从第一性原理倒推,我们最终的目标是利润,利润之前是成交,成交之前是流量。 关键词调研就是兵马未动,粮草先行。 你不能坐在那里想用户需要什么,你得把需求真正查出来。 SEO既需要理科生思维,也需要文科生思维。 我学东西基本不是先完整学一遍,而是遇到问题解决问题,最后突然发现一套体系都学会了。 AI第一次让我意识到,语言的隔阂和技术的隔阂都可以被大幅降低。 只要人还需要解决问题,搜索这件事就不会消失。 有一天我给Claude Code下完指令,出去泡了一杯茶,回来发现工作已经全做完了。 那一刻我感到无比孤独和空虚,因为我发现自己过得太舒服了。 原来一个人真的可以不上班,也可以养活自己。 无论你卖什么,只要是在解决真实需求,就有机会解决自己的生存问题。 秒懂没有用,做和秒懂中间有差价。 真正值钱的是,你已经踩过这些坑,知道遇到问题该怎么解决。 以前叫个体户,现在有了技术,叫OPC。 细分B2B小企业在2026年可能有大结果。 以前一个独立站需要开发、运营、SEO和设计,现在很多事情一个人真的能干。 我做AI工具站,第一步永远是先找到海外用户一个具体的需求。 创业成本不只是开发,还有Token、服务器、时间和运维。 我的美妙工作流,就是AI在后台完成工作,我负责验收,然后喝咖啡、喝茶。 一个非常简单、但所有人都应该开始用的工具,就是语音输入法。 Demo和生产环境是完全不一样的,真正有用户以后,成本一定要重新算。 大道至简。很多行业入门的方法其实都一样。 ⏱Shownotes 01:26 Terry登场:一个跨境电商创业者 01:51 “干土木的啥都能干”:完全跨界的人生起点 02:07 土木工程毕业后,为什么去巴基斯坦做了三年海外项目 03:19 第一次长期生活在巴基斯坦是什么体验 04:30 回国、准备结婚,以及建筑行业周期带来的第一次转行 05:29 一个土木工程学生为什么大学时就会搭网站 06:16 说服外贸老板:做海外生意,为什么必须试试独立站 06:59 从襄阳来到深圳:一个QQ群里认识的贵人 08:42 真正进入跨境电商以后,SEO每天到底在干什么 09:03 SEO为什么同时需要技术思维和内容思维 09:47 Thin Content:网站内容太薄为什么很危险 10:49 最大的误区:SEO不等于写文章 11:33 从利润、成交倒推到自然流量 11:52 拿到一个网站以后,第一步为什么是诊断 13:33 关键词调研为什么叫“兵马未动,粮草先行” 14:04 Semrush、Ahrefs与专业关键词研究 15:07 搜索量、蓝海、竞争度和利润空间怎样一起判断 16:11 HTML、CSS、服务器,这些技术能力是怎么自学出来的 16:45 遇到问题解决问题:Terry的长期学习方法 17:25 SEO到底训练了什么能力 17:39 为什么一个SEO负责人反而认为自己文科思维更重 19:46 第一次用AI写英文SEO内容,行业转折出现了 20:00 Jasper AI怎样大幅降低海外写手成本 21:50 内容生产门槛下降以后,SEO从业者第一次感到危机 22:41 Jasper先火起来,ChatGPT上线以后发生了什么 25:37 亲眼看着一个曾经常用的AI工具消失 27:42 AI生成内容以后,SEO为什么没有消失 28:13 Google AI Overview与搜索的新形态 29:39 GEO和SEO究竟是不是一回事 30:55 做到SEO负责人后,为什么主动加入AI SaaS初创公司 32:11 跨境经验与AI产品出海,怎样自然接到一起 33:02 为什么又从AI公司离开,决定做OPC 33:30 把整个SEO工作流搬进Claude Code 34:26 泡完茶回来,发现自己的工作已经全部做完 34:40 “无比孤独和空虚”:效率太高为什么反而促成辞职 35:56 OPC后的第一个稳定现金流,为什么是Claude Code训练营 36:44 “出来混最重要的是出来”:从一次免费分享开始 37:18 安装、Skill、PPT、飞书:为什么需要系统Roadmap 37:56 独立开发者的预售思维:课程还没做,就先卖 38:36 第一期2000元,两天一夜 39:34 接近20名学员为什么愿意成为“初始股东” 41:00 为什么卖得出去的不是Claude Code,而是“跨境电商+AI” 41:32 做到第六期以后,他第一次意识到不上班也能活 42:20 老学员转介绍为什么逐渐成为核心来源 43:40 35岁危机:自己的价值是不是只能依赖公司平台 44:48 培训之外,开始给跨境企业做AI提效 45:14 为什么长期方向一定还要进入B端 46:06 Agent怎样帮助跨境团队寻找海外Influencer 46:25 B2B客户开发为什么也适合AI自动化 47:50 “我看到一个财富密码”:2026年的细分B2B出海 48:53 过去小企业为什么很难承担独立站成本 49:36 独立站SEO/GEO为什么可能让细分产品直接跳出平台竞争 50:14 真实案例:一些B2B网站每天收到四五封海外询盘 51:18 开发、SEO、运营和设计,以前到底要养多少人 51:45 AI Coding以后,一个人为什么真的能干很多环节 52:58 Terry现在还在运营哪些网站 53:23 其中一个AI工具站每天约1000名用户访问 54:05 两个AI工具出海网站,都是从一个具体海外需求开始 55:04 如果从零重新做一个AI出海项目,他会先花哪两笔钱 55:24 先买查词工具,再找到需求,然后才建站 56:09 开发、Token、服务器、时间与运维:把成本全部算进去 57:10 公众号为什么叫「Terry的美妙工作流」 57:39 AI工作,人喝茶:什么叫真正的美妙工作流 58:44 快问快答:今天到底透露了多少“财富密码” 59:06 最离不开的AI工具:Claude Code、ChatGPT与Grok 59:13 为什么Grok适合追实时海外信息 01:00:37 最值钱的习惯,居然是语音输入 01:01:45 豆包语音输入怎样帮Terry在地铁上快速整理自我介绍 01:02:13 AI时代,为什么语音输入已经不只是语音识别 01:03:01 最大的建站坑:免费托管遇到流量暴增 01:04:12 Demo可以随便部署,生产环境为什么必须重算成本 01:05:23 普通人30天入门SEO/GEO,应该从哪里学 01:05:53 Google官方SEO文档,为什么可能比很多付费课更适合入门 01:06:50 “大道至简”:不同行业走到最后的方法为什么越来越像 01:07:15 未来一年:降低培训占比,继续做跨境企业AI落地 01:07:44 独立站AI提效、海外推广和品牌建设,才是下一阶段 💬听众互动 如果AI已经能替你完成现在工作里80%的重复任务,你会选择留在原来的岗位里,把日子过得更轻松,还是像Terry一样,拿着被释放出来的能力去重新做一门自己的生意? 更现实一点:如果现在只给你一台电脑,你最想把自己过去哪一段行业经验,做成一个真正能卖到海外的产品或服务?

69分钟
90
2周前
49. 史柏帆×张磊:从《三体》到一稿过的出海短剧,他们用AI重新做导演

49. 史柏帆×张磊:从《三体》到一稿过的出海短剧,他们用AI重新做导演

灯下白-走进 AI 圈的真实对话

🎙《灯下白》EP49 嘉宾:史柏帆、张磊 史柏帆 AIGC导演,AIGC影视创作者、创业者,长期进行AI视频与内容创作实践。 张磊 程序员出身的AIGC导演。因为长期热爱影视与《三体》,2024年前后开始尝试用AI把小说转化成画面,并逐渐从技术开发转向AIGC影视创作。如今与史柏帆共同从事AI短剧、影视资产设计与导演工作。 主持人:吴熳 在得到直播讲过AI应用,在WaytoAGI北京切磋分享,代表中国在英国大使馆文教处国际大会全英发言讲中国AI如何赋能英语教学,AI牛马库导航科普网站 ka21.org 主理人 本节目由人类与GPT共同策划,剪映处理音频中水词,千问处理剪辑时间轴,GPT撰写Shownotes,Banana Pro生成播客logo,即梦生成播客封面,Suno生成片头片尾音乐,同时由声湃和中关村科学城公司提供录音场地,由罗德麦克风提供录音设备。感谢中关村科学城的政策支持! 🪝本期故事 这大概是《灯下白》目前最像“三个人误入别人家客厅”的一期。 节目刚开始,史柏帆就以“公主式出场”坐进镜头。吴熳坐在史柏帆和张磊中间,忍不住说:你们两个怎么这么像两口子? 他们最近确实几乎每天都在一起。 一起创业,一起做AIGC公司,一起接甲方的AI短剧,一起讨论资产、分镜、世界观和镜头。工作强度很高,但史柏帆说,他们反而觉得很幸福,因为两个人很多时候意见一致,兴趣也接近;一方忙不过来,另一方自然补位。 他们最近做的一部海外短剧,剧情也很典型。 一个原本漂亮的皇后被人陷害,吃了让自己变胖的药,在国王生日典礼上遭到羞辱,最后完成逆袭。这个故事听起来甚至有一点狗血,但史柏帆和张磊并不排斥。 因为出海短剧首先面对的,仍然是最基础的人性。 受辱、委屈、逆袭、爱、嫉妒、愤怒、快乐,这些情绪并不会因为观众来自美国、欧洲还是中国就彻底不同。真正不同的,是服装、建筑、文化背景、行为逻辑和生活习惯。 所以他们做AIGC短剧,不只是“给模型一句Prompt”。 一部架空宫廷剧到底处于哪个时代?巴洛克还是洛可可?建筑应该有多古老?女王穿什么衣服?头饰、王冠、家具和沙发应该怎样搭配?一个穿越者把现代物品带进古代环境以后,什么样的反差才真正成立? 这些都需要在生成以前被设计。 人物是一套资产,服装是一套资产,场景、家具、重要道具也都是资产。到了真正的视频阶段,再像传统导演调度现场一样,把角色、位置、动作、台词、情绪和镜头重新组织起来。 史柏帆说,现在的AI视频创作正在发生一个很明显的变化: 以前更像动画思维,现在越来越像导演思维。 而张磊就是这种变化里很有代表性的人。 他原本是程序员。 但他一直喜欢电影,也一直是《三体》的书迷。他曾经有一个很简单的愿望:能不能把自己脑海里的《三体》真正做成画面,让别人也看到? 2024年前后,AI视频工具开始出现,他突然发现,过去需要庞大影视工业体系才能完成的东西,个人第一次有了机会。 于是他开始做,越做越多,越做越喜欢,最后真的从程序员走成了AIGC导演。 但工具变强,并没有让导演变得不重要。 恰恰相反。 当AI越来越会生成画面,真正困难的问题开始从“能不能生成”,转向“你到底想生成什么”。 张磊做《三体》时,有一场云天明回忆自己人生经历的戏。他用了差不多三天完成,却因此低落了一个星期。 因为在制作过程中,他必须把自己带进角色。 角色为什么这样说话?这个时候应该是什么表情?镜头离他多远?情绪什么时候起来,什么时候落下? 过去演员自己要进入角色。 现在AIGC导演甚至要替AI演员进入角色。 这也是史柏帆认为,AI依然很难真正替代导演和编剧的原因之一: 导演最核心的能力,是共情。 不是知道哪个模型参数更高,而是能不能进入一个和自己完全不同的人,看见他的处境,理解他的欲望,再让观众也相信这一切。 所以聊到最后,两个人给想进入AIGC影视行业的人一个几乎完全不像技术教程的建议: 先看电影。 去看真正优秀的影视作品。 看节奏为什么这样变化,看分镜为什么放在这里,看人物为什么这样表演,看一部成熟作品怎样让情绪呼吸。 模型当然还会继续变。 但电影为什么好看,这件事不会因为模型更新一次就自动改变。 💡本期你会听到 史柏帆和张磊为什么决定一起创业,以及两个长期高度协作的人怎样在AIGC影视公司里互相补位。 海外AI短剧的甲方到底在买什么。从剧本到分镜,再到最终视频,AIGC团队需要承担哪些真实交付环节。 为什么“被陷害的胖皇后逆袭”这样的剧情会适合海外短剧,以及不同国家的观众背后有哪些共通的人性。 流量到底有没有所谓的玄学。史柏帆为什么越来越不愿意天天研究平台算法,而更关心“观众到底想看什么、看完有没有情绪”。 视频号的冷启动、流量池和赛马机制是怎么回事,为什么朋友最初的一键三连和完播率可能仍然有意义。 曾经几个小时跑出巨大流量内容,为什么史柏帆反而觉得这种流量“没有意义”。 内容创作者究竟应该追求绝对播放量,还是找到真正喜欢自己内容的人。 2025年前后的AI视频工具还有明显局限时,为什么真正优秀的作品放到今天仍然成立。 模型变强以后,提高的更多是创作效率,还是创作上限? 中文观众和海外观众的审美真的差很多吗?为什么史柏帆认为喜怒哀乐这样的底层情绪始终共通。 做海外剧时,为什么世界观不能偷懒。罗马、希腊、中世纪、巴洛克、洛可可和新古典主义之间的区别,最后会怎样影响观众的沉浸感。 剧情为什么也需要“呼吸感”。持续的信息轰炸和持续的高情绪,为什么反而可能让人疲惫。 一个程序员是怎样转行成为AIGC导演的。 张磊为什么因为《三体》开始做AI影视,并逐渐发现这就是自己真正喜欢的事情。 做一部AI短剧以前,人物、面容、服装、场景、道具和装修为什么都需要先被资产化。 什么叫“AI脸”,为什么成熟AIGC作品必须让人物真正拥有辨识度。 为什么现在的AI视频已经开始从“动画思维”进入“导演思维”。 资产拆开以后,导演怎样重新调度人物、场景、道具、位置、动作、台词和情绪。 语言在新一代AIGC影视里为什么仍然重要。它不只是描述画面,更是在组织不同资产之间的关系。 史柏帆为什么离不开语言模型、视频模型和图像工具,人物一致性在影视工作流里到底有多重要。 张磊为什么开始关注新的语言模型,让它帮助做资产整理、时代考据、服装特征、提示词和情绪设计。 AIGC导演最重要的能力为什么不是Prompt,而是共情。 一个导演为什么会因为做了三天云天明的戏,自己低落一个星期。 传统演员需要入戏,而AIGC时代为什么变成导演替AI角色入戏。 不同AI模型为什么像有不同“脾气”,并不存在一个模型适合全部场景。 普通人30天进入AIGC影视行业,究竟应该先学模型,还是先补影视基本功。 为什么两个人都认为,热爱比追风口更重要。 未来一年,史柏帆最想要的变化为什么并不是一个新模型,而是和张磊“长长久久”地继续把事情做下去。 🔥本期金句 做流量没有想象中那么难。归根结底,还是大家想看什么,什么东西能让人开心、让人有共鸣。 我并不需要去搞清楚每个平台全部的算法逻辑,我更关心内容本身到底好不好。 如果每天都盯着流量,一个人会非常焦虑。 流量如果不能把我真正喜欢、真正做的东西传播出去,对我来说就没有那么大意义。 工具的限制不是制约真正创作者的核心因素。 新的模型可以提高创作效率,但不会自动让作品变好。 所有人类底层的感情其实是共通的,差异更多来自成长环境和文化细节。 一部片子的情绪要像呼吸一样,有呼有吸,有张有弛。 现在的AI创作越来越不是动画思维,而是导演思维。 一个AIGC导演依然要理解人物、世界观、动作、台词和情绪。 我过去虽然是程序员,但我一直非常喜欢影视。 因为热爱,所以我去做。 导演最重要的能力之一,是共情。 AI很难替代导演和编剧的一点,是人能够站到别人的角度思考问题。 现在的导演还要站到演员的角度,因为你要指导AI演员怎么表演。 模型都有自己的脾气,没有一个工具适合所有场景。 如果真的想进入AIGC影视,先拿出热爱,再开始做。 比学任何一个AI技术更重要的,是先看足够多优秀的影视作品。 ⏱Shownotes 00:10 《灯下白》第一期视频播客:史柏帆和张磊登场 00:40 “你们两个怎么像两口子”:两个AIGC创业搭档的日常 01:26 现在正在给甲方做什么:AI海外短剧正式交付 01:56 胖皇后被陷害再逆袭:海外观众到底喜欢什么剧情 03:21 工作之外继续做内容IP,“魏大局”为什么还在更新 04:20 流量有没有秘密:先别研究算法,先想观众为什么愿意看 05:01 一键三连、完播率与视频冷启动 05:41 流量池和赛马机制:做到最后为什么反而不想天天研究 06:19 几个小时的大流量,为什么史柏帆觉得“没有意义” 06:52 B站×CCTV6比赛与过去的AIGC获奖经历 07:20 为什么2025年的模型很差,作品今天看依然可以很好 08:17 中文和海外评委都喜欢的内容,到底共通在哪里 08:36 出海短剧背后:人类底层情绪其实没有那么不同 09:18 张磊的导演方法:先问这套画面能不能打动自己 10:00 世界观为什么是AIGC影视最容易被忽略的基础 11:01 巴洛克、中世纪与穿越剧:怎样让时代反差真正成立 11:57 一部片子的情绪为什么必须像呼吸一样有张有弛 12:49 程序员张磊为什么突然开始做AIGC导演 13:53 “因为热爱,所以才做” 14:28 人物、服装、场景、道具:影视资产到底包括什么 15:45 AIGC视频正在从动画思维进入导演思维 16:04 人物是人物,场景是场景,道具是道具:资产开始真正被拆开 17:05 像传统导演一样调度AI角色 17:55 语言依然重要:怎样描述位置、动作、台词和情绪 18:30 快问快答:史柏帆最离不开哪些AI工具 18:50 人物一致性为什么仍然是AIGC影视的基础问题 19:05 张磊最近为什么开始关注新的语言模型 20:01 语言模型怎样参与资产考据、提示词与分镜辅助 21:08 史柏帆:导演最重要的能力,是共情 21:42 张磊做《三体》时,因为云天明的戏低落了一个星期 22:31 为什么AIGC导演比过去更需要“进入演员” 22:52 做AIGC影视踩过最大的坑是什么 23:30 不同模型,其实都有不同的脾气 23:34 普通人30天入行AIGC影视,应该从哪里开始 23:40 史柏帆:先拿出热爱 24:12 张磊:先看大量真正优秀的影视作品 24:50 不是AI+行业,而是行业+AI 24:58 未来一年最期待什么:两个搭档继续长长久久 25:22 “人生得一知己真的很难” 📖故事摘要 史柏帆和张磊最近正在一起创业。 他们做的是AIGC影视公司。 吴熳坐在两个人中间录这期视频播客时,最直观的感受甚至不是他们技术有多强,而是这两个人实在太熟了。 熟到对方一句话刚开头,另一方就知道后面想表达什么;一方手里的工作来不及做完,另一方自然接过去;聊到对商业、创作和未来的判断,两个人很多时候也站在同一边。 史柏帆自己形容,他们最近几乎同吃同住,每天一起工作,强度非常高,却又觉得这件事非常幸福。 因为找到一个真正意气相投的搭档,本来就是一件很难的事。 他们现在接的是真实的AIGC短剧项目。 甲方给出剧本,团队需要理解故事,再细化分镜、设计人物和资产,最后把一整部剧通过AI真正做出来。 例如最近的一条剧情里,一个皇后被人陷害,因为吃了药变得非常肥胖。在国王生日典礼上,她受到各种羞辱,最后完成逆袭。 这种故事听起来并不高级。 甚至可以说相当“抓马”。 但如果真的去看全球短剧市场,就会发现,很多能够跨文化传播的东西本来就建立在人性非常基础的地方。 受辱以后想要翻身。 爱而不得。 嫉妒。 愤怒。 委屈。 喜悦。 逆袭。 这些感情不需要复杂的文化翻译。 观众可能来自完全不同的国家,可当一个人物被羞辱时,人知道什么叫难受;当她终于赢回来时,人也知道什么叫爽。 史柏帆认为,真正需要本地化的反而是细节。 成长环境、历史背景、服饰、建筑、礼仪和文化逻辑都会不同。 所以做海外短剧时,团队不能只让AI随便生成一个“欧洲宫殿”。 这个故事究竟发生在哪一个时代? 建筑属于中世纪早期,还是更晚的巴洛克? 人物穿什么? 宫廷里的家具长什么样? 如果剧情里存在穿越,那么现代物品被带入这个环境时,怎样才能形成真正的视觉反差? 这些都需要导演在AI开始生成以前就想清楚。 这也是为什么他们反复谈到“资产”。 人物的面容是资产。 服装是资产。 场景是资产。 道具是资产。 甚至某些家具和饰品,也要提前确定。 如果女主角换一个镜头脸就变了,如果同一场戏里衣服突然从巴洛克跳成唐代服装,即使每一张图片单独看都足够漂亮,观众也很难真正相信这个世界。 所以AIGC影视发展到今天,问题已经从“我能不能生成一张好看的图”,逐渐变成了“我有没有能力管理一个完整世界”。 史柏帆把这种变化称为: 从动画思维走向导演思维。 过去,AI视频制作大量依赖图生视频。 创作者先完成一张包含人物、背景、道具和特效的完整分镜图,再让模型使它运动起来。 现在,人物、场景和道具越来越可以独立存在。 创作者可以像传统影视导演一样思考: 这个人站在哪里? 从A点走到B点。 镜头先看国王,再移动到皇后。 人物说什么话? 现在是什么情绪? 谁和谁之间发生了什么关系? 生成方式发生变化之后,传统影视里大量关于导演、表演、摄影和世界观的知识,反而重新变得重要。 张磊就是一个非常有意思的例子。 他的职业出身是程序员。 但他一直很喜欢电影,也一直喜欢《三体》。 过去,看完小说以后,他会产生一种很典型的书迷幻想: 如果我能把脑子里的这些画面真的做出来就好了。 以前,这个愿望的成本太高。 拍影视需要剧组、演员、摄影、场景、服化道和大量预算。一个程序员即使脑子里有完整画面,也很难凭个人能力真正完成。 2024年前后,AI给了他第一次机会。 他开始尝试把小说转化成画面。 一开始只是因为喜欢。 后来越做越多,逐渐总结出自己的方法,也越来越享受导演这个角色。 吴熳问他: 为什么坚持? 张磊的答案其实特别简单: 因为热爱。 聊到后来,吴熳甚至觉得“坚持”这个词都不准确。 如果一件事情本身就是一个人喜欢的,他其实不是咬牙坚持。 只是一直在做。 而真正做久了以后,张磊发现,AIGC导演需要的远远不只是技术。 他做《三体》时,曾经处理云天明回忆人生的一场戏。 那是一段很悲伤的内容。 为了让AI生成的人物真正拥有正确的表情、动作和镜头情绪,他必须反复进入云天明的心理。 那场戏做了三天。 做完以后,他自己低落了整整一个星期。 吴熳听完觉得很好笑: 以前只听说演员出不了戏,怎么现在导演也出不了戏? 可这件事恰恰揭示了AIGC导演今天发生的变化。 过去演员需要理解角色。 导演把要求告诉演员,演员自己完成大量情感加工。 现在,AI演员并不会真正体验云天明的痛苦。 导演必须替它理解。 人物为什么低头? 这一刻应该哭,还是忍着不哭? 说这句话时声音应该是什么状态? 镜头到底应该靠近,还是慢慢退开? 导演必须先进入角色,再把这种理解转化成AI能够执行的指令。 史柏帆把这种能力概括为: 共情。 他认为,导演需要不断训练自己站到别人的位置上。 理解不同的人,理解不同的处境,也理解世界上和自己完全不同的生活。 这也是他认为AI短期内很难真正取代导演或编剧的一部分原因。 模型可以快速生成。 但真正的问题是: 谁来决定这一刻应该让观众感受到什么? 情绪也不能一直堆高。 史柏帆认为,一部片子要像呼吸。 有呼,也有吸。 如果一开始就是高能,到最后依然高能,观众反而会逐渐麻木。导演需要设计起伏,知道什么时候收下来,什么时候重新推高,什么时候安静下来让观众和人物待一会儿。 这些都不是换一个更强的视频模型以后自动出现的。 所以两个人对“模型决定作品质量”这件事都没有那么迷信。 他们在2025年就开始大量做AI视频。 那个时候模型的能力明显比今天弱,视频经常出现各种局限。 但史柏帆认为,张磊当时做的《三体》,放到今天依然是很好的作品。 工具变强以后,最大的变化是效率提高了。 创作者可以更快到达自己想去的地方。 但如果不知道自己究竟想去哪里,再快也没有意义。 这和史柏帆对流量的态度其实很像。 他并不否认算法,也知道视频存在冷启动、流量池和赛马机制。 最开始的时候,朋友帮忙点赞、转发、看完视频,确实可能帮助内容更快进入第一批流量池。 可做久以后,他越来越不愿意天天研究“下一个池子到底是多少播放量”。 因为那会让创作者变得很焦虑。 他自己做过几个小时内获得巨大流量的内容。 但他说: 这种流量对我没有意义。 如果只是热闹,没有把自己真正喜欢、真正正在做的事情传递给对的人,再大的数字也不一定留下什么。 他更在意的是: 观众为什么看? 看完以后有没有开心? 有没有被打动? 有没有共鸣? 只要内容本身成立,真正喜欢它的人自然会留下。 这也是两个人做出海短剧时的一套共同逻辑。 不要先追算法。 先理解人。 不要先追模型。 先理解影视。 不要因为AI可以快速生成,就放弃导演对世界观、情绪、节奏和表演的判断。 快问快答时,吴熳问: 如果一个普通人只有30天,想进入AIGC影视行业,应该怎么办? 史柏帆的回答是: 先问自己喜不喜欢。 AI时代一个很大的变化,是人终于有机会做很多过去因为专业和资源壁垒无法进入的事情。 你过去没有学导演,并不意味着不能拍。 没有读美术,也不意味着不能开始做视觉。 但前提是,你真的愿意投入。 张磊则给出了更传统的答案: 先大量看好电影。 看真正成熟的影视作品是怎样讲故事的,怎样做分镜,怎样安排人物情绪,怎样处理表演。 这些能力比先熟练某一个AI模型更重要。 因为模型一定会变。 行业知识不会那么快过时。 聊到最后,吴熳问他们: 未来一年最期待什么? 史柏帆没有回答下一代视频模型。 也没有说公司赚多少钱。 他说: 希望和张老师长长久久。 过去半年多,两个人在创作、做事、待人接物和商业判断上越来越合拍。 到了三十多岁以后,能够找到一个真正愿意长期一起做事,又真正互相信任的人,本身已经非常难得。 史柏帆说: 人生得一知己,真的不好找。 于是这一期从AI短剧聊到流量,从模型聊到导演,最后落到的还是人。 工具变得越来越强。 一个人能做的事情越来越多。 可真正稀缺的东西,好像还是没有变: 热爱。 共情。 判断。 以及一个愿意和你一起把事情做下去的人。 💬听众互动 如果现在AI已经把“拍一部片子”的技术门槛大幅降低,你最想把哪一本小说、哪一个故事,或者哪一个一直存在于脑海里的画面真正拍出来? 以及,如果要找一个人和你一起做这件事,你最希望这个搭档补足你哪一种能力?

27分钟
56
2周前
48. 颜鑫:00后连续创业AI零售、社交,泛心理和具身智能后,他想让机器人先学会听懂那句“我没事”

48. 颜鑫:00后连续创业AI零售、社交,泛心理和具身智能后,他想让机器人先学会听懂那句“我没事”

灯下白-走进 AI 圈的真实对话

🎙《灯下白》EP48 嘉宾:颜鑫 00后AI创业者、算法与具身智能实践者。大学学习自动化,大二起自学AI并开始创业,先后探索AI+零售、AI+社交、AI+泛心理等方向。近年来持续研究多模态情感感知、情感理解、机器人记忆与情感陪伴,希望让AI从被动响应的工具,逐渐成为能够感知环境、理解人并主动交互的伙伴。 主持人:吴熳 在得到直播讲过AI应用,在WaytoAGI北京切磋分享,代表中国在英国大使馆文教处国际大会全英发言讲中国AI如何赋能英语教学,AI牛马库导航科普网站 ka21.org 主理人 本节目由人类与GPT共同策划,剪映处理音频中水词,千问处理剪辑时间轴,GPT撰写Shownotes,Banana Pro生成播客logo,即梦生成播客封面,Suno生成片头片尾音乐,同时由声湃和中关村科学城公司提供录音场地,由罗德麦克风提供录音设备。感谢中关村科学城的政策支持! 🪝本期故事 录制这期《灯下白》的当天,吴熳原本并没有提前约颜鑫。 她是在面壁智能和华为昇腾的一场活动上再次遇见他的。颜鑫上台展示了一个自己正在折腾的桌面机器人,吴熳看完以后觉得有意思,现场把人“薅”过来录播客。 真正让她印象深刻的,不是机器人会回答多少知识问题,而是一个很小的瞬间。 有一次颜鑫正在电脑前写代码,没人向机器人提问,它却自己看着周围的环境,突然对他说:“你的屏幕看起来好大,你写代码应该很爽。你是不是程序员?” 颜鑫当时也愣了一下。 因为这句话不是由一句Prompt触发的。机器人通过摄像头看到了他的屏幕,观察了环境里的信息,再推测眼前这个人可能正在写代码,最后主动发起了一次对话。 这和我们今天熟悉的大部分AI交互不太一样。无论ChatGPT、豆包还是其他聊天机器人,通常都需要人先说一句话,AI再回答。颜鑫更想做的,是一个真正“活在环境里”的机器:它会看,会听,会记得,也会在某些时候主动和你说话;你可以打断它,它也可以根据你突然改变的表达调整自己的反应。 为了让这种交互更接近人,他还试图把延迟压到600—800毫秒左右,让机器人不仅说话,还能通过头部、身体和两只像耳朵一样的天线做出与语言相匹配的动作。 但颜鑫真正想解决的问题,比“做一个可爱的桌面机器人”更深。 如果一个人嘴上说“我没事”,AI到底怎样判断他是真的没事,还是正在强撑? 只看文字,这三个字永远只是“我没事”。可人在真实世界表达情绪时,还有语气、停顿、表情、姿态和动作。同一句话,用不同声音和表情说出来,背后的意义可能完全不同。 所以从2023年开始,颜鑫把越来越多精力放在AI+泛心理与情感陪伴上。他研究多模态情感感知、情感理解、全模态记忆,也思考一个进入家庭的机器人应该记住什么、忘掉什么,以及怎样在尊重隐私的情况下长期理解一个人。 而他为什么偏偏对“情绪”这件事感兴趣,也并不是偶然。 2023年前后,他自己即将毕业,身边的师兄师姐也都开始面临答辩、找工作、租房、异地和第一次真正进入社会的压力。大家都很焦虑,他自己也不是一个永远快乐的人。 他后来很坦率地说:如果我自己非常快乐,我可能也不会选择做这个方向。 颜鑫做产品有一个习惯——他必须先问:这个东西我自己会不会用? 他想做的不是一个听起来宏大的AI系统,而是先让它能帮到自己,再帮到身边的人。 从大二第一次做AI零售,到AI社交,再到今天做情感陪伴和具身智能,表面上看,他已经换了好几个赛道。 但聊到最后会发现,这几次创业其实都在靠近同一件事: 让AI真正进入人的生活。 不是让人为了AI改变生活,而是让AI先学会理解人。 💡本期你会听到 颜鑫为什么从大二就开始创业,以及一个00后连续探索AI+零售、AI+社交和AI+泛心理的路径是怎样形成的。 一个桌面机器人为什么会在没人提问的时候,主动观察颜鑫的屏幕,并判断“你是不是程序员”;主动交互和我们今天熟悉的聊天机器人到底有什么区别。 为什么“能不能被打断”是人机交互里非常重要的能力。如果AI永远按照自己的话说到底,它为什么更像对讲机,而不像一个真正的伙伴。 人和人交谈时对延迟非常敏感,为什么颜鑫尝试把机器人的响应压到600—800毫秒左右;低延迟为什么不仅影响体验,也会影响人对“这个AI聪不聪明”的直觉判断。 除了语言,一个陪伴机器人为什么还需要动作。头部、身体和两只天线的运动怎样与表达同步,以及为什么这些物理反馈会产生纯线上聊天无法提供的存在感。 人到底能不能和机器人建立信任?颜鑫为什么认为“绝对信任”也许很难,但“相对信任”可能通过技术逐步建立。 他说“我没事”时,AI到底听见了什么?为什么只识别文字,很容易损失人真正表达的情绪。 情感感知为什么必须从文字扩展到视觉、声音等更多模态,以及情绪为什么比数学题更难训练——1+1可以明确判断对错,但一个人此刻到底有多难过,很难拥有绝对标准答案。 AM Bench为什么被提出,它试图衡量现有模型在情感理解相关能力上的表现。 为什么颜鑫认为一部分情感感知应该尽可能留在端侧。一个进入家庭、拥有摄像头的机器人会看到大量私人生活,如果全部上传云端,会产生怎样的隐私风险。 2024年他们做视觉—文本多模态小模型的过程中,为什么把端侧情感理解作为重要方向,以及小模型在具身设备中可能承担什么角色。 从情感感知到情感理解,再到情感表达,为什么是三个完全不同的问题。 传统语音对话链路为什么会经过“语音转文字—大模型处理—文字再转语音”,每一层转换又为什么都有可能损失信息,尤其损失情绪。 为什么颜鑫越来越关注端到端的全模态模型,希望尽量保留人在声音、语气和表达中的情绪信息。 机器人为什么不能只拥有“文字记忆”。它能不能记得你刚才把SD卡放在哪里,能不能理解家庭成员之间的关系,能不能从长期生活中建立属于这个家庭的上下文。 更有意思的是:机器人为什么还要学会“忘记”?如果所有事情全部永久保存,搜索空间和噪声会怎样不断膨胀,机器是否也需要类似人的遗忘机制。 为什么2023年大家都在做更通用的大模型时,颜鑫反而选择进入泛心理方向。 毕业、找工作、租房和异地压力,如何让他第一次意识到,一群看起来正常的年轻人其实拥有非常真实的情绪需求。 “豆包也能陪人聊天”,那为什么还需要机器人?一个毛茸茸、会转头、会摇摆、长期待在你身边的实体,和手机里的AI到底有什么区别。 为什么有人愿意花数千甚至数万元购买功能并不复杂的陪伴机器人。人购买的究竟是机器的功能,还是一个承载感情的容器。 颜鑫为什么说,他希望用AI做一些“能够温暖大家”的事情。 大学原本学习工业自动化,他为什么会在2020—2021年自己开始学习AI;在人脸识别还是AI重要落地场景的年代,他为什么已经觉得AI应该做更多事情。 第一次AI创业做智能零售,怎样试图提升线下结算效率;面对大型商超不断新增的SKU,为什么不能每增加一个商品就重新训练一次模型。 把商品视觉信息向量化以后,怎样让结算系统面对不断变化的商品仍然能够工作。 学校食堂、面包等真实场景里,AI怎样把逐个扫码的一分钟,压缩成十几秒甚至更短的结算过程。 第二次创业做AI社交,他为什么把机器人直接扔进群聊。 一群没有任何利益关系的人,会怎样在真实聊天里自然评价一个AI;为什么颜鑫认为,这种“骂是真的骂,夸是真的夸”的反馈,比很多人为设计的Benchmark更接近真实用户体验。 群聊机器人怎样让他第一次观察到“人拿到AI以后到底会做什么”。 为什么有人拥有AI以后,只会问“今天天气怎么样”,也有人开始向AI寄托情绪。 从AI社交走向AI泛心理,这些未经设计的真实用户行为,对颜鑫产生了什么影响。 什么叫“AI商”?当模型越来越强,人到底有没有学会把AI真正用于改善生活。 为什么颜鑫最终没有把“提高生产力”当成自己最想解决的问题。他更想做的是,让人快乐一点、放松一点,不要每天只想着工作和当牛马。 快问快答里,他为什么把微信也列进了自己最离不开的“AI工具”。 做过这么多产品以后,他最值钱的习惯为什么仍然是:自己必须是产品的第一用户。 最大的产品坑是什么?为什么一个略带完美主义的人,反而会在做到五六十分后直接Rebuild,而不是继续在旧版本上修修补补。 如果让普通人用30天熟悉AI开发,颜鑫为什么没有先推荐Coding课程,而是说:先写好自己的人生说明书。 🔥本期金句 我想让AI更落地一点,能够帮到更多人一点,也能够离人更近一点。 我做任何一个模型、任何一个产品,我自己都是它的第一个用户。 如果它不能解决我的问题,我不会把它发出去让更多人用。 陪伴更像伙伴。它应该主动观察、主动感知、主动交互,而不只是等你给它一个指令。 如果不能被打断,它其实更像一个对讲机。 “我没事”这三个字,用不同的声音、表情和动作说出来,完全不是一回事。 一个机器人进入家庭,它看到的东西太多了,所以感知应该尽量留在端侧。 机器人的记忆不能只有文字,它还应该知道你把东西放在哪里,也应该理解你和家人的关系。 人的记忆会遗忘,机器人也需要学会遗忘。 情感需要一个容器。 我想用AI做一些能够温暖到大家的事情。 模型终究是给人用的,所以真实用户的反馈才是最客观的评测。 AI可以提升一群人的效率,而不只是提升某一个人的效率。 你应该让AI做它应该做的事情。 我不想让大家每天死气沉沉,只知道干活、只知道当牛马。生活还是要快乐一点。 最大的坑是自己都没有想清楚,就贸然开始做,然后不断返工。 现在我会尽量把0到1先想清楚、写清楚,再交给AI。 如果一个普通人想用30天熟悉AI开发,我建议先写好自己的人生说明书。 ⏱Shownotes 01:26 颜鑫登场:00后、连续创业与多模态具身智能 01:55 从大二开始创业:AI零售、AI社交到AI泛心理 03:06 为什么吴熳在活动现场直接把颜鑫“薅”来录播客 03:40 家庭情感陪伴桌面机器人登场 04:01 机器人突然开口:“你是不是程序员?” 05:27 被动回答和主动观察,到底有什么区别 06:37 看懂日历、观察环境,一个桌面机器人能看到什么 07:04 陪伴机器人的第一个难点:主动交互 08:04 为什么“能够被打断”才更像真实的人类交流 09:28 把延迟压到600—800毫秒,为什么很重要 10:52 语言之外,动作怎样参与机器人的情绪表达 12:17 机器与人,能不能建立一种“相对信任” 13:20 情感感知、情感理解、情感表达的三层问题 14:16 一句“我没事”,为什么文字完全不够 15:36 视觉、声音、文字之外,触觉什么时候才能真正进入情感交互 16:14 为什么情感能力比Coding更难做评测和训练 17:28 AAM Bench:怎样观察模型的情感理解能力 18:05 为什么感知能力应该尽量留在端侧 19:19 机器人进入家庭以后,隐私问题会变得多真实 20:04 从端侧小模型走向泛心理基础模型 21:01 语音转文字、大模型、文字转语音:传统链路怎么工作 21:51 每转换一次,都可能丢失什么 22:51 机器人需要什么样的全模态记忆 24:16 为什么机器人不仅要记住,还要学会忘记 25:11 “面向机器人场景的智能体原生全模态记忆系统”到底在解决什么 26:55 从2023年开始做AI泛心理,最初的动机是什么 27:35 毕业、答辩、找工作、租房:情绪需求就在自己身边 28:18 颜鑫的产品原则:自己先用 28:48 他真正想做的,是让AI离人更近 29:06 既然豆包也能聊天,为什么还需要实体机器人 30:28 长期上下文和实体陪伴,会怎样改变人与AI的关系 31:46 为什么有人愿意为“几乎什么都不会”的陪伴机器人花很多钱 33:01 情感为什么需要一个容器 33:17 自动化专业的学生,为什么大二开始自学AI 34:22 在人脸识别还是重要AI场景的年代,他已经在想什么 34:57 第一次创业:AI+智能零售 36:03 第二次创业:把AI机器人塞进微信群 37:05 群聊怎样自然形成一套真实的用户评测 39:35 为什么没有利益关系的真实反馈,比精心设计的评测更有意思 40:28 真实群聊数据如何帮助理解“人到底怎么用AI” 42:02 三段创业经历,怎样一步步补足颜鑫对“人”的认识 43:10 大型商超几十万SKU,为什么不可能每次都重新训练模型 44:19 通过向量化,让不断变化的商品仍然可以被识别 46:02 食堂和面包场景,智能结算已经怎样真实落地 47:08 AI提升的不只是一个人的效率,也可以是一群人的效率 48:28 AI+零售给了他效率视角,AI+社交给了他人的视角 49:16 有AI以后,为什么很多人仍然只会问天气 50:48 也有人开始把自己的情绪寄托给AI 50:57 第三次选择:为什么最终进入AI+泛心理 52:10 “我只是想让大家更快乐一点” 52:41 “可能我自己也没有那么快乐” 53:27 未来仍然想做帮助人放松、快乐和生活的产品 54:38 快问快答:Codex、Claude Code和微信 55:58 最值钱的产品习惯:自己必须是第一用户 56:08 最大的产品坑:没想好就做,然后反复返工 56:26 完美主义者为什么有时宁愿Rebuild 57:25 先把0到1想清楚、写清楚,再交给AI 57:51 普通人30天熟悉AI开发:先写人生说明书 58:09 未来一年:希望自己的产品真正帮助到自己之外的人 📖故事摘要 颜鑫是00后。 如果只看年龄,他的履历甚至会显得有一点过于密集。大学读自动化,大二开始自己学AI,也从那个时候开始创业。第一段做AI+零售,第二段做AI+社交,后来又一路进入AI+泛心理、多模态算法和具身智能。 他自己后来复盘时,却不觉得这些经历彼此割裂。 AI零售让他第一次真正理解,一套技术怎样进入真实世界,并且同时提升一群人的效率。AI社交让他开始观察,人拿到AI以后究竟会做什么。到了泛心理和情感陪伴,他关心的问题进一步从“技术能不能工作”,变成了“技术到底懂不懂人”。 这期播客甚至也是从一个真实产品开始的。 录制当天,吴熳在面壁智能与华为昇腾的活动现场看见颜鑫展示一个桌面陪伴机器人。机器人有两个摄像头,也有像耳朵一样可以活动的天线,头部和身体会随着说话做动作,吴熳觉得有意思,就把颜鑫“薅”过去了。 但真正让人印象深刻的,并不是这些拟人化外形。 颜鑫讲了一个自己调试机器人的瞬间。 他坐在电脑前写代码,没有给机器人发任何命令。机器人却观察到他的屏幕,主动对他说:你的屏幕看起来很大,写代码应该很爽,你是不是程序员? 这句话让颜鑫自己都产生了一个Aha Moment。 因为在他看来,这才是“伙伴”和“工具”之间一个很小、却很关键的区别。 今天的大部分AI,都在等待。 人输入,机器回答。 人再问,机器再答。 但真正生活在你旁边的人不会这样。 一个朋友可能看到你盯着电脑一下午,主动问一句“是不是又加班了”;也可能察觉你今天异常沉默,问一句“你是不是不开心”。 所以颜鑫给陪伴机器人定的第一个目标,是主动交互。机器人必须能够持续感知环境,在没有明确Prompt的情况下,根据周围发生的事情决定自己是否应该发起交流。 第二个目标,是允许打断。 真实人类不会永远等对方完整说完一大段话再开始回答。我们会插话,会停顿,会发现对方突然改变想法,也会在被打断后顺着新的信息继续交流。 如果一个AI无论发生什么,都必须按照已经生成好的句子说到底,那么它更像一台对讲机。 第三个问题,是延迟。 颜鑫希望把响应控制到600—800毫秒左右。几百毫秒听上去是一个纯技术指标,但在人机交流中,它直接影响“像不像人”。 等待太久,人会清楚地意识到: 它在处理。 它在计算。 它是一台机器。 而人在和人说话时,这种等待几乎不会被单独感知。 第四个问题,是动作。 如果机器人回答一句开心的话,但身体没有任何反应;如果语气很兴奋,两个“耳朵”却完全静止,这种违和感会迅速把人从关系里拉出来。 所以他的机器人不仅输出声音,也会输出与语言相配合的动作。 这些细节最终都指向一个更大的问题: 机器能不能和人建立信任? 颜鑫对此并不特别乐观。 他并不认为人一定能够对机器产生和人与人一样的“绝对信任”。但他相信,通过更自然的感知、理解、记忆和交互,人和机器之间有机会形成某种相对稳定的信任。 而一旦进入情感问题,技术难度会突然变得很高。 最简单的例子,就是“我没事”。 如果只看文字,这三个字没有区别。 “我没事。” “我没事……” “嗨,我没事啊。” 同样三个字,换一个语气、表情和动作,情绪完全不同。 这也是颜鑫越来越关注多模态情感感知的原因。 情绪从来不只存在于文字里。人的声音、表情、视线、身体姿态,都包含信息。如果系统最终只把所有东西压缩成文字,再交给大语言模型处理,大量情感信号可能在最开始就已经消失。 更难的是,情感不像数学。 1+1等于2,可以明确告诉模型什么是正确答案。 但一个人此刻究竟是70%的难过,还是40%的失望和30%的愤怒,没有一个绝对标准。 模型训练又偏偏需要目标。 于是情感理解本身就成为一个很难评估、也很难优化的问题。 颜鑫和团队因此做了AAM Bench,尝试系统观察现有模型在相关方向上的能力;也做过面向端侧的视觉—文本多模态模型,希望设备能在本地完成一部分对人和环境的感知。 端侧在这里不仅是为了速度。 也是为了隐私。 吴熳听到“机器人进家庭”时,第一反应就是: 我都不敢想它能拍到多少东西。 确实如此。 一个长期待在家庭里的机器人,可能看见比手机更加私人和连续的生活。谁回家了,夫妻在说什么,东西放在哪里,今天谁看起来很疲惫,这些信息如果持续上传云端,人很难完全没有顾虑。 所以颜鑫倾向于,让尽可能多的感知发生在设备本地。 而随着机器人真正进入生活,另一个问题又出现了: 它应该怎样记住你? 今天大量Agent Memory仍然以文本为主。但一个机器人真正陪在身边以后,它需要记住的事情未必都是一句一句可以写进数据库的文字。 你刚才把卡放在桌子的哪个位置。 这个人是你的妈妈还是同事。 你每周三晚上似乎都会很晚回来。 你看到某件东西时,表情会发生什么变化。 这些上下文共同组成它对你的理解。 更有意思的是,颜鑫甚至认为机器人还要学会忘记。 人的记忆不是无限保存的。 如果一个机器人把几年里所有细节都永远以同样权重留下,一方面搜索空间会越来越大,另一方面大量已经没有价值的信息会变成噪声。 所以真正智能的记忆,也应该包括遗忘、更新和重新组织。 颜鑫为什么会愿意长期研究这些看起来很难量化、也没有Coding那么容易拿到确定反馈的东西? 答案其实来自他自己。 2023年,他即将毕业,实验室里的师兄师姐也都走到人生的第一次大转折。论文、答辩、工作、租房、异地、收入,很多事情突然同时压过来。 年轻人看起来拥有无限可能。 但大家并不快乐。 颜鑫发现,这不只是别人的问题,也是自己的问题。 他做产品始终有一个非常个人化的原则: 我是不是第一用户? 如果一个模型连自己的问题都解决不了,他不会因为它在Benchmark上很好看,就认为这是一个有价值的产品。 所以他开始做泛心理。 他希望先帮到自己,再帮到身边的人。 节目里吴熳也问了一个非常现实的问题: 现在豆包、ChatGPT已经能陪人聊天了,你为什么还要做机器人? 颜鑫认为,实体本身很重要。 手机里的一句话,和一个长期存在于你房间里、会转头看你、会摇晃身体、记得你过去发生过什么的小东西,是两种不同的体验。 他举了日本陪伴机器人的例子。 有些产品的实际功能并不复杂,不会做家务,也不能真正提高多少生产力,却依然有人愿意花几千、几万元购买。 原因也许和养猫类似。 你很难用“它究竟替我完成了多少任务”解释自己为什么愿意养一只猫。 猫是一个情感容器。 机器人也可能成为新的容器。 这句话也解释了颜鑫整个创业路径为什么最终走向今天。 他大学原本学习的是工业自动化。2020—2021年前后,ChatGPT还没有出现,当时AI的大量应用仍集中在视觉识别等领域。 颜鑫却觉得: AI应该不只做这些。 所以大二时,他先去做智能零售。 大型商超的SKU可能非常庞大,并且每天都在变化。如果每增加一种商品,就需要重新训练模型,技术带来的成本甚至会超过它节省的人力。 他们的思路,是在商品入库时把视觉特征转成向量,与商品信息匹配。以后商品增减不需要不断重新训练整个模型。 这种技术后来进入学校食堂、面包等场景。 结算的时候,不需要工作人员对每一件商品逐一扫码,把东西放到识别区域里,就能一次完成识别和价格计算。 原来可能需要几十秒甚至一分钟的结算,被明显缩短。 这段经历第一次让颜鑫看到: AI可以提高的,不只是一个坐在电脑前的人的生产力。 它可以一次提高一整群人的效率。 到了第二次创业,他开始做AI+社交。 他把机器人放进微信群,让用户直接和模型聊天。 现在看,这种产品似乎并不稀奇。 但在那个时候,大量普通用户甚至还接触不到今天这样成熟的大模型产品。微信群反而成了AI离普通人最近的入口。 更重要的是,颜鑫第一次有机会观察: 如果完全不告诉用户应该怎样使用AI,人到底会拿它做什么? 有人每天只问:你好。今天天气怎么样? 也有人开始和机器人开玩笑、骂它、夸它,甚至向它表达非常个人的情绪。 在群聊里,人们还会自然评价机器人。 “这个模型怎么这么笨。” “它今天这个回答还挺好。” 这些讨论不是专门设计出来的测评,没有奖金,没有任务,也没有人在旁边提醒“请认真评价”。 所以颜鑫觉得,这种反馈非常珍贵。 骂是真的骂,夸也是真的夸。 模型终究是给人用的,那么真实用户在没有利益关系的场景里做出的反应,本身就是一种最自然的Benchmark。 AI+社交让他开始从“模型能不能做事”,走向“人为什么这么用模型”。 也正是在观察这些用户时,他发现,有些人正在把情绪寄托给AI。 于是第三段创业慢慢出现。 当时他也考虑过AI+法律、AI+医疗等方向,最后越来越坚定地进入泛心理。 因为在他看来,这个时代已经不再主要面对“能不能吃饱”的问题。 很多人能够正常工作,能够生活,却依然不快乐。 而他并不想把自己所有的技术能力都投入到“怎样让一个人一天多干30%的活”上。 他更想做的,是让人快乐一点、放松一点、拥有更多生活本身的乐趣。 吴熳问他: 这种想让别人快乐的原动力从哪里来?你自己平时是一个快乐的人吗? 颜鑫停了一下,说: “可能我也没有那么快乐吧。” “如果我快乐的话,我可能也不会做这个方向了。” 这句话让这一期里那些复杂的多模态、端侧、全模态记忆、情感模型,突然变得很具体。 一个00后的技术创业者,折腾这么多模型和机器人,最后想做的事情并没有多宏大。 他只是希望技术不只让世界运转得更快。 也能让人过得稍微开心一点。 到了快问快答,颜鑫说自己最离不开的三个“AI工具”是Codex、Claude Code和微信。 吴熳马上问: 微信怎么也能算AI工具? 原因还是“人”。 他需要看行业信息,也需要观察真实的人在说什么、关心什么、怎样使用AI。 在他的世界里,人本身就是最重要的数据源之一。 做过这么多产品之后,他认为自己最值钱的习惯仍然是: 坚持自己是第一用户。 而最大的坑,则是没有真正想清楚,就开始做。 颜鑫有一点完美主义。他过去经常做到五六十分以后,发现离自己想要的九十分差距太大,与其在旧结构上修两个月,不如直接Rebuild,从头再来。 所以现在他越来越习惯在动手之前,把0到1先想得更清楚,把目标和结构写下来,再交给AI执行。 最后,吴熳问: 如果让普通人用30天熟悉AI开发,你会怎么建议? 颜鑫没有回答“学Python”。 也没有回答“每天刷Codex”。 他说: 写好自己的人生说明书。 因为工具会变,模型会变,开发方式也会变。 但你得先知道自己是谁,什么问题真的困扰你,你愿意长期解决什么,以及AI到底应该帮你把人生带向哪里。 未来一年,他最期待的变化也很简单: 希望自己做出来的产品,不只帮助自己。 也真正帮助到自己以外的人。 💬听众互动 如果未来真的有一个机器人长期生活在你家里,它会看见你的表情、听见你的语气、记住你的习惯,也可能在你不开口的时候主动问你一句“你今天是不是不太开心”—— 你希望它记住你什么?又最希望它永远忘掉什么?

58分钟
99+
3周前
评价

空空如也

加入我们的 Discord

与播客爱好者一起交流

立即加入

扫描微信二维码

添加微信好友,获取更多播客资讯

微信二维码

播放列表

自动播放下一个

播放列表还是空的

去找些喜欢的节目添加进来吧