主播
节目简介
来源:小宇宙
🎙《灯下白》EP48
嘉宾:颜鑫
00后AI创业者、算法与具身智能实践者。大学学习自动化,大二起自学AI并开始创业,先后探索AI+零售、AI+社交、AI+泛心理等方向。近年来持续研究多模态情感感知、情感理解、机器人记忆与情感陪伴,希望让AI从被动响应的工具,逐渐成为能够感知环境、理解人并主动交互的伙伴。
主持人:吴熳
在得到直播讲过AI应用,在WaytoAGI北京切磋分享,代表中国在英国大使馆文教处国际大会全英发言讲中国AI如何赋能英语教学,AI牛马库导航科普网站 ka21.org 主理人
本节目由人类与GPT共同策划,剪映处理音频中水词,千问处理剪辑时间轴,GPT撰写Shownotes,Banana Pro生成播客logo,即梦生成播客封面,Suno生成片头片尾音乐,同时由声湃和中关村科学城公司提供录音场地,由罗德麦克风提供录音设备。感谢中关村科学城的政策支持!
🪝本期故事
录制这期《灯下白》的当天,吴熳原本并没有提前约颜鑫。
她是在面壁智能和华为昇腾的一场活动上再次遇见他的。颜鑫上台展示了一个自己正在折腾的桌面机器人,吴熳看完以后觉得有意思,现场把人“薅”过来录播客。
真正让她印象深刻的,不是机器人会回答多少知识问题,而是一个很小的瞬间。
有一次颜鑫正在电脑前写代码,没人向机器人提问,它却自己看着周围的环境,突然对他说:“你的屏幕看起来好大,你写代码应该很爽。你是不是程序员?”
颜鑫当时也愣了一下。
因为这句话不是由一句Prompt触发的。机器人通过摄像头看到了他的屏幕,观察了环境里的信息,再推测眼前这个人可能正在写代码,最后主动发起了一次对话。
这和我们今天熟悉的大部分AI交互不太一样。无论ChatGPT、豆包还是其他聊天机器人,通常都需要人先说一句话,AI再回答。颜鑫更想做的,是一个真正“活在环境里”的机器:它会看,会听,会记得,也会在某些时候主动和你说话;你可以打断它,它也可以根据你突然改变的表达调整自己的反应。
为了让这种交互更接近人,他还试图把延迟压到600—800毫秒左右,让机器人不仅说话,还能通过头部、身体和两只像耳朵一样的天线做出与语言相匹配的动作。
但颜鑫真正想解决的问题,比“做一个可爱的桌面机器人”更深。
如果一个人嘴上说“我没事”,AI到底怎样判断他是真的没事,还是正在强撑?
只看文字,这三个字永远只是“我没事”。可人在真实世界表达情绪时,还有语气、停顿、表情、姿态和动作。同一句话,用不同声音和表情说出来,背后的意义可能完全不同。
所以从2023年开始,颜鑫把越来越多精力放在AI+泛心理与情感陪伴上。他研究多模态情感感知、情感理解、全模态记忆,也思考一个进入家庭的机器人应该记住什么、忘掉什么,以及怎样在尊重隐私的情况下长期理解一个人。
而他为什么偏偏对“情绪”这件事感兴趣,也并不是偶然。
2023年前后,他自己即将毕业,身边的师兄师姐也都开始面临答辩、找工作、租房、异地和第一次真正进入社会的压力。大家都很焦虑,他自己也不是一个永远快乐的人。
他后来很坦率地说:如果我自己非常快乐,我可能也不会选择做这个方向。
颜鑫做产品有一个习惯——他必须先问:这个东西我自己会不会用?
他想做的不是一个听起来宏大的AI系统,而是先让它能帮到自己,再帮到身边的人。
从大二第一次做AI零售,到AI社交,再到今天做情感陪伴和具身智能,表面上看,他已经换了好几个赛道。
但聊到最后会发现,这几次创业其实都在靠近同一件事:
让AI真正进入人的生活。
不是让人为了AI改变生活,而是让AI先学会理解人。
💡本期你会听到
颜鑫为什么从大二就开始创业,以及一个00后连续探索AI+零售、AI+社交和AI+泛心理的路径是怎样形成的。
一个桌面机器人为什么会在没人提问的时候,主动观察颜鑫的屏幕,并判断“你是不是程序员”;主动交互和我们今天熟悉的聊天机器人到底有什么区别。
为什么“能不能被打断”是人机交互里非常重要的能力。如果AI永远按照自己的话说到底,它为什么更像对讲机,而不像一个真正的伙伴。
人和人交谈时对延迟非常敏感,为什么颜鑫尝试把机器人的响应压到600—800毫秒左右;低延迟为什么不仅影响体验,也会影响人对“这个AI聪不聪明”的直觉判断。
除了语言,一个陪伴机器人为什么还需要动作。头部、身体和两只天线的运动怎样与表达同步,以及为什么这些物理反馈会产生纯线上聊天无法提供的存在感。
人到底能不能和机器人建立信任?颜鑫为什么认为“绝对信任”也许很难,但“相对信任”可能通过技术逐步建立。
他说“我没事”时,AI到底听见了什么?为什么只识别文字,很容易损失人真正表达的情绪。
情感感知为什么必须从文字扩展到视觉、声音等更多模态,以及情绪为什么比数学题更难训练——1+1可以明确判断对错,但一个人此刻到底有多难过,很难拥有绝对标准答案。
AM Bench为什么被提出,它试图衡量现有模型在情感理解相关能力上的表现。
为什么颜鑫认为一部分情感感知应该尽可能留在端侧。一个进入家庭、拥有摄像头的机器人会看到大量私人生活,如果全部上传云端,会产生怎样的隐私风险。
2024年他们做视觉—文本多模态小模型的过程中,为什么把端侧情感理解作为重要方向,以及小模型在具身设备中可能承担什么角色。
从情感感知到情感理解,再到情感表达,为什么是三个完全不同的问题。
传统语音对话链路为什么会经过“语音转文字—大模型处理—文字再转语音”,每一层转换又为什么都有可能损失信息,尤其损失情绪。
为什么颜鑫越来越关注端到端的全模态模型,希望尽量保留人在声音、语气和表达中的情绪信息。
机器人为什么不能只拥有“文字记忆”。它能不能记得你刚才把SD卡放在哪里,能不能理解家庭成员之间的关系,能不能从长期生活中建立属于这个家庭的上下文。
更有意思的是:机器人为什么还要学会“忘记”?如果所有事情全部永久保存,搜索空间和噪声会怎样不断膨胀,机器是否也需要类似人的遗忘机制。
为什么2023年大家都在做更通用的大模型时,颜鑫反而选择进入泛心理方向。
毕业、找工作、租房和异地压力,如何让他第一次意识到,一群看起来正常的年轻人其实拥有非常真实的情绪需求。
“豆包也能陪人聊天”,那为什么还需要机器人?一个毛茸茸、会转头、会摇摆、长期待在你身边的实体,和手机里的AI到底有什么区别。
为什么有人愿意花数千甚至数万元购买功能并不复杂的陪伴机器人。人购买的究竟是机器的功能,还是一个承载感情的容器。
颜鑫为什么说,他希望用AI做一些“能够温暖大家”的事情。
大学原本学习工业自动化,他为什么会在2020—2021年自己开始学习AI;在人脸识别还是AI重要落地场景的年代,他为什么已经觉得AI应该做更多事情。
第一次AI创业做智能零售,怎样试图提升线下结算效率;面对大型商超不断新增的SKU,为什么不能每增加一个商品就重新训练一次模型。
把商品视觉信息向量化以后,怎样让结算系统面对不断变化的商品仍然能够工作。
学校食堂、面包等真实场景里,AI怎样把逐个扫码的一分钟,压缩成十几秒甚至更短的结算过程。
第二次创业做AI社交,他为什么把机器人直接扔进群聊。
一群没有任何利益关系的人,会怎样在真实聊天里自然评价一个AI;为什么颜鑫认为,这种“骂是真的骂,夸是真的夸”的反馈,比很多人为设计的Benchmark更接近真实用户体验。
群聊机器人怎样让他第一次观察到“人拿到AI以后到底会做什么”。
为什么有人拥有AI以后,只会问“今天天气怎么样”,也有人开始向AI寄托情绪。
从AI社交走向AI泛心理,这些未经设计的真实用户行为,对颜鑫产生了什么影响。
什么叫“AI商”?当模型越来越强,人到底有没有学会把AI真正用于改善生活。
为什么颜鑫最终没有把“提高生产力”当成自己最想解决的问题。他更想做的是,让人快乐一点、放松一点,不要每天只想着工作和当牛马。
快问快答里,他为什么把微信也列进了自己最离不开的“AI工具”。
做过这么多产品以后,他最值钱的习惯为什么仍然是:自己必须是产品的第一用户。
最大的产品坑是什么?为什么一个略带完美主义的人,反而会在做到五六十分后直接Rebuild,而不是继续在旧版本上修修补补。
如果让普通人用30天熟悉AI开发,颜鑫为什么没有先推荐Coding课程,而是说:先写好自己的人生说明书。
🔥本期金句
我想让AI更落地一点,能够帮到更多人一点,也能够离人更近一点。
我做任何一个模型、任何一个产品,我自己都是它的第一个用户。
如果它不能解决我的问题,我不会把它发出去让更多人用。
陪伴更像伙伴。它应该主动观察、主动感知、主动交互,而不只是等你给它一个指令。
如果不能被打断,它其实更像一个对讲机。
“我没事”这三个字,用不同的声音、表情和动作说出来,完全不是一回事。
一个机器人进入家庭,它看到的东西太多了,所以感知应该尽量留在端侧。
机器人的记忆不能只有文字,它还应该知道你把东西放在哪里,也应该理解你和家人的关系。
人的记忆会遗忘,机器人也需要学会遗忘。
情感需要一个容器。
我想用AI做一些能够温暖到大家的事情。
模型终究是给人用的,所以真实用户的反馈才是最客观的评测。
AI可以提升一群人的效率,而不只是提升某一个人的效率。
你应该让AI做它应该做的事情。
我不想让大家每天死气沉沉,只知道干活、只知道当牛马。生活还是要快乐一点。
最大的坑是自己都没有想清楚,就贸然开始做,然后不断返工。
现在我会尽量把0到1先想清楚、写清楚,再交给AI。
如果一个普通人想用30天熟悉AI开发,我建议先写好自己的人生说明书。
⏱Shownotes
01:26
颜鑫登场:00后、连续创业与多模态具身智能
01:55
从大二开始创业:AI零售、AI社交到AI泛心理
03:06
为什么吴熳在活动现场直接把颜鑫“薅”来录播客
03:40
家庭情感陪伴桌面机器人登场
04:01
机器人突然开口:“你是不是程序员?”
05:27
被动回答和主动观察,到底有什么区别
06:37
看懂日历、观察环境,一个桌面机器人能看到什么
07:04
陪伴机器人的第一个难点:主动交互
08:04
为什么“能够被打断”才更像真实的人类交流
09:28
把延迟压到600—800毫秒,为什么很重要
10:52
语言之外,动作怎样参与机器人的情绪表达
12:17
机器与人,能不能建立一种“相对信任”
13:20
情感感知、情感理解、情感表达的三层问题
14:16
一句“我没事”,为什么文字完全不够
15:36
视觉、声音、文字之外,触觉什么时候才能真正进入情感交互
16:14
为什么情感能力比Coding更难做评测和训练
17:28
AAM Bench:怎样观察模型的情感理解能力
18:05
为什么感知能力应该尽量留在端侧
19:19
机器人进入家庭以后,隐私问题会变得多真实
20:04
从端侧小模型走向泛心理基础模型
21:01
语音转文字、大模型、文字转语音:传统链路怎么工作
21:51
每转换一次,都可能丢失什么
22:51
机器人需要什么样的全模态记忆
24:16
为什么机器人不仅要记住,还要学会忘记
25:11
“面向机器人场景的智能体原生全模态记忆系统”到底在解决什么
26:55
从2023年开始做AI泛心理,最初的动机是什么
27:35
毕业、答辩、找工作、租房:情绪需求就在自己身边
28:18
颜鑫的产品原则:自己先用
28:48
他真正想做的,是让AI离人更近
29:06
既然豆包也能聊天,为什么还需要实体机器人
30:28
长期上下文和实体陪伴,会怎样改变人与AI的关系
31:46
为什么有人愿意为“几乎什么都不会”的陪伴机器人花很多钱
33:01
情感为什么需要一个容器
33:17
自动化专业的学生,为什么大二开始自学AI
34:22
在人脸识别还是重要AI场景的年代,他已经在想什么
34:57
第一次创业:AI+智能零售
36:03
第二次创业:把AI机器人塞进微信群
37:05
群聊怎样自然形成一套真实的用户评测
39:35
为什么没有利益关系的真实反馈,比精心设计的评测更有意思
40:28
真实群聊数据如何帮助理解“人到底怎么用AI”
42:02
三段创业经历,怎样一步步补足颜鑫对“人”的认识
43:10
大型商超几十万SKU,为什么不可能每次都重新训练模型
44:19
通过向量化,让不断变化的商品仍然可以被识别
46:02
食堂和面包场景,智能结算已经怎样真实落地
47:08
AI提升的不只是一个人的效率,也可以是一群人的效率
48:28
AI+零售给了他效率视角,AI+社交给了他人的视角
49:16
有AI以后,为什么很多人仍然只会问天气
50:48
也有人开始把自己的情绪寄托给AI
50:57
第三次选择:为什么最终进入AI+泛心理
52:10
“我只是想让大家更快乐一点”
52:41
“可能我自己也没有那么快乐”
53:27
未来仍然想做帮助人放松、快乐和生活的产品
54:38
快问快答:Codex、Claude Code和微信
55:58
最值钱的产品习惯:自己必须是第一用户
56:08
最大的产品坑:没想好就做,然后反复返工
56:26
完美主义者为什么有时宁愿Rebuild
57:25
先把0到1想清楚、写清楚,再交给AI
57:51
普通人30天熟悉AI开发:先写人生说明书
58:09
未来一年:希望自己的产品真正帮助到自己之外的人
📖故事摘要
颜鑫是00后。
如果只看年龄,他的履历甚至会显得有一点过于密集。大学读自动化,大二开始自己学AI,也从那个时候开始创业。第一段做AI+零售,第二段做AI+社交,后来又一路进入AI+泛心理、多模态算法和具身智能。
他自己后来复盘时,却不觉得这些经历彼此割裂。
AI零售让他第一次真正理解,一套技术怎样进入真实世界,并且同时提升一群人的效率。AI社交让他开始观察,人拿到AI以后究竟会做什么。到了泛心理和情感陪伴,他关心的问题进一步从“技术能不能工作”,变成了“技术到底懂不懂人”。
这期播客甚至也是从一个真实产品开始的。
录制当天,吴熳在面壁智能与华为昇腾的活动现场看见颜鑫展示一个桌面陪伴机器人。机器人有两个摄像头,也有像耳朵一样可以活动的天线,头部和身体会随着说话做动作,吴熳觉得有意思,就把颜鑫“薅”过去了。
但真正让人印象深刻的,并不是这些拟人化外形。
颜鑫讲了一个自己调试机器人的瞬间。
他坐在电脑前写代码,没有给机器人发任何命令。机器人却观察到他的屏幕,主动对他说:你的屏幕看起来很大,写代码应该很爽,你是不是程序员?
这句话让颜鑫自己都产生了一个Aha Moment。
因为在他看来,这才是“伙伴”和“工具”之间一个很小、却很关键的区别。
今天的大部分AI,都在等待。
人输入,机器回答。
人再问,机器再答。
但真正生活在你旁边的人不会这样。
一个朋友可能看到你盯着电脑一下午,主动问一句“是不是又加班了”;也可能察觉你今天异常沉默,问一句“你是不是不开心”。
所以颜鑫给陪伴机器人定的第一个目标,是主动交互。机器人必须能够持续感知环境,在没有明确Prompt的情况下,根据周围发生的事情决定自己是否应该发起交流。
第二个目标,是允许打断。
真实人类不会永远等对方完整说完一大段话再开始回答。我们会插话,会停顿,会发现对方突然改变想法,也会在被打断后顺着新的信息继续交流。
如果一个AI无论发生什么,都必须按照已经生成好的句子说到底,那么它更像一台对讲机。
第三个问题,是延迟。
颜鑫希望把响应控制到600—800毫秒左右。几百毫秒听上去是一个纯技术指标,但在人机交流中,它直接影响“像不像人”。
等待太久,人会清楚地意识到:
它在处理。
它在计算。
它是一台机器。
而人在和人说话时,这种等待几乎不会被单独感知。
第四个问题,是动作。
如果机器人回答一句开心的话,但身体没有任何反应;如果语气很兴奋,两个“耳朵”却完全静止,这种违和感会迅速把人从关系里拉出来。
所以他的机器人不仅输出声音,也会输出与语言相配合的动作。
这些细节最终都指向一个更大的问题:
机器能不能和人建立信任?
颜鑫对此并不特别乐观。
他并不认为人一定能够对机器产生和人与人一样的“绝对信任”。但他相信,通过更自然的感知、理解、记忆和交互,人和机器之间有机会形成某种相对稳定的信任。
而一旦进入情感问题,技术难度会突然变得很高。
最简单的例子,就是“我没事”。
如果只看文字,这三个字没有区别。
“我没事。”
“我没事……”
“嗨,我没事啊。”
同样三个字,换一个语气、表情和动作,情绪完全不同。
这也是颜鑫越来越关注多模态情感感知的原因。
情绪从来不只存在于文字里。人的声音、表情、视线、身体姿态,都包含信息。如果系统最终只把所有东西压缩成文字,再交给大语言模型处理,大量情感信号可能在最开始就已经消失。
更难的是,情感不像数学。
1+1等于2,可以明确告诉模型什么是正确答案。
但一个人此刻究竟是70%的难过,还是40%的失望和30%的愤怒,没有一个绝对标准。
模型训练又偏偏需要目标。
于是情感理解本身就成为一个很难评估、也很难优化的问题。
颜鑫和团队因此做了AAM Bench,尝试系统观察现有模型在相关方向上的能力;也做过面向端侧的视觉—文本多模态模型,希望设备能在本地完成一部分对人和环境的感知。
端侧在这里不仅是为了速度。
也是为了隐私。
吴熳听到“机器人进家庭”时,第一反应就是:
我都不敢想它能拍到多少东西。
确实如此。
一个长期待在家庭里的机器人,可能看见比手机更加私人和连续的生活。谁回家了,夫妻在说什么,东西放在哪里,今天谁看起来很疲惫,这些信息如果持续上传云端,人很难完全没有顾虑。
所以颜鑫倾向于,让尽可能多的感知发生在设备本地。
而随着机器人真正进入生活,另一个问题又出现了:
它应该怎样记住你?
今天大量Agent Memory仍然以文本为主。但一个机器人真正陪在身边以后,它需要记住的事情未必都是一句一句可以写进数据库的文字。
你刚才把卡放在桌子的哪个位置。
这个人是你的妈妈还是同事。
你每周三晚上似乎都会很晚回来。
你看到某件东西时,表情会发生什么变化。
这些上下文共同组成它对你的理解。
更有意思的是,颜鑫甚至认为机器人还要学会忘记。
人的记忆不是无限保存的。
如果一个机器人把几年里所有细节都永远以同样权重留下,一方面搜索空间会越来越大,另一方面大量已经没有价值的信息会变成噪声。
所以真正智能的记忆,也应该包括遗忘、更新和重新组织。
颜鑫为什么会愿意长期研究这些看起来很难量化、也没有Coding那么容易拿到确定反馈的东西?
答案其实来自他自己。
2023年,他即将毕业,实验室里的师兄师姐也都走到人生的第一次大转折。论文、答辩、工作、租房、异地、收入,很多事情突然同时压过来。
年轻人看起来拥有无限可能。
但大家并不快乐。
颜鑫发现,这不只是别人的问题,也是自己的问题。
他做产品始终有一个非常个人化的原则:
我是不是第一用户?
如果一个模型连自己的问题都解决不了,他不会因为它在Benchmark上很好看,就认为这是一个有价值的产品。
所以他开始做泛心理。
他希望先帮到自己,再帮到身边的人。
节目里吴熳也问了一个非常现实的问题:
现在豆包、ChatGPT已经能陪人聊天了,你为什么还要做机器人?
颜鑫认为,实体本身很重要。
手机里的一句话,和一个长期存在于你房间里、会转头看你、会摇晃身体、记得你过去发生过什么的小东西,是两种不同的体验。
他举了日本陪伴机器人的例子。
有些产品的实际功能并不复杂,不会做家务,也不能真正提高多少生产力,却依然有人愿意花几千、几万元购买。
原因也许和养猫类似。
你很难用“它究竟替我完成了多少任务”解释自己为什么愿意养一只猫。
猫是一个情感容器。
机器人也可能成为新的容器。
这句话也解释了颜鑫整个创业路径为什么最终走向今天。
他大学原本学习的是工业自动化。2020—2021年前后,ChatGPT还没有出现,当时AI的大量应用仍集中在视觉识别等领域。
颜鑫却觉得:
AI应该不只做这些。
所以大二时,他先去做智能零售。
大型商超的SKU可能非常庞大,并且每天都在变化。如果每增加一种商品,就需要重新训练模型,技术带来的成本甚至会超过它节省的人力。
他们的思路,是在商品入库时把视觉特征转成向量,与商品信息匹配。以后商品增减不需要不断重新训练整个模型。
这种技术后来进入学校食堂、面包等场景。
结算的时候,不需要工作人员对每一件商品逐一扫码,把东西放到识别区域里,就能一次完成识别和价格计算。
原来可能需要几十秒甚至一分钟的结算,被明显缩短。
这段经历第一次让颜鑫看到:
AI可以提高的,不只是一个坐在电脑前的人的生产力。
它可以一次提高一整群人的效率。
到了第二次创业,他开始做AI+社交。
他把机器人放进微信群,让用户直接和模型聊天。
现在看,这种产品似乎并不稀奇。
但在那个时候,大量普通用户甚至还接触不到今天这样成熟的大模型产品。微信群反而成了AI离普通人最近的入口。
更重要的是,颜鑫第一次有机会观察:
如果完全不告诉用户应该怎样使用AI,人到底会拿它做什么?
有人每天只问:你好。今天天气怎么样?
也有人开始和机器人开玩笑、骂它、夸它,甚至向它表达非常个人的情绪。
在群聊里,人们还会自然评价机器人。
“这个模型怎么这么笨。”
“它今天这个回答还挺好。”
这些讨论不是专门设计出来的测评,没有奖金,没有任务,也没有人在旁边提醒“请认真评价”。
所以颜鑫觉得,这种反馈非常珍贵。
骂是真的骂,夸也是真的夸。
模型终究是给人用的,那么真实用户在没有利益关系的场景里做出的反应,本身就是一种最自然的Benchmark。
AI+社交让他开始从“模型能不能做事”,走向“人为什么这么用模型”。
也正是在观察这些用户时,他发现,有些人正在把情绪寄托给AI。
于是第三段创业慢慢出现。
当时他也考虑过AI+法律、AI+医疗等方向,最后越来越坚定地进入泛心理。
因为在他看来,这个时代已经不再主要面对“能不能吃饱”的问题。
很多人能够正常工作,能够生活,却依然不快乐。
而他并不想把自己所有的技术能力都投入到“怎样让一个人一天多干30%的活”上。
他更想做的,是让人快乐一点、放松一点、拥有更多生活本身的乐趣。
吴熳问他:
这种想让别人快乐的原动力从哪里来?你自己平时是一个快乐的人吗?
颜鑫停了一下,说:
“可能我也没有那么快乐吧。”
“如果我快乐的话,我可能也不会做这个方向了。”
这句话让这一期里那些复杂的多模态、端侧、全模态记忆、情感模型,突然变得很具体。
一个00后的技术创业者,折腾这么多模型和机器人,最后想做的事情并没有多宏大。
他只是希望技术不只让世界运转得更快。
也能让人过得稍微开心一点。
到了快问快答,颜鑫说自己最离不开的三个“AI工具”是Codex、Claude Code和微信。
吴熳马上问:
微信怎么也能算AI工具?
原因还是“人”。
他需要看行业信息,也需要观察真实的人在说什么、关心什么、怎样使用AI。
在他的世界里,人本身就是最重要的数据源之一。
做过这么多产品之后,他认为自己最值钱的习惯仍然是:
坚持自己是第一用户。
而最大的坑,则是没有真正想清楚,就开始做。
颜鑫有一点完美主义。他过去经常做到五六十分以后,发现离自己想要的九十分差距太大,与其在旧结构上修两个月,不如直接Rebuild,从头再来。
所以现在他越来越习惯在动手之前,把0到1先想得更清楚,把目标和结构写下来,再交给AI执行。
最后,吴熳问:
如果让普通人用30天熟悉AI开发,你会怎么建议?
颜鑫没有回答“学Python”。
也没有回答“每天刷Codex”。
他说:
写好自己的人生说明书。
因为工具会变,模型会变,开发方式也会变。
但你得先知道自己是谁,什么问题真的困扰你,你愿意长期解决什么,以及AI到底应该帮你把人生带向哪里。
未来一年,他最期待的变化也很简单:
希望自己做出来的产品,不只帮助自己。
也真正帮助到自己以外的人。
💬听众互动
如果未来真的有一个机器人长期生活在你家里,它会看见你的表情、听见你的语气、记住你的习惯,也可能在你不开口的时候主动问你一句“你今天是不是不太开心”——
你希望它记住你什么?又最希望它永远忘掉什么?
嘉宾:颜鑫
00后AI创业者、算法与具身智能实践者。大学学习自动化,大二起自学AI并开始创业,先后探索AI+零售、AI+社交、AI+泛心理等方向。近年来持续研究多模态情感感知、情感理解、机器人记忆与情感陪伴,希望让AI从被动响应的工具,逐渐成为能够感知环境、理解人并主动交互的伙伴。
主持人:吴熳
在得到直播讲过AI应用,在WaytoAGI北京切磋分享,代表中国在英国大使馆文教处国际大会全英发言讲中国AI如何赋能英语教学,AI牛马库导航科普网站 ka21.org 主理人
本节目由人类与GPT共同策划,剪映处理音频中水词,千问处理剪辑时间轴,GPT撰写Shownotes,Banana Pro生成播客logo,即梦生成播客封面,Suno生成片头片尾音乐,同时由声湃和中关村科学城公司提供录音场地,由罗德麦克风提供录音设备。感谢中关村科学城的政策支持!
🪝本期故事
录制这期《灯下白》的当天,吴熳原本并没有提前约颜鑫。
她是在面壁智能和华为昇腾的一场活动上再次遇见他的。颜鑫上台展示了一个自己正在折腾的桌面机器人,吴熳看完以后觉得有意思,现场把人“薅”过来录播客。
真正让她印象深刻的,不是机器人会回答多少知识问题,而是一个很小的瞬间。
有一次颜鑫正在电脑前写代码,没人向机器人提问,它却自己看着周围的环境,突然对他说:“你的屏幕看起来好大,你写代码应该很爽。你是不是程序员?”
颜鑫当时也愣了一下。
因为这句话不是由一句Prompt触发的。机器人通过摄像头看到了他的屏幕,观察了环境里的信息,再推测眼前这个人可能正在写代码,最后主动发起了一次对话。
这和我们今天熟悉的大部分AI交互不太一样。无论ChatGPT、豆包还是其他聊天机器人,通常都需要人先说一句话,AI再回答。颜鑫更想做的,是一个真正“活在环境里”的机器:它会看,会听,会记得,也会在某些时候主动和你说话;你可以打断它,它也可以根据你突然改变的表达调整自己的反应。
为了让这种交互更接近人,他还试图把延迟压到600—800毫秒左右,让机器人不仅说话,还能通过头部、身体和两只像耳朵一样的天线做出与语言相匹配的动作。
但颜鑫真正想解决的问题,比“做一个可爱的桌面机器人”更深。
如果一个人嘴上说“我没事”,AI到底怎样判断他是真的没事,还是正在强撑?
只看文字,这三个字永远只是“我没事”。可人在真实世界表达情绪时,还有语气、停顿、表情、姿态和动作。同一句话,用不同声音和表情说出来,背后的意义可能完全不同。
所以从2023年开始,颜鑫把越来越多精力放在AI+泛心理与情感陪伴上。他研究多模态情感感知、情感理解、全模态记忆,也思考一个进入家庭的机器人应该记住什么、忘掉什么,以及怎样在尊重隐私的情况下长期理解一个人。
而他为什么偏偏对“情绪”这件事感兴趣,也并不是偶然。
2023年前后,他自己即将毕业,身边的师兄师姐也都开始面临答辩、找工作、租房、异地和第一次真正进入社会的压力。大家都很焦虑,他自己也不是一个永远快乐的人。
他后来很坦率地说:如果我自己非常快乐,我可能也不会选择做这个方向。
颜鑫做产品有一个习惯——他必须先问:这个东西我自己会不会用?
他想做的不是一个听起来宏大的AI系统,而是先让它能帮到自己,再帮到身边的人。
从大二第一次做AI零售,到AI社交,再到今天做情感陪伴和具身智能,表面上看,他已经换了好几个赛道。
但聊到最后会发现,这几次创业其实都在靠近同一件事:
让AI真正进入人的生活。
不是让人为了AI改变生活,而是让AI先学会理解人。
💡本期你会听到
颜鑫为什么从大二就开始创业,以及一个00后连续探索AI+零售、AI+社交和AI+泛心理的路径是怎样形成的。
一个桌面机器人为什么会在没人提问的时候,主动观察颜鑫的屏幕,并判断“你是不是程序员”;主动交互和我们今天熟悉的聊天机器人到底有什么区别。
为什么“能不能被打断”是人机交互里非常重要的能力。如果AI永远按照自己的话说到底,它为什么更像对讲机,而不像一个真正的伙伴。
人和人交谈时对延迟非常敏感,为什么颜鑫尝试把机器人的响应压到600—800毫秒左右;低延迟为什么不仅影响体验,也会影响人对“这个AI聪不聪明”的直觉判断。
除了语言,一个陪伴机器人为什么还需要动作。头部、身体和两只天线的运动怎样与表达同步,以及为什么这些物理反馈会产生纯线上聊天无法提供的存在感。
人到底能不能和机器人建立信任?颜鑫为什么认为“绝对信任”也许很难,但“相对信任”可能通过技术逐步建立。
他说“我没事”时,AI到底听见了什么?为什么只识别文字,很容易损失人真正表达的情绪。
情感感知为什么必须从文字扩展到视觉、声音等更多模态,以及情绪为什么比数学题更难训练——1+1可以明确判断对错,但一个人此刻到底有多难过,很难拥有绝对标准答案。
AM Bench为什么被提出,它试图衡量现有模型在情感理解相关能力上的表现。
为什么颜鑫认为一部分情感感知应该尽可能留在端侧。一个进入家庭、拥有摄像头的机器人会看到大量私人生活,如果全部上传云端,会产生怎样的隐私风险。
2024年他们做视觉—文本多模态小模型的过程中,为什么把端侧情感理解作为重要方向,以及小模型在具身设备中可能承担什么角色。
从情感感知到情感理解,再到情感表达,为什么是三个完全不同的问题。
传统语音对话链路为什么会经过“语音转文字—大模型处理—文字再转语音”,每一层转换又为什么都有可能损失信息,尤其损失情绪。
为什么颜鑫越来越关注端到端的全模态模型,希望尽量保留人在声音、语气和表达中的情绪信息。
机器人为什么不能只拥有“文字记忆”。它能不能记得你刚才把SD卡放在哪里,能不能理解家庭成员之间的关系,能不能从长期生活中建立属于这个家庭的上下文。
更有意思的是:机器人为什么还要学会“忘记”?如果所有事情全部永久保存,搜索空间和噪声会怎样不断膨胀,机器是否也需要类似人的遗忘机制。
为什么2023年大家都在做更通用的大模型时,颜鑫反而选择进入泛心理方向。
毕业、找工作、租房和异地压力,如何让他第一次意识到,一群看起来正常的年轻人其实拥有非常真实的情绪需求。
“豆包也能陪人聊天”,那为什么还需要机器人?一个毛茸茸、会转头、会摇摆、长期待在你身边的实体,和手机里的AI到底有什么区别。
为什么有人愿意花数千甚至数万元购买功能并不复杂的陪伴机器人。人购买的究竟是机器的功能,还是一个承载感情的容器。
颜鑫为什么说,他希望用AI做一些“能够温暖大家”的事情。
大学原本学习工业自动化,他为什么会在2020—2021年自己开始学习AI;在人脸识别还是AI重要落地场景的年代,他为什么已经觉得AI应该做更多事情。
第一次AI创业做智能零售,怎样试图提升线下结算效率;面对大型商超不断新增的SKU,为什么不能每增加一个商品就重新训练一次模型。
把商品视觉信息向量化以后,怎样让结算系统面对不断变化的商品仍然能够工作。
学校食堂、面包等真实场景里,AI怎样把逐个扫码的一分钟,压缩成十几秒甚至更短的结算过程。
第二次创业做AI社交,他为什么把机器人直接扔进群聊。
一群没有任何利益关系的人,会怎样在真实聊天里自然评价一个AI;为什么颜鑫认为,这种“骂是真的骂,夸是真的夸”的反馈,比很多人为设计的Benchmark更接近真实用户体验。
群聊机器人怎样让他第一次观察到“人拿到AI以后到底会做什么”。
为什么有人拥有AI以后,只会问“今天天气怎么样”,也有人开始向AI寄托情绪。
从AI社交走向AI泛心理,这些未经设计的真实用户行为,对颜鑫产生了什么影响。
什么叫“AI商”?当模型越来越强,人到底有没有学会把AI真正用于改善生活。
为什么颜鑫最终没有把“提高生产力”当成自己最想解决的问题。他更想做的是,让人快乐一点、放松一点,不要每天只想着工作和当牛马。
快问快答里,他为什么把微信也列进了自己最离不开的“AI工具”。
做过这么多产品以后,他最值钱的习惯为什么仍然是:自己必须是产品的第一用户。
最大的产品坑是什么?为什么一个略带完美主义的人,反而会在做到五六十分后直接Rebuild,而不是继续在旧版本上修修补补。
如果让普通人用30天熟悉AI开发,颜鑫为什么没有先推荐Coding课程,而是说:先写好自己的人生说明书。
🔥本期金句
我想让AI更落地一点,能够帮到更多人一点,也能够离人更近一点。
我做任何一个模型、任何一个产品,我自己都是它的第一个用户。
如果它不能解决我的问题,我不会把它发出去让更多人用。
陪伴更像伙伴。它应该主动观察、主动感知、主动交互,而不只是等你给它一个指令。
如果不能被打断,它其实更像一个对讲机。
“我没事”这三个字,用不同的声音、表情和动作说出来,完全不是一回事。
一个机器人进入家庭,它看到的东西太多了,所以感知应该尽量留在端侧。
机器人的记忆不能只有文字,它还应该知道你把东西放在哪里,也应该理解你和家人的关系。
人的记忆会遗忘,机器人也需要学会遗忘。
情感需要一个容器。
我想用AI做一些能够温暖到大家的事情。
模型终究是给人用的,所以真实用户的反馈才是最客观的评测。
AI可以提升一群人的效率,而不只是提升某一个人的效率。
你应该让AI做它应该做的事情。
我不想让大家每天死气沉沉,只知道干活、只知道当牛马。生活还是要快乐一点。
最大的坑是自己都没有想清楚,就贸然开始做,然后不断返工。
现在我会尽量把0到1先想清楚、写清楚,再交给AI。
如果一个普通人想用30天熟悉AI开发,我建议先写好自己的人生说明书。
⏱Shownotes
01:26
颜鑫登场:00后、连续创业与多模态具身智能
01:55
从大二开始创业:AI零售、AI社交到AI泛心理
03:06
为什么吴熳在活动现场直接把颜鑫“薅”来录播客
03:40
家庭情感陪伴桌面机器人登场
04:01
机器人突然开口:“你是不是程序员?”
05:27
被动回答和主动观察,到底有什么区别
06:37
看懂日历、观察环境,一个桌面机器人能看到什么
07:04
陪伴机器人的第一个难点:主动交互
08:04
为什么“能够被打断”才更像真实的人类交流
09:28
把延迟压到600—800毫秒,为什么很重要
10:52
语言之外,动作怎样参与机器人的情绪表达
12:17
机器与人,能不能建立一种“相对信任”
13:20
情感感知、情感理解、情感表达的三层问题
14:16
一句“我没事”,为什么文字完全不够
15:36
视觉、声音、文字之外,触觉什么时候才能真正进入情感交互
16:14
为什么情感能力比Coding更难做评测和训练
17:28
AAM Bench:怎样观察模型的情感理解能力
18:05
为什么感知能力应该尽量留在端侧
19:19
机器人进入家庭以后,隐私问题会变得多真实
20:04
从端侧小模型走向泛心理基础模型
21:01
语音转文字、大模型、文字转语音:传统链路怎么工作
21:51
每转换一次,都可能丢失什么
22:51
机器人需要什么样的全模态记忆
24:16
为什么机器人不仅要记住,还要学会忘记
25:11
“面向机器人场景的智能体原生全模态记忆系统”到底在解决什么
26:55
从2023年开始做AI泛心理,最初的动机是什么
27:35
毕业、答辩、找工作、租房:情绪需求就在自己身边
28:18
颜鑫的产品原则:自己先用
28:48
他真正想做的,是让AI离人更近
29:06
既然豆包也能聊天,为什么还需要实体机器人
30:28
长期上下文和实体陪伴,会怎样改变人与AI的关系
31:46
为什么有人愿意为“几乎什么都不会”的陪伴机器人花很多钱
33:01
情感为什么需要一个容器
33:17
自动化专业的学生,为什么大二开始自学AI
34:22
在人脸识别还是重要AI场景的年代,他已经在想什么
34:57
第一次创业:AI+智能零售
36:03
第二次创业:把AI机器人塞进微信群
37:05
群聊怎样自然形成一套真实的用户评测
39:35
为什么没有利益关系的真实反馈,比精心设计的评测更有意思
40:28
真实群聊数据如何帮助理解“人到底怎么用AI”
42:02
三段创业经历,怎样一步步补足颜鑫对“人”的认识
43:10
大型商超几十万SKU,为什么不可能每次都重新训练模型
44:19
通过向量化,让不断变化的商品仍然可以被识别
46:02
食堂和面包场景,智能结算已经怎样真实落地
47:08
AI提升的不只是一个人的效率,也可以是一群人的效率
48:28
AI+零售给了他效率视角,AI+社交给了他人的视角
49:16
有AI以后,为什么很多人仍然只会问天气
50:48
也有人开始把自己的情绪寄托给AI
50:57
第三次选择:为什么最终进入AI+泛心理
52:10
“我只是想让大家更快乐一点”
52:41
“可能我自己也没有那么快乐”
53:27
未来仍然想做帮助人放松、快乐和生活的产品
54:38
快问快答:Codex、Claude Code和微信
55:58
最值钱的产品习惯:自己必须是第一用户
56:08
最大的产品坑:没想好就做,然后反复返工
56:26
完美主义者为什么有时宁愿Rebuild
57:25
先把0到1想清楚、写清楚,再交给AI
57:51
普通人30天熟悉AI开发:先写人生说明书
58:09
未来一年:希望自己的产品真正帮助到自己之外的人
📖故事摘要
颜鑫是00后。
如果只看年龄,他的履历甚至会显得有一点过于密集。大学读自动化,大二开始自己学AI,也从那个时候开始创业。第一段做AI+零售,第二段做AI+社交,后来又一路进入AI+泛心理、多模态算法和具身智能。
他自己后来复盘时,却不觉得这些经历彼此割裂。
AI零售让他第一次真正理解,一套技术怎样进入真实世界,并且同时提升一群人的效率。AI社交让他开始观察,人拿到AI以后究竟会做什么。到了泛心理和情感陪伴,他关心的问题进一步从“技术能不能工作”,变成了“技术到底懂不懂人”。
这期播客甚至也是从一个真实产品开始的。
录制当天,吴熳在面壁智能与华为昇腾的活动现场看见颜鑫展示一个桌面陪伴机器人。机器人有两个摄像头,也有像耳朵一样可以活动的天线,头部和身体会随着说话做动作,吴熳觉得有意思,就把颜鑫“薅”过去了。
但真正让人印象深刻的,并不是这些拟人化外形。
颜鑫讲了一个自己调试机器人的瞬间。
他坐在电脑前写代码,没有给机器人发任何命令。机器人却观察到他的屏幕,主动对他说:你的屏幕看起来很大,写代码应该很爽,你是不是程序员?
这句话让颜鑫自己都产生了一个Aha Moment。
因为在他看来,这才是“伙伴”和“工具”之间一个很小、却很关键的区别。
今天的大部分AI,都在等待。
人输入,机器回答。
人再问,机器再答。
但真正生活在你旁边的人不会这样。
一个朋友可能看到你盯着电脑一下午,主动问一句“是不是又加班了”;也可能察觉你今天异常沉默,问一句“你是不是不开心”。
所以颜鑫给陪伴机器人定的第一个目标,是主动交互。机器人必须能够持续感知环境,在没有明确Prompt的情况下,根据周围发生的事情决定自己是否应该发起交流。
第二个目标,是允许打断。
真实人类不会永远等对方完整说完一大段话再开始回答。我们会插话,会停顿,会发现对方突然改变想法,也会在被打断后顺着新的信息继续交流。
如果一个AI无论发生什么,都必须按照已经生成好的句子说到底,那么它更像一台对讲机。
第三个问题,是延迟。
颜鑫希望把响应控制到600—800毫秒左右。几百毫秒听上去是一个纯技术指标,但在人机交流中,它直接影响“像不像人”。
等待太久,人会清楚地意识到:
它在处理。
它在计算。
它是一台机器。
而人在和人说话时,这种等待几乎不会被单独感知。
第四个问题,是动作。
如果机器人回答一句开心的话,但身体没有任何反应;如果语气很兴奋,两个“耳朵”却完全静止,这种违和感会迅速把人从关系里拉出来。
所以他的机器人不仅输出声音,也会输出与语言相配合的动作。
这些细节最终都指向一个更大的问题:
机器能不能和人建立信任?
颜鑫对此并不特别乐观。
他并不认为人一定能够对机器产生和人与人一样的“绝对信任”。但他相信,通过更自然的感知、理解、记忆和交互,人和机器之间有机会形成某种相对稳定的信任。
而一旦进入情感问题,技术难度会突然变得很高。
最简单的例子,就是“我没事”。
如果只看文字,这三个字没有区别。
“我没事。”
“我没事……”
“嗨,我没事啊。”
同样三个字,换一个语气、表情和动作,情绪完全不同。
这也是颜鑫越来越关注多模态情感感知的原因。
情绪从来不只存在于文字里。人的声音、表情、视线、身体姿态,都包含信息。如果系统最终只把所有东西压缩成文字,再交给大语言模型处理,大量情感信号可能在最开始就已经消失。
更难的是,情感不像数学。
1+1等于2,可以明确告诉模型什么是正确答案。
但一个人此刻究竟是70%的难过,还是40%的失望和30%的愤怒,没有一个绝对标准。
模型训练又偏偏需要目标。
于是情感理解本身就成为一个很难评估、也很难优化的问题。
颜鑫和团队因此做了AAM Bench,尝试系统观察现有模型在相关方向上的能力;也做过面向端侧的视觉—文本多模态模型,希望设备能在本地完成一部分对人和环境的感知。
端侧在这里不仅是为了速度。
也是为了隐私。
吴熳听到“机器人进家庭”时,第一反应就是:
我都不敢想它能拍到多少东西。
确实如此。
一个长期待在家庭里的机器人,可能看见比手机更加私人和连续的生活。谁回家了,夫妻在说什么,东西放在哪里,今天谁看起来很疲惫,这些信息如果持续上传云端,人很难完全没有顾虑。
所以颜鑫倾向于,让尽可能多的感知发生在设备本地。
而随着机器人真正进入生活,另一个问题又出现了:
它应该怎样记住你?
今天大量Agent Memory仍然以文本为主。但一个机器人真正陪在身边以后,它需要记住的事情未必都是一句一句可以写进数据库的文字。
你刚才把卡放在桌子的哪个位置。
这个人是你的妈妈还是同事。
你每周三晚上似乎都会很晚回来。
你看到某件东西时,表情会发生什么变化。
这些上下文共同组成它对你的理解。
更有意思的是,颜鑫甚至认为机器人还要学会忘记。
人的记忆不是无限保存的。
如果一个机器人把几年里所有细节都永远以同样权重留下,一方面搜索空间会越来越大,另一方面大量已经没有价值的信息会变成噪声。
所以真正智能的记忆,也应该包括遗忘、更新和重新组织。
颜鑫为什么会愿意长期研究这些看起来很难量化、也没有Coding那么容易拿到确定反馈的东西?
答案其实来自他自己。
2023年,他即将毕业,实验室里的师兄师姐也都走到人生的第一次大转折。论文、答辩、工作、租房、异地、收入,很多事情突然同时压过来。
年轻人看起来拥有无限可能。
但大家并不快乐。
颜鑫发现,这不只是别人的问题,也是自己的问题。
他做产品始终有一个非常个人化的原则:
我是不是第一用户?
如果一个模型连自己的问题都解决不了,他不会因为它在Benchmark上很好看,就认为这是一个有价值的产品。
所以他开始做泛心理。
他希望先帮到自己,再帮到身边的人。
节目里吴熳也问了一个非常现实的问题:
现在豆包、ChatGPT已经能陪人聊天了,你为什么还要做机器人?
颜鑫认为,实体本身很重要。
手机里的一句话,和一个长期存在于你房间里、会转头看你、会摇晃身体、记得你过去发生过什么的小东西,是两种不同的体验。
他举了日本陪伴机器人的例子。
有些产品的实际功能并不复杂,不会做家务,也不能真正提高多少生产力,却依然有人愿意花几千、几万元购买。
原因也许和养猫类似。
你很难用“它究竟替我完成了多少任务”解释自己为什么愿意养一只猫。
猫是一个情感容器。
机器人也可能成为新的容器。
这句话也解释了颜鑫整个创业路径为什么最终走向今天。
他大学原本学习的是工业自动化。2020—2021年前后,ChatGPT还没有出现,当时AI的大量应用仍集中在视觉识别等领域。
颜鑫却觉得:
AI应该不只做这些。
所以大二时,他先去做智能零售。
大型商超的SKU可能非常庞大,并且每天都在变化。如果每增加一种商品,就需要重新训练模型,技术带来的成本甚至会超过它节省的人力。
他们的思路,是在商品入库时把视觉特征转成向量,与商品信息匹配。以后商品增减不需要不断重新训练整个模型。
这种技术后来进入学校食堂、面包等场景。
结算的时候,不需要工作人员对每一件商品逐一扫码,把东西放到识别区域里,就能一次完成识别和价格计算。
原来可能需要几十秒甚至一分钟的结算,被明显缩短。
这段经历第一次让颜鑫看到:
AI可以提高的,不只是一个坐在电脑前的人的生产力。
它可以一次提高一整群人的效率。
到了第二次创业,他开始做AI+社交。
他把机器人放进微信群,让用户直接和模型聊天。
现在看,这种产品似乎并不稀奇。
但在那个时候,大量普通用户甚至还接触不到今天这样成熟的大模型产品。微信群反而成了AI离普通人最近的入口。
更重要的是,颜鑫第一次有机会观察:
如果完全不告诉用户应该怎样使用AI,人到底会拿它做什么?
有人每天只问:你好。今天天气怎么样?
也有人开始和机器人开玩笑、骂它、夸它,甚至向它表达非常个人的情绪。
在群聊里,人们还会自然评价机器人。
“这个模型怎么这么笨。”
“它今天这个回答还挺好。”
这些讨论不是专门设计出来的测评,没有奖金,没有任务,也没有人在旁边提醒“请认真评价”。
所以颜鑫觉得,这种反馈非常珍贵。
骂是真的骂,夸也是真的夸。
模型终究是给人用的,那么真实用户在没有利益关系的场景里做出的反应,本身就是一种最自然的Benchmark。
AI+社交让他开始从“模型能不能做事”,走向“人为什么这么用模型”。
也正是在观察这些用户时,他发现,有些人正在把情绪寄托给AI。
于是第三段创业慢慢出现。
当时他也考虑过AI+法律、AI+医疗等方向,最后越来越坚定地进入泛心理。
因为在他看来,这个时代已经不再主要面对“能不能吃饱”的问题。
很多人能够正常工作,能够生活,却依然不快乐。
而他并不想把自己所有的技术能力都投入到“怎样让一个人一天多干30%的活”上。
他更想做的,是让人快乐一点、放松一点、拥有更多生活本身的乐趣。
吴熳问他:
这种想让别人快乐的原动力从哪里来?你自己平时是一个快乐的人吗?
颜鑫停了一下,说:
“可能我也没有那么快乐吧。”
“如果我快乐的话,我可能也不会做这个方向了。”
这句话让这一期里那些复杂的多模态、端侧、全模态记忆、情感模型,突然变得很具体。
一个00后的技术创业者,折腾这么多模型和机器人,最后想做的事情并没有多宏大。
他只是希望技术不只让世界运转得更快。
也能让人过得稍微开心一点。
到了快问快答,颜鑫说自己最离不开的三个“AI工具”是Codex、Claude Code和微信。
吴熳马上问:
微信怎么也能算AI工具?
原因还是“人”。
他需要看行业信息,也需要观察真实的人在说什么、关心什么、怎样使用AI。
在他的世界里,人本身就是最重要的数据源之一。
做过这么多产品之后,他认为自己最值钱的习惯仍然是:
坚持自己是第一用户。
而最大的坑,则是没有真正想清楚,就开始做。
颜鑫有一点完美主义。他过去经常做到五六十分以后,发现离自己想要的九十分差距太大,与其在旧结构上修两个月,不如直接Rebuild,从头再来。
所以现在他越来越习惯在动手之前,把0到1先想得更清楚,把目标和结构写下来,再交给AI执行。
最后,吴熳问:
如果让普通人用30天熟悉AI开发,你会怎么建议?
颜鑫没有回答“学Python”。
也没有回答“每天刷Codex”。
他说:
写好自己的人生说明书。
因为工具会变,模型会变,开发方式也会变。
但你得先知道自己是谁,什么问题真的困扰你,你愿意长期解决什么,以及AI到底应该帮你把人生带向哪里。
未来一年,他最期待的变化也很简单:
希望自己做出来的产品,不只帮助自己。
也真正帮助到自己以外的人。
💬听众互动
如果未来真的有一个机器人长期生活在你家里,它会看见你的表情、听见你的语气、记住你的习惯,也可能在你不开口的时候主动问你一句“你今天是不是不太开心”——
你希望它记住你什么?又最希望它永远忘掉什么?