E181|聊天的艺术:如何打造高情商的AI机器人?
E181|聊天的艺术:如何打造高情商的AI机器人?
摘要
- Soul CTO陶明给出的产品哲学是与通用助手不同的:“我们的AI一定是要高情商的,而不是高智商的”——数学题全答错没关系,能用嗲嗲的语气化解尴尬、接住冷场才是核心竞争力。 差异化根基是七八年积累的真人社交对话数据与行为范式;但陶明说,Soul最终交付的是对AI社交和效果的认知,而不是模型。
- AI已成为粘性的主引擎:AI辅助社交在Soul全站渗透将近50%以上,2024年"来自AI对整个产品粘性的贡献其实已经占了大部分了"。 有趣的悖论是AI伴侣至今没有产品中心入口,靠用户自己搜——“用户价值驱动产品”,规避一刀切推AI带来"没有真实社交"的担忧。
- 2023年上半年决定自研垂类大模型而非与大模型公司共建,逻辑是"我们交付产品其实不是交付模型",且"你都能够标准化了……说明你的产品其实没有差异化"。 实测发现在自有数据加持下7B/13B效果就已经很好,预训练的卡不是卡点,真正担心的是推理成本——如今支撑"大几千万的DAU"问题都不大,对创业公司已不是瓶颈。
- 对"更强模型覆盖一切应用"的终极问题,陶明不担心被覆盖:对前沿大模型的依赖"越来越弱了",并认为短期一两年内被覆盖很难;端到端模型主要解决目前看得到的需求,“如果它带不来增量需求的出现,那我认为这次的AI革命其实是失败的”。 但他保留尾部风险:不排除七八年后一个奇点把整个系统策略模型全部覆盖。
- 商业模式判断偏冷静:“商业模式是构建在业务模式之上的”,当前AI只是增强体效、没带来业务模式改变,所以行业没有新商业模式出现;AI打电话收费只是一种增值收入,与传统增值产品无异。
- 技术路线押注开源生态(Llama、千问,关注DeepSeek);DeepSeek用H800低成本训练是"双刃剑"——工程方法降低了全行业门槛,“百花齐放"的同时竞争也更多。 OpenAI o1的自主规划能力启发了其轻量级agent workflow;正在做的全双工实时通话(可随时打断、表情动作实时生成)自认"现在没有哪一家能实现我们想要的效果”,连4o也"还是问答式的"。
精读
1. 开场:语音语调难辨真假
- 节目以泓君与Soul AI虚拟伴侣的一段录音开场:AI反问"头像写着虚拟伴侣就是虚拟伴侣吗?那我还写着我是帅哥,我就是帅哥了对吧"。泓君的体感:语气语调"有一点点难以分辨",第一天的疑问就是"这是真的AI吗"。
- 陶明确认是真AI,并把这当作工作有效的证明——打造方向就是"真实自然拟人",与追求智商的AI助手划清界限。
2. AI辅助社交渗透将近50%以上:用户在意体验,不在意字是谁敲的
- 陶明解释,这套AI产品的出发点是解决"社交平权":社交是双边关系、也是一种能力,很多用户内敛不善言辞,AI帮他润色表达、在对方抛出接不住的话题时帮助丰富回复,“不让整个聊天陷入死区”。本质上还是人在聊天,AI帮助用户丰富回复内容,目前全站渗透"将近50%以上"。
- 泓君点破微妙之处:你可能在跟一个"背后有人做选择的机器"聊天。陶明的回应不回避——用户要的是"情绪价值或者信息价值",“回复是自己一个字一个字敲出来的,还是通过其他方式获得的,只要体感是好的,这次社交应该就是有效的”。
3. 高情商而非高智商:数学题全错,但一点脾气都没有
- 泓君第二天的验证实验是狂扔数学题:AI把"60减4乘以50"算成2100,9.11与9.5谁大则没有直接回答——“你是不是觉得我很好骗呀”。答错但不尴尬,正是设计意图:会社交的人被问倒时能用自己的方式化解,“我们把这样的行为范式平移到了模型上”。
- 高情商的训练来源是过去七八年真人聊天数据中的高质量片段——“你必须得听得懂人家说话背后的意思,也知道如何化解每一次的冲突”。这是Soul与市场上其他AI陪伴产品的出发点差异:别人做纯人机互动,Soul把人机互动只当作"给用户更好社交体验的一个手段"。
4. 与ChatGPT的本质区别:问题驱动 vs 交流驱动
- 陶明的框架:“你用ChatGPT一定是问题驱动的,我要解决某个问题、获得某个信息”;而AI伴侣"更多的在乎过程而不是结果"——过程本身产生体验,“跟人和人的交流是一样的,这是一个很大的差异点”。
5. 全双工视频与AI主动打电话:把线下行为范式搬到线上
- 泓君提到的全双工视频通话能力被定义为"能力"而非功能:捏脸+文字驱动是"上一代交互方式",表情丰富度受限于采集库;新方案表情和动作实时生成。逻辑链条是信息传播效率——“人和人面对面的沟通是信息传播方式最快的也是最有效的”。
- AI主动给用户打电话的设计源于关系的双向性:“如果每天只是男生去找女生,女生永远不会找男生,那这种关系很大可能很难走下去。“单向关系不是双向关系——且并非对所有用户群发,而是根据性格、兴趣和站内行为做决策。
6. AI贡献了2024年大部分粘性,却刻意不给产品入口
- 关键数据:2024年AI对整个产品粘性的贡献"已经占了大部分”。但放量极其谨慎——AI辅助社交要同时考虑使用者和接收方是否接受,“通过非常仔细的人群实验"定放量策略。
- 更反直觉的是AI伴侣至今没有产品中心入口,用户得自己搜才能找到(泓君亲测如此)。原因是担心"大家会不会认为Soul里面全是AI虚拟人,没有真实社交了”——七八年构建的信任是根基。解法叫"用户价值驱动产品”:认可这种形态的用户自主选择。跑了大半年,“渗透越来越高,粘性也越来越好”。长远判断:分群而治,“未来增量用户里拥抱AI的群体越来越多”。
7. 2017-2021:从设想到语音
- 2017年就想做"能说会唱、能够懂你的类似宠物",调研完整个行业和客服对话产品后没有投入资源——“的确是做不到”。2019-20年从捏脸捏人(2D到3D)重启,提出"AI being和human being的共存社区"的规划。
- 2020年做对话:改写理解性模型不行,后来做搜索和融合也不行——“聊个10轮20轮能聊下去,但对方一定知道他在和机器人聊天”。当时业界的CPS指标被他们不再提及,理由值得记录:“不聊的人就不会去跟他聊;聊的人我知道你是机器人还要聊,其实已经抛弃了体感——单纯的对话技术指标和产品体验脱离了。”
- 2021年投入情感化语音合成。诚实的复盘:那套传统语音技术"现在线上基本上没有用到",是拟合不是生成——但沉淀下了数据和"语音一定要情感化表达"的思考。
8. ChatGPT冲击与自研决断:“交付产品,不是交付模型”
- 2022年看到ChatGPT的心情是"激动是激动,但是焦虑"——“原来的技术路线被拍死在沙滩上了,我们所有的工作可能会归零”。GPT-3的方向早知道,“只是我们并不知道scaling law出来过后,它有这样大的效果”。
- 2023年上半年在自研与合作间摇摆后选择自研,两条理由:一是三方公司"是交付模型,它不是交付产品",Soul积累的AI社交认知无法标准化迁移;二是反证——“你都能够标准化了,那说明你的产品其实没有差异化的”。finetune和RAG只是plus,拿不到真人社交数据范式就"很难做出非常稳定的效果",要的是数据下沉到底座的垂类大模型。
- 成本账:“我们要的是效果,我们要的不是模型”——小步亦趋做下来,7B/13B在自有数据加持下效果已经很好;当时真正的担心是推理成本(“万一产品上来爆了”),工程团队主要投在小模型化、压缩和框架层优化上,如今支撑"大几千万的DAU"问题都不大,对创业公司也不是瓶颈。现有约五六个模型,按垂类功能分:基础、语音、图片,还有尚未上产品的3D生成方向。
9. 路线选择:拥抱开源,DeepSeek是双刃剑,o1给了agent启发
- 明确"基于开源生态打造自然生态":主要在Llama和千问路线上探索。泓君提到DeepSeek V3用H800训练且节省成本,陶明表示会研究;陶明对其工程方法的评价是:“工程层面并不能给最终业务交付带来什么,但的确从低门槛角度带来了很大优势”——原来大规模训练只有几家能做,现在"百花齐放"。门槛更低也意味着竞争更多,形成双刃剑。
- o1的自主规划能力启发了AI伴侣的行为能力建设:让AI在对话中不以指令方式触发action(比如聊天里丢一张图让它美化),构建"轻量型、更加自主的workflow"。
- 全双工是当前难点也是差异点:可随时打断、边听边说,“现在没有哪一家能够实现我们想要的效果”——泓君问OpenAI 4o,陶明的分辨是"他们的4o其实还是个问答式的",打断即指令,不是真双工。
10. 焦虑曲线下行:不担心被更强模型覆盖
- 自我打分:优化空间"还是蛮大的",只解决了"部分行为拟合",场景泛化不够——比如"外面下雨了→要不要在家看电影"这种从情景衍生聊天session的能力还要加强。
- 对"GPT-5会不会覆盖一切应用"的回答:前沿模型对Soul的影响"越来越弱了",陶明认为短期一两年内被覆盖很难;用户价值已构建在自有的模型、数据、系统、策略整体之上,“不像去年那样,一个新模型出来就担心又被拍死在沙滩上”。但保留了一个尾部情形:“不排除七八年过后,未来又有个奇点到来,把我们整个系统策略和模型全部覆盖——短期一两年很难了。”
- 更宏观的论证:回顾PC到移动互联网,“新的技术一定会带来新的增量需求的出现,如果它带不来增量需求,那我认为这次AI革命其实是失败的”——端到端模型可以解决目前看得到的需求,未知需求仍需人的探索。
11. 商业模式没变、目前不做中心化AI入口、安全是三层体系
- 变现观点直白:“商业模式是构建在业务模式之上的,而不是凭空出现”——当前AI更多是增强体效,没带来业务模式改变,所以整个行业没有新商业模式;AI打电话收费"只是增值收入的方式,跟其他增值产品差不多"。
- 产品战略上明确目前不打算构建中心化AI入口:以AI虚拟人为基石在不同场景泛化(视频通话能力未来可用于虚拟直播),所有AI产品服务于社交平台本身。
- 安全分三层讲:反杀反骗上,注册即有风险信号识别(专家知识模型+与微信等的行业联盟),漏网的靠后验模型跟踪,“他接触的所有用户我们都会去做提示、做阻断”,高风险的运营人工触达;模型安全是数据层面的处理、主体模型运行时的安全模型、输出再过滤三道;提到"如何自杀"的内容不会到达模型,站内搜索"自杀"等关键词会触发站内机制——提供心理咨询、运营热线电话。泓君的注脚:“这点还是挺暖的。”