先锋 趋势 方法 投研 作者
在「缓慢、昂贵且分散」的市场,AI 的机会最性感 | 对谈 Mizzen AI 孙克强&李一豪
返回节目精读

在「缓慢、昂贵且分散」的市场,AI 的机会最性感 | 对谈 Mizzen AI 孙克强&李一豪

摘要

  • Mizzen AI押注的不是一个“更便宜的访谈工具”,而是AI产品闭环里尚未提速的关键一环。 孙克强的原话是:“AI让产品的迭代速度大幅加快,但是用研的速度远远跟不上研发的速度。”传统项目约需60人天、约10万的项目开销;Mizzen Insight宣称可把速度提高100倍、成本压到1/10,让研究周期从月级变成小时级,早上提问、午饭后取报告。目前团队仅8人。传统用研本身是劳动和智力劳动密集型,人员增长会加重管理,且交付质量不变时ROI递减。
  • 李一豪看到的是一个总量大、头部不大、结构固化却仍高度分散的替代窗口。 他估算全球传统调研市场约800亿—900亿美元,新兴UX tools约30亿—50亿美元,而头部公司的年收入也只有20亿—30亿美元;类比4000亿美元的传统法律市场与600亿—700亿美元的legal tech,分散并不妨碍第一名上市并创造可观回报。更关键的是,这类传统、半数字化行业变化较慢,反而给新进入者机会建立AI原生优势。
  • 真正的产品壁垒不是把访谈员换成ChatGPT,而是训练一个“能挖到点”的提问模型。 孙克强坦承,通用大模型是“很好的回答者,而不是一个好的提问者”,且优秀访谈过程大多闭源;团队正获取超过保密期的独家访谈数据,用强化学习自研environment与reward model,以回答的真实性、细节、主观分析和一致性等维度评价主持人的问题。李一豪把这视为垂直AI的核心壁垒:domain benchmark与边缘数据飞轮,而非单纯调用更强的base model。
  • 降本的最大价值可能不是抢走已有大项目,而是把用研变成每天都能启动的小实验。 孙克强观察到,产品构建成本已经“大幅降低,甚至低于分发成本”,客户因而从一个月一次的大报告转向“连续渐进式的用户研究”;已有消费电子客户开始研究“是否采用先用后付费”“手写与屏幕打字是否应分离”等微小问题。平台免收平台费、按项目收费,目标是“用研的平权化”;Koji则认为,新增市场的新机会对创业公司更友好。
  • AI主持人的反直觉优势是减少人际表演,但回答质量仍要靠机制设计。 面对主持人质疑,孙克强承认受访者起初会不适应,但认为AI能减少主持人的性别、情绪和chemistry造成的干扰;平台会提前告知真实性、细节、主观分析、一致性等评分标准,并把得分与礼金挂钩,使博弈中的最优解变成“更加真实、更加愿意表达”。其受访者供给由2家国内、2家海外供应商及合作专家库组成,声称总量达到千万级。
  • 团队明确否定了现阶段直接“访谈AI”的捷径,却给真实数据积累后的受访者模拟保留了长期路径。 孙克强认为当前模型与人的真实context仍有“巨大gap”,训练时固化的上下文只能复现过去且不完整的信息,通用推理能力与品牌方信任也都不足。长期方案不是凭空生成persona,而是将受访者历次表达沉淀为偏好图谱,再做有依据、低成本的实验性模拟。
  • 这笔早期赌注同时押注一条长期技术主线和创始人的转向能力。 孙克强从视觉偏好HPS、GPT-3.5与RLHF一路追到多模态人类偏好,期间又在调研画廊、艺术家和交易者后放弃艺术市场方向;李一豪看重的正是这种“真实采样”、快速pivot与被负面反馈推动而非击倒的resilience。终局愿景是让Mizzen成为“每一个PM的钢铁侠盔甲”,以Web coding和web user research作为两只手,由人贡献直觉、审美与“神来之笔”,AI完成研究和迭代链路。被问及300万美元投三个人时,孙克强表示前两名会投给Quick Stone的两位老股东,第三名投给硅谷公司Krea。

精读

1. AI研发越快,用研越成为产品闭环的硬瓶颈

  • 孙克强用三个问题筛方向:需求是否真实、技术变量是否足够颠覆、是否“通往伟大之路”。Nielsen已有100多年历史,说明需求长期存在,但行业仍然“很慢、很贵、效率很低”。

  • 团队自己探索idea时,一周只能访谈十余人;传统项目通常约60人天、约10万的项目开销。AI却能把原本串行的20到30场访谈并发执行,Mizzen Insight因此提出“100倍速度、1/10成本”。目前团队仅8人。

  • 更大的判断是产品必须从用户洞察出发、研发后再回到用户;任何一环滞后都会限制迭代。李一豪补充,模型对反馈的隐式建模最终可能直接影响交互、体验、性能甚至价格。

2. 慢、贵、分散的近千亿美元市场给新物种留下整合空间

  • 李一豪估算,传统调研市场全球约800亿—900亿美元,新兴UX tools约30亿—50亿美元;行业虽已进入固化和并购整合,头部公司的年收入仍仅约20亿—30亿美元。

  • 他的类比是:传统legal约4000亿美元,legal tech已有600亿—700亿美元;中国K12在“双减”前由约2600亿元升至4600亿元、接近5000亿元,头部三家也能做到100亿—150亿元年收入。

  • 这类市场天然scatter:专业性与深度服务让细分公司长期存在,但巨大总盘子仍能托起一个足以上市的第一名。AI可能扩大头部,也可能创造完全不同的“新生物种”。

  • 李一豪认为,深度数字化市场的生态往往掌握在互联网巨头手里;传统调研市场迭代较慢,反而给创业公司留出窗口。他认为中国团队的产品迭代、用户运营与复杂To B交付能力,是很有竞争力的组合。

3. 人类主持人的“对齐税”让AI不只是在省人工

  • 孙克强发现,多位主持人并行工作会产生高昂的“对齐税”:信息同步时洞察被稀释,人的疲劳与当天情绪又会直接改变访谈效果。

  • 即使由同一人完成全部访谈,也会出现“认知边际效益递减”:第一位受访者令人兴奋,到第二位时,主持人的兴趣和追问密度便开始大幅衰减。

  • AI的价值因此不只是替代工时,而是保持一致性——“对所有的访谈者都是第一次访谈那样”,持续好奇并追问可能被人类主持人略过的细节。

4. 用研从大型项目变成连续小实验,新增市场才是主战场

  • 孙克强的反共识判断是,AI让产品构建成本“大幅降低,甚至低于分发成本”,一次性、昂贵、耗时一个月的研究报告也开始转向“连续渐进式的用户研究”。

  • Koji以消费品说明价值:软件需求做错尚可回撤,实体产品备货一万件后卖不掉,不但形成库存,销毁也要成本;但传统调研的人才hour pay太高,过去通常只有戴森、蔚来等资金充足的公司用得起。

  • 已有消费电子客户从核心项目扩展到微小问题:消费者愿不愿意“先用后付费”,手写输入与屏幕打字是否应出现在同一产品形态。孙克强称目标是让用研不再只是“大公司、或者大公司的核心项目才拥有的权利”。

  • 平台已有付费客户,模式是免平台费、按项目收费。主持人用“访10个人、每人约1000元、项目约1万元”复述计价逻辑,孙克强回答“对”,但没有披露统一价目表。

5. Mizzen把一次研究拆成四个Agent并保留证据链

  • 以一家大型现制餐饮品牌为例,访谈创建agent先接收自然语言需求,在沟通过程中实时整理访谈大纲。

  • 招募环节只需描述用户画像;平台随后筛选候选人,并用5—10分钟的面试agent核验身份与条件,确保受访者符合品牌方需求。

  • AI主持人邀请受访者打开摄像头,直接把他们带回具体情境并追问;报告agent再汇总所有访谈,输出总括结论、逐题定性与定量分析。孙克强强调,报告内容都可以由原文支撑,而非只交付一份不可核验的总结。

6. AI可能减少人际表演,但回答质量取决于激励设计

  • 主持人的质疑是:受访者发现对面是AI后,会不会敷衍、情绪不足或难以保持注意力?孙克强承认“一开始会有一点”,但称产品设计目前已经解决这一问题。

  • 第一层设计是让受访者知道自己在帮助真实品牌改进产品;第二层是他援引的“霍桑效应”:人类主持人的性别、情绪和chemistry可能诱发自我展示,AI反而让人“放下防备”,更如实表达。

  • 第三层是一套benchmark,以多模态行为评估真实性,并检查细节、主观分析和前后一致性;受访者在开始回答前就会获知评分标准,得分与礼金挂钩。“最好的一个解在于,你要变得更加真实、更加愿意表达。”

  • 样本池底层已接入2家国内、2家海外供应商,合计声称达千万量级;平台再用agent筛选和面试,同时接入咨询、研究公司的专家库,并自建社群。

7. “访谈AI”现在不可信,现阶段仍需真实人作为数据源

  • 面对“为什么不直接访谈模拟人的AI”,孙克强给出明确否定:现阶段模型与人类真实context存在“巨大gap”,环境中的细小变化都可能改变人的态度和选择。

  • 固定训练上下文只能提供过去且不全面的信息,通用智能也不足以可靠推演真实产品体验;更现实的阻力是,品牌方普遍对AI受访者的真实性和有效性存在很大顾虑。

  • 团队仍保留长期路径:先用真实访谈积累个人表达与偏好,再模拟特定受访者,服务高效、实时、低成本的实验性研究。这里的前提不是生成一个泛化persona,而是拥有可校验的历史数据。

8. 通用模型擅长回答、提问能力不足,强化学习是主持人壁垒

  • 客户不约而同地认为,研究质量首先取决于主持人“能够问出什么样的问题”。孙克强的坦诚判断是,当前大模型是“很好的回答者,而不是一个好的提问者”。

  • 原因之一是模型公司的post-training主要优化答案偏好,而非“怎样提问可以问到你心坎里去”;原因之二是苹果等企业的大量优秀访谈过程并不公开,互联网中很难找到这些关键样本。

  • Mizzen已与多家国内外研究、咨询机构合作,获取超过保密期的访谈数据,并与对方签订独家合作;团队又用半年设计训练体系,目标不是一个“能说话”的模型,而是专业、能够“挖到点”的AI主持人。

  • 强化学习环境以真实项目背景和受访者信息模拟回答,再由评分模型按多个维度评价模拟受访者的回答;回答质量越高,说明问题越好。李一豪认为,这种domain benchmark与持续产生的边缘数据,才是垂直AI公司的长期飞轮。

9. 偏好图谱把一次性访谈沉淀为长期资产

  • 孙克强认为,传统个性化推荐依赖离散、粗糙的标签,无法立体塑造一个人;语言则能承载更完整的信息,只是过去缺少低成本整合与检索的方法。

  • 团队的“人类偏好图谱”尝试汇总用户在不同平台留下的表达,按当前问题检索最相关的历史偏好。第一项用途是超越有限标签,更精准地找到符合研究要求的人。

  • 第二项用途是跨访谈校验:若受访者前后推翻自己,主持人会主动确认;第三项才是模拟观点。孙克强强调的长期资产,是把真实人类偏好转成可复用的结构化数据,而非每次项目结束即归零。

10. 创始人的多次转向始终围绕“理解人”,终局是PM的钢铁侠盔甲

  • 孙克强30岁,清华硕士、港中文MMLab博士,曾在商汤工作5年、Meta工作半年;他的创业信念是“YOLO,You Only Live Once”,“我终将死亡,在这之前我要给这个世界留下些什么”。

  • 他把GPT-3.5通过RLHF让世界认识到“人类偏好是模型放大器”视为重要启发,博士期间又做了视觉偏好研究HPS,并称其为全球第一个系统性挖掘不同人类视觉偏好的模型。其自我解释是:“这不是从计算机视觉跳到用研”,而是从视觉扩展到复杂、多模态的动机与选择原因。

  • 团队最早探索过艺术领域的human preference benchmark与arena;孙克强调研画廊、艺术家和交易者后发现,艺术供给已非稀缺,渠道、资本和分发主导价值,于是快速pivot。李一豪从最初计划90分钟却聊到3小时的雨天会面起,看中的正是这种“真实采样”、resilience与持续拓宽边界的倾向。

  • Musical.ly创始人Louis曾告诉孙克强,前后摄像头普及带来的“生产力跃迁”改变了创作与消费;他希望Mizzen同样释放用研产能。终局是“每一个PM的钢铁侠盔甲”:Web coding与web user research成为两只手,人贡献直觉、极致审美和神来之笔,AI完成研究到产品迭代的链路。

  • 被问及300万美元投三个人时,孙克强表示前两名会投给Quick Stone的两位老股东,第三名投给硅谷公司Krea,理由是其很早就把产品打磨速度做到极致。