先锋 趋势 方法 投研 作者
124. 雨森的创投观察第1集:2026年预期、The Year of R、回调、我们如何下注
返回节目精读

124. 雨森的创投观察第1集:2026年预期、The Year of R、回调、我们如何下注

摘要

  • 2026年的关键词是"Year of R":Return(回报)、Research(研究)、Remember(记忆)。 戴雨森的核心逻辑:新一代SOTA相比上一代的进步在放缓(想想GPT-4对GPT-3的跃升 vs GPT-5对GPT-4),投入却指数级变大,而数据中心约50%的投入是4-6年就会过时的算力——“大家在投入变大的时候,对于回报的关注也会越来越大”。
  • 明确的市场判断:明年美股可能出现比较明显的pullback,时间点可能在下半年,触发条件是美国劳动力市场软化叠加AI回报不及预期,“OpenAI本身的用户和收入的增长会是这个大担心的一个很重要的trigger”。 他个人已基本清仓二级股票,但不做空:“做空是一个你希望别人变得很惨的事情”——只做多,可以降仓位。
  • 泡沫观与朱啸虎"三年无泡沫、纯属无稽之谈"正面相抵:“人类历史上每次技术革命都带来了泡沫,几乎毫无例外”,AI是最重要的革命,“它带来人类历史上最大的泡沫可能也是很理所当然的”——但还没到顶,泡沫之巅的标志是烂公司骗子公司都很贵,目前英伟达短期估值甚至很低。 风险机制在长短端错配:一旦AGI预期在长端转悲观,“短端它业绩再好可能也都不会是主要的交易因素”。对token论的回应:用量年涨十倍是必然,但"token量的上涨不一定能带来回报的必然到来"。
  • 模型没有秘密、卖API不是垄断生意:硅谷无竞业、人才流动快,“没有能够真正长期保守的秘密”;中国开源模型以五到十分之一的成本把差距压在6-12个月,“现在基本上已经是中国模型的天下”。 模型公司的第一方应用越来越重要(Claude Code发布几个月ARR到几亿美金,Dario不惜与最大客户Cursor直接竞争),而"模型给你的是code,你给用户的也是code"的薄壳应用会被持续挤压。
  • 商业化四条路都比共识慢:订阅制难提价(Netflix二十年基本没涨价;“去年两百美金买到的模型,现在就只能卖二十美金了”);广告电商是存量蛋糕(Google找到AdWords花了4年、Facebook信息流花了6年);AI替代程序员是价值通缩而非工资转移(杰文斯悖论);企业服务渗透慢于预期(Office Copilot始终低于预期)。 红杉David的$200B之问已膨胀到万亿级——“屋子里的大象”,目前没人有好答案。
  • 中美AI估值差是全球配置里最大的期权:Thinking Machines五百亿美金估值"是中国所有AI创业公司加起来的估值还要多";Mistral 140亿 vs Kimi不到40亿;美国高增长应用给30-100倍ARR、中国约10倍。 配置用哑铃:一头OpenAI/Google/Anthropic最稳,一头中国公司弹性最大、可能有百倍回报——“这个gap我认为最宽的时候已经过去了”。
  • 给创业者:负margin倒卖token的增长已终结,硅谷开始要求应用有类SaaS的50%以上毛利与留存;要对6-12个月后的SOTA有高质量前瞻(杨植麟之于长文本、Manus之于agent)、第一天做全球市场、“不下牌桌持续翻牌”——Manus是第三次尝试才打成的牌。 2026年memory、多模态生成、voice是必争之地。

精读

1. 2025总复盘:AI符合预期,最超预期的是中国创投回暖

  • 戴雨森的年终自评:AI的发展"基本上是符合我之前的一个预期的"——技术进步→产品落地→商业化这条链路得到验证:ChatGPT收入涨得很快、Anthropic API涨得很快,Cursor、Claude Code在coding上接近十亿美金ARR,Manus、Genspark等通用agent朝一亿美金ARR以上走。
  • 真正超预期的是中国创投生态的回暖:二级市场大反弹带来退出端盈利效应,DeepSeek年初横空出世,机器人、光模块等半导体产业链具备全球竞争力,“投资的项目的数量、金额、估值以及项目竞争的强度都发生了很多的提升”。
  • 美国同样热情高涨——出现了Thinking Machines这种"在没有产品或者基本没有产品的情况下达到五十个billion估值"的新型公司,以及一批约50倍ARR的百亿美金级初创。

2. “聪明的小学生"开始赚钱:Agent元年的兑现

  • 去年的比方是"AI还在快速学习,它是一个非常聪明的小学生,但是一个小学生去打工呢可能还不能赚钱”——2025年这个小学生开始交作业了。
  • 年初提出的三个关键技术进展全部兑现:O系列带来的推理能力提高(thinking time scaling)、以Sonnet 3.5为代表的编程能力提高、以及Computer Use——三者加起来解锁Agent元年。结果是Claude Code、Codex这类能自主编程一小时以上的"L3级"coding agent,和Manus、Genspark这类通用agent产品的出现。

3. 三个去年的判断:省时间赢了杀时间,人形机器人继续落空

  • 中国互联网过去十年赚钱靠杀时间的应用,但"比起这种Kill Time杀时间的应用,AI来省时间其实更重要"——一年过去,陪伴型应用没到期待值,大应用基本都在生产力方向。
  • 对人形机器人的谨慎兑现:“改变数字世界一直是比较简单一点,我们对于物理世界的改变一直是被高估的”——Optimus等在manipulation上的预期落空,具身智能"肯定要继续往后延",虽然VLA、Sunday这类家用机器人有些有意思的苗头。
  • 替代手机的通用硬件(Humane、Friends吊坠、Rabbit)依然很难,判断不变。

4. Agent还困在prosumer市场

  • 大公司里部署agent对数据、隐私、权限要求都高,“在大公司里面Agent其实它的渗透率是很低的”——目前的agent产品服务的是全球几亿知识工作者、专业型个人和中小团队。这个判断贯穿全集:早期市场的快速渗透不等于主流市场的到来。

5. 模型侧:thinking time scaling与更多"李世石时刻"

  • 技术主线:底层突破→被scaling→性能与场景提升。O1(2024年10月发布)解锁了推理路线,落在benchmark上:GPQA从二十多分做到接近八九十分,超越人类PhD;SWE-bench从GPT-4的不到5分提到接近80分;Humanity’s Last Exam从几分到三四十分。
  • 年终OpenAI和DeepMind的通用模型双双拿到IMO金牌级成绩,DeepSeek Math V2带来开源的IMO金牌级表现——“有更多的李世石时刻到来”,在编程、数学、常识推理领域,AI正在超过人类中最强的个体,“这个其实会带来很多我们认知的变化”。

6. 多模态:从吉卜力时刻到Nano Banana Pro

  • 年初GPT-4o带来吉卜力时刻——图片生成模型指令追随变好后用户场景大扩展;Nano Banana及Nano Banana Two Pro能把长文变成infographic海报"甚至像哆啦A梦去跟你解释";VO3、Sora 2实现音画同步、更长时长、更好物理一致性。
  • Sora 2的意义不在留存(“它不是个消费内容的地方”),而在于让很多人第一次看到"虚拟和现实的边界正在被消散"——“非常让人觉得很魔法般的时刻”。

7. 一年之间,开源已是中国模型的天下

  • 2024年大家担心中国缺卡、人才在美国;DeepSeek证明"可以通过十分之一甚至更小的成本追到接近世界SOTA的水平"。下半年千问、Kimi K2、GLM、MiniMax、字节相继证明这不是DeepSeek独有——美国SOTA发布后几个月,中国就能拿出"性能接近、成本只有五到十分之一、并且还能真的用上的开源模型"。
  • 年初开源生态还是Llama主导,“现在基本上已经是中国模型的天下”:Cursor的Composer One被普遍认为基于中国开源模型训练;All-in主播Chamath公开说已把大量使用切到Kimi K2,“表现很好,同时价格很低”。

8. 模型没有秘密:benchmark饱和与"高分低能"

  • 为什么座次一直在变、没人拉开代差?“这个行业里边信息和人才流动很快,尤其硅谷没有竞业……没有能够真正长期保守的秘密”,且大家的数据大差不差、手上都有几十万卡。
  • Benchmark也饱和了:刚出的可能是Opus 4.5(口述音近"OPENS 4.5"),SWE-bench约80分,Gemini 3 Pro约78分,“看上去好像只有两分的差距”,但开发者实际用下来前者好用很多。戴雨森的清华比方:“有人是高分低能”——衡量模型的benchmark需要升级,饱和之后只能到开发者和用户端才能看到真正差距。

9. “大力出奇迹"叙事受到挑战与伊利亚的交替论

  • 2023年对scaling law的简单粗暴理解是"投入很多卡,训出来的模型就有了壁垒,就可以把后面的钱都赚了”——现在两条都受到挑战:大力没带来一家独秀,第一军团仍在你追我赶;大钱也没形成后面的人追不上的壁垒,中国公司追得很紧。
  • 伊利亚的框架成为全集的理论支点:“AI历史一直是一个scaling和research交替的过程”——现有范式提升已经marginal,谁能发现下一个可scaling的范式重新变得重要。Demis的最新说法:到AGI还需要一到两个研究breakthrough。

10. 中国开源打破的三个叙事:十万卡、人才、蒸馏

  • 叙事一"没有十万卡集群做不出好模型":做追赶时很多实验不用再做,资源少反而精打细算,“才会有像MLA这种在效率上非常重要的成果出来”。
  • 叙事二"优秀人才都在硅谷":变成了"US Chinese vs China Chinese"——“他们其实之前就是坐在一张桌子上读书的”,甚至出现硅谷顶级人才回国,“有但不多,但是要有了,这个在两年前大家觉得不可想象”。
  • 叙事三"全靠蒸馏":蒸馏肯定是追赶者的优势,“但把这个全部归于蒸馏,会让大家忽视中国公司做了很多真正的技术创新”——DeepSeek的MLA、DSA稀疏注意力,Kimi在Muon(口述"Moon")optimizer上的迭代。结论带刻度:短期完全超越很难,但"把差距缩小在六到十二个月中间,目前来看还是比较现实的"。

11. 卖API不是垄断生意

  • 活案例:Manus上线时全是Claude 3.7的API——“当时只有Claude 3.7才能够跑起来”,但很快发现另一家模型(口述音近"Dreamline",所指不明)也跑得挺好且更便宜,迅速切走大量调用;Codex出来后Anthropic编程也不再一骑绝尘。“对于一个应用,在API中间切换其实是比较容易的。”
  • 反转的含义:应用公司反而获得了"博采诸家所长"的优势,不同任务用最好的模型——这本身就是卖API壁垒不高的体现。“它肯定不是个垄断性生意。”

12. 模型公司必须重视第一方产品

  • 今年的明确趋势:Claude原本是"没有花太多精力的应用",但Claude Code发布后几个月ARR到几亿美金;拥有应用意味着更多用户数据、memory的机会、更强的模型。
  • 达瑞(原文未明确姓氏)在访谈里说关键领域会自己做第一方产品,“甚至不惜和他们最大的客户Cursor去直接竞争”——“既是客户的关系又是竞争的关系"是今年最有意思的现象之一。

13. 加工厂框架:Cursor的困境

  • 戴雨森的核心比方:把应用看作加工厂,从模型公司买来token加工成输出。“在编程的应用里面,模型公司给他的也是code,他给用户的大部分也是code——应用的加工是比较少的,壁垒就相对薄一点。“经过复杂加工、直接交付完整结果的应用,壁垒才更高。
  • 且战场已经不是Claude Code vs Cursor,而是Claude Code、Codex、Antigravity等一系列模型第一方产品 vs Cursor,细分领域还有Lovable。附上免责声明:“AI就是非常难预判,任何这种很具体的预判,我觉得都要做好随时被打脸的准备——三年前也没有人预料到ChatGPT会来。”

14. 字节为什么不开源

  • “我可能也不是回答这个问题最好的人”,但判断是:字节没有通过开源建立生态影响力去融资或获客的压力,“对字节来说可能更重要的还是豆包、即梦这些产品能够让用户喜欢用,所以对他来说开不开源我感觉也没那么重要”。开源是与人为善、扩大影响力的工具——是手段不是信仰。

15. 应用侧:从"黑莓时刻"到coding跨越鸿沟

  • 去年的判断是AI应用还在黑莓时刻而非iPhone时刻——技术不够强、应用形态不确定。今年兑现了叙事:Sonnet 3.5之后coding应用"跨越鸿沟进入了主流市场”,“很难想象一个稍微有一点信息量的程序员他不使用AI编程工具”,从一亿美金ARR走到十亿甚至更高。
  • 推理能力提升、幻觉减少也带来行业落地:美国是高价值行业(Harvey代表的法律)和劳动密集型白领(客服的口述“Cara、Daihong”一类),中国是真格投的黑湖(AI+工厂小单快反制造,“非常符合中国的国情”)和AI+教育(口述"猿为伍”,音)。

16. 应用的护城河:从生鱼片到满汉全席

  • 2023年第一批AI应用只是模型外面的UI,“就像生鱼片——鱼肉加上芥末和酱油”;现在的先进应用在模型外多了context层(实时上下文、行业专有数据、用户偏好、memory)和环境与工具层(给agent用的工具、可改变的环境),“从原来的生鱼片变成满汉全席”。
  • 证据:Manus在Scale AI发布的Remote Labor Index上"超过了所有的先进的模型”;ChatGPT模型未必绝对最好但留存越来越好,很多分析归因于memory——“Memory这一层其实是在产品层的”。

17. 中国应用第一天就是国际化

  • 与美团、拼多多、字节出海要重运营本地化不同,基于LLM的应用"第一天就是国际化的"——语言天然通晓,而"一个美国人、一个巴西人、一个日本人做PPT的需求可能都是差不多的"。Andreessen的AI应用Top 50榜单里中国公司做的有十几个。
  • 中国创业者的经营效率惊人:Plaud全球收入过一亿美金此前一直没融资;真格最近投的深圳公司Polo做在线视频生成,没融资做到两千万美金ARR(对标美国约一亿美金ARR的Higgsfield)。“中国创业者还是执行力很强,挺能打的。”
  • 但这不是鼓励不融资:“创业拿融资其实是一个时光机——你原来花一年的事情,能不能靠融资把它变成三个月做了?“startup的第一性原理定义就是增长很快的公司。

18. Agent不是Year of Agent,是Decade of Agent

  • 小珺的体感质疑:“我自己感觉Agent没有那么多。“戴的回应:元年就意味着是第一年。援引Karpathy的博客:从自动驾驶经验看,“Agent不是The Year of Agent,这是Decade of Agent”——Karpathy十几年前就开过几英里的L4车,觉得很快能用,但现在做成robotaxi的仍然极少。“它可以很快的给你一个比较有意思的demo”,但autonomous永远是长过程。
  • 偏乐观的量化判断:主流模型厂都在收集agentic数据,白领电脑上常用应用不过百种、手机常用不超过二十个,“如果以AI能够比较自由地使用我们人类在电脑和手机上使用的软件作为标志,可能一年之后agent能力会有很大的提升”——但处理异常、理解任务、规划反馈,还是decade更准确。

19. Coding agent是明牌,创业公司要找模型没有的数据

  • “所有的模型公司都在拼命提高coding的能力,coding就是一种语言”——创业公司现在再进场肯定难了;机会在超越现有范式(人类没写过的任务、偏弱的后端,“大家用web coding都是在做房子外面的装修,房子里面的下水做的是不是足够好?"),但整体还是大厂的机会多。
  • 垂直的判断比朱啸虎的版本更苛刻:“别人没有的数据肯定是对的,问题是什么数据是真正别人没有的,这个没有想的那么容易”——反例是医疗:“医疗的数据大部分就是在公域的”,问诊数据基本是对公有知识库的复制,现有模型已经很强;正例是教育:“同样教一个二元一次方程,对不同资质的学生教法就不一样,这个数据在模型里面是没有的”——垂直的定义是提供模型中不具备的价值,不是把模型价值打包卖给用户。

20. 通用agent的反共识机会:OpenAI做了,但没做好

  • 朱啸虎说创业公司只该做垂直(AI时代要离大厂三条马路)。戴的正面回应:“当大家都认为你去做通用没机会的时候,可能也存在反共识的机会”——投Manus时"也有非常多的投资人会认为OpenAI一做你就没戏了。但OpenAI其实也做了,ChatGPT Agent发布之后大家发现,第一不好用,第二表现也没有特别好”。
  • 两个微观差别:Chatbot不是最适合agent的界面形态(Claude Code、Codex都是单独应用);模型公司理论上什么都能做,但在具体方向上投入的人力和你有没有足够大的差别。Manus的wide research能同时跑一百个并行agent任务,“这个是其他agent应用都做不到的”——通用性要靠infra带来模型厂没有的优势,做到一加一大于二。

21. 网景雅虎论:不能因为终局不吃前面的包子

  • “如果你是Cursor的天使投资人,你会觉得非常悲伤吗?还是说其实是开心的、能赚到很多钱的?“互联网早期最有名的是网景和雅虎,最后都被干掉了,“但你可以说投雅虎、投网景没有意义吗?我觉得也不是的”。
  • 方法论收束:“你不能说终局是这样的,所以你中前面到终局的过程你就不去探索了——我最后一个包子吃饱了,但我前面的包子不吃了嘛。”

22. 真格的节奏:好公司都是悲观期投的

  • 2025年出手二十来个,节奏一直很稳:“市场很悲观的时候我们觉得还是有很优秀的人创业,市场很火热的时候我们也觉得最优秀的人其实也没那么多。“现在跑得好的AI公司基本是2023年投的:Manus 2022年、HeyGen(口述"黑剑”)2021年、Genspark和AI教育项目2023年、Kimi 2023年。
  • 自评留了遗憾:头部公司股份可以拿更多(Manus做得不错,其他几家不是第一大股东);机器人一直谨慎、现在很火还有公司要上市,“至于资本市场的火热与否,这个我觉得也不是我们能够去判断的”。

23. 中美估值差的具体账本

  • 天使轮:Thinking Machines第一轮一百亿、第二轮五百亿美金,基本没有产品,“五百亿美金应该是中国所有的AI创业公司加起来的估值还要多——大模型公司加起来一百多亿,应用公司加起来一百多亿”。
  • 模型层:Mistral最新一轮140亿美金,pre-training基本不做了,benchmark对标的就是Kimi、千问、DeepSeek——而Kimi上一轮才三十多亿美金。应用层:Manus级别的公司(几个月做到一亿美金ARR、几十个点毛利、月增20%)在美国给30-50亿美金;Polo没融资做到两千万ARR,中国第一轮估值八千万美金——美国给30到100倍ARR,中国给10倍。

24. 哑铃配置:最稳的加弹性最大的

  • 假设是能全谱系下注的美国投资人:“一个比较典型的策略是哑铃型”——一头是最稳的OpenAI、Google、Anthropic;一头是中国公司的optionality:“估值很低,如果中国能出来一个AI时代的字节,这里面是可能有百倍回报以上的机会。OpenAI现在再做百倍回报是不是有点难?”
  • 收敛判断:中美估值差会相向而行地缩短,“两年前大家交易的可能是一比一百,现在可能五比一百,最后三十比一百或者五十比一百都是很可以期待的”。

25. AI创投不像移动互联网,更像半导体革命

  • 移动互联网本质是互联网的移动化——分发端变了,底层技术(TCP/IP)没变,“十年前的app现在也可以用”。AI在分发端仍是移动互联网的延续,但技术端类比的是集成电路革命:大capex、密集科研、明显的代际周期。
  • 结构性差异:互联网平台有网络效应所以先发优势(先发我就投你很多钱);AI是比研发的,“你在前面探索了,但我可以用我资金优势、数据优势去做后面的超越”——有后发优势。且流量端已是成熟市场:“现在大家抢的是要从抖音抢时间、从王者荣耀抢时间”,Instagram被收购时13个人10亿美金的小成本创业时代不再。

26. 下一个张一鸣:名字可能已经听过,但他要先跟张一鸣竞争

  • “如果十年之后会出现新的一代像张一鸣、王兴、黄峥这种划时代的创业者,那我们现在可能已经听说过他的名字了”——这也是大家普遍FOMO多投的原因。但戴自己戳破这个假设:“当时没有张一鸣跟他竞争——当时是大家都在成为张一鸣,现在是大家先要跟张一鸣竞争。”
  • 对"事在成之前都不显然"的注脚:字节是把信息分发推荐想清楚了、但执行上大量试错;小红书当年"很多人都觉得看不上,觉得做不大”。现在做app变容易了(web coding就能做),但巨头创始人"又年轻又很能打”——Sergey Brin亲自指挥code red。“AI还有一个很有意思的:所有人都认为AI会颠覆自己、都认为是大机会的时候,对创业公司的难度就会继续上涨。”

27. Year of R之一——Return:投入的账越来越难算

  • 过去几年大家bet的是"对AI的投资在持续超预期”,吸引投资的是潜在的大回报。但现在的投入和修高速公路、铺光纤不一样:数据中心里约百分之五十的投入是算力,四到六年之后就会过时——“这个投资需要在更短的回报周期里面看到有回报的落地”。
  • 两头挤压:模型端新一代SOTA相比上一代的进步在放缓,同时投入大了很多,还"没有能够阻止中国这些开源模型公司以低成本的快速接近”——模型端边际回报在下降;应用端则从去年的低预期高增长,变成了今年的高预期(Meta天天加价挖人就是未来预期很高的体现),而AGI时间表在往后移。

28. 订阅制的天花板:二十年没涨价的Netflix

  • 订阅是AI收入大头,OpenAI ARR接近180亿美元(口述"接近十八个B”)、近6亿DAU、10亿MAU——“作为一个帮助人们获取知识的应用,它的渗透率不低了”,愿意为AI付费的知识工作者渗透率已经比较高。
  • 提价的悖论:“去年或者前年两百美金买到的模型,现在就只能卖二十美金了”——智能进步加token降价,让"更聪明所以更贵"的故事失效。类比:“二十年前Netflix一个月订阅十七美金左右,现在高的二十多、低的几美金——二十年给用户的价值提升巨多,但收费其实没有涨多少。“再叠加Gemini、Meta、xAI的竞争,普通用户订阅制大规模提价很难。

29. 广告电商是存量蛋糕,且比想象慢

  • “广告加电商大部分是一个存量的重新分配”——在线广告盘子与GMV成比例,两个总盘子不会突然翻倍,“存量竞争分蛋糕并不带来新的生产力”。这正是Meta、Google、字节、腾讯对大DAU chatbot高度警惕、重金投入的原因之一。
  • 速度也快不了:Google花了好几年才找到AdWords/AdSense,Facebook花六年才发明信息流广告;且广告和订阅有内在矛盾(付了费为什么还看广告?)。“最近爆出OpenAI进入code red,要把精力花在模型能力的提升而不是做广告上”——对市场普遍预期2026年广告贡献可观收入,“我觉得速度会很不及大家现在乐观的预期”。

30. 程序员工资谬误:替代不等于赚到工资

  • 流行叙事:全球一亿以上程序员、人均年薪十万美金,AI替代后能赚走五万亿。戴的反驳是全集最锋利的一刀:“如果你替代了很多的程序员,并不意味着你能赚到这些程序员的工资,而是说这些程序员原来完成的任务变得不值钱了”——原来值十万美金的工作被两百美金的AI做掉,“它是一个价值有点像是通缩的过程”,就像接线员的工作和工资一起永远消失了。
  • 杰文斯悖论的两面:token成本下降用量必然提升,但"涨了十倍的用量 vs 跌了十倍的价格”——大部分非SOTA任务会以flat rate收费,只有最前沿的任务能按用量高边际收费。“短期看其实不会有那么乐观。”

31. 企业服务慢,万亿之问没有答案

  • Office Copilot是最直接的场景,但"渗透率和收入其实是始终低于预期的”——财富五百强用新技术比大家想的慢,数据、隐私、权限都是关卡;预期明年早期市场渗透到一定程度后,AI企业服务增速也会下来。
  • 总账:红杉David(Cahn,likely)从两百B问题到六百B问题,“现在这个问题已经不只是六百B,已经是一个超过一个trillion的问题了”——每年要多挣回来上千亿美金,“这其实是一个屋子里的大象,越来越严重的问题,大家现在是没有一个特别好的答案的”。

32. 对创始人的信号:负margin增长的时代结束了

  • 年初Cursor的故事是"增长很快margin不重要,甚至可以负margin增长”——一块钱的token卖五毛。现在硅谷的风向已变:“你有没有一个好的margin、好的retention、有质量的增长”——模型公司烧钱可以理解,但应用公司本质是加工token卖附加值,“大家还是会对应用有一个类似于SaaS的百分之五十以上margin的要求”。
  • 辩证的乐观:“当大家需要看回报的时候,真正能创造价值的公司反而会更加stand out”——不看回报时钱多竞争滥,好公司反而被迫卷。

33. Year of R之二——Research:new labs是硅谷的新bet

  • 回报从哪来?“最近这半个月大家普遍都指向了另一个R就是research”——伊利亚的交替论。硅谷出现投资新物种new labs:以研究员为核心、探索与头部模型公司差异化的机会——Thinking Machines、伊利亚的SSI、Reflection,近期的Humans&、Periodic、Isara(音),“一上来就是十亿美金级估值、融上亿美金”。
  • 组织逻辑:做研究需要宽松环境、自由探索、没有KPI和时间限制——OpenAI当年Staney(likely)写的《伟大不能被计划》反映的正是研究lab的状态,“但OpenAI现在已经不是个研究lab了,它已经主要是一个产品驱动、用户和收入matrix驱动的创业公司”。new labs本质是想成为下一代OpenAI,在下一个paradigm shift里占位。

34. Benchmark的下半场:给AI命题的人最厉害

  • Benchmark是训练的优化目标,和能力进步相互推动——SWE-bench之于coding就是例子,“给AI命题的人是很厉害的”。但现有benchmark基本被刷爆,且"人类要去benchmark一个比自己聪明的存在,这个其实是越来越难的”——他很认同姚顺雨(口述"顺宇")提出的"下半场"理念:需要新benchmark去衡量和指导训练。
  • 这也会内化为壁垒:“benchmark有点像高考命题组——当高考题已经被大家刷爆的时候,接下来应该做什么样的题,反而会形成每个公司内部的一个很重要的壁垒。”

35. Year of R之三——Remember:真正的记忆不用带笔记本

  • Memory是AI应用差异化的关键:“如果你没有memory没有个性化,你问AI和我问AI得到的结果都是一样的。“哪怕现在还很初级,同一个问题ChatGPT给他的答案个性化程度已远高于Gemini——因为有三年的聊天记录。
  • 但现在的memory基于retrieval:“好比说你的朋友对你的理解完全来自于他有个很厚的笔记本,记录了跟你聊天的每一句话——真正的记忆肯定是他不用带这个笔记本”,是权重级、在线学习式的懂你。“归根到底最后我们每个人用的AI可能都是一个针对我们的模型”——这是研究的兵家必争之地。
  • Memory还是proactive agent的前提:“好的秘书应该是老板没有说的时候就能够察言观色主动解决问题”——2026年AI应用的必争之地是获取用户尽可能多的context形成好的memory。

36. 硬凑不进R的第四条主线:多模态

  • “我想了很久能不能用一个R来表示,好像没有想到——就是我们看到硬凑啊。“多模态分reasoning和generation两支。生成侧的类比句式:GPT-3.5解锁了ChatGPT、Sonnet 3.7解锁了Cursor,“那Nano Banana Pro、VO3这样的进展,它能解锁什么样的大应用机会呢?“在chatbot里让它生成图片不是自然体验——垂直领域"能不能颠覆Canva”,创作者与广告素材生成是百亿、千亿美金级别的机会。
  • 推理侧在突破边缘:Zero Bench这个视觉推理benchmark(一百个人能做、AI基本做不了的任务)目前最好的模型不到十分,“但我听说在前沿的lab里面可能有能做到六七十分的模型能力”——visual reasoning突破时,交互和AI能做的事会有很多提升。

37. 回应红杉的"Year of Delay”:同意delay,警惕外推

  • 对David的两极分化预判(数据中心delay、AGI推后,但应用高增长):物理世界的delay必然——美国建数据中心、建电力都难,TSMC这类上游也不愿为下游狂热十倍扩产能;AGI的delay与自己"需要研究范式突破"的判断一致。
  • 但对"adoption持续增长"要拆开看:真正跨越鸿沟的只有两个——chatbot和coding(全球程序员AI coding渗透率应该已超20%)。AI的分发渠道是现成的(对比拼多多要等智能手机下沉),所以早期市场扩散极快——“这种早期市场的快速扩张,我认为是很容易让大家对于主流市场的进度过于乐观”,早期用户被消耗完而主流用户没有动力时,会出现断崖式的增长率下降,这就是鸿沟。

38. 泡沫观:最大的革命配最大的泡沫,但还没到顶

  • “人类历史上每次技术革命都带来了泡沫,几乎毫无例外——修运河、修铁路、修高速公路、互联网。AI我认为是人类历史上可能最重要的技术革命,它带来人类历史上最大的泡沫可能也是很理所当然的。”
  • 但泡沫之巅的标志是"不只是好公司很高,烂公司甚至骗子公司也很高”(互联网泡沫被记住最深的是商业模式都不成立的公司估值奇高)——现在还没到,英伟达因为增速快,短期估值甚至很低。“没有泡沫我觉得也不客观。”
  • 交易机制在长短端错配:2023年初很多二级高手因英伟达库存多而做空,“但实际上你长端已经发生了变化"被打爆;现在反过来——短端很乐观(明年后年英伟达预期都很高),“如果大家对AI回报周期变长、AGI到来放缓,这种长端预期变悲观的话,短端它业绩再好可能也都不会是主要的交易因素”。

39. 具体的回调路径:下半年、劳动力市场、OpenAI是trigger

  • “我自己感觉明年如果以美股为代表的话,市场是可能会有一个比较明显的pullback,比较大的时间点可能是在下半年”——条件是劳动力市场软化叠加AI return不及预期,“OpenAI本身的用户和收入的增长会是这个大担心的一个很重要的trigger”。
  • 悲观情绪目前还没传导:“如果传导的话股市走势就不是这个样子了。“现在市场交易的是对OpenAI的担心:Oracle等公布与OpenAI的大单后,大家质疑"你怎么掏得出来一点四个trillion”——你只有五千亿美金估值、融了可能一千亿。Gemini 3发布后OpenAI影子股票(软银、Oracle)大跌,Oracle"跌回到了发那个超大IPO订单的新闻之前——市场认为把这个全都抹掉了”。
  • 姿态声明:strong opinion weakly held——“如果明年出现了新的大的商业化变现场景,或者模型能力得到很大提高,那我也非常乐于改变我的观点。”

40. 好泡沫与坏泡沫:《Boom》的分类学

  • 今年读到的好书《Boom》把泡沫分两种:认为未来会比现在好很多的泡沫(运河、互联网、AR/VR、AI)是好泡沫——“这其实是我们VC天天在做的事情,叫投资未来”;认为未来跟现在完全一样的泡沫(次贷"贷款一样能还得上”、中国房地产"房子会一直涨”、茅台)是坏泡沫。
  • 区别在外部性和参与者:好泡沫的投入变成了光纤、变成了创业公司的资金,参与者主要是VC和创业者这类专业玩家;坏泡沫参与者是普通人、不鼓励改变未来。“泡沫也是人们对未来的期许与雄心壮志的体现……好的泡沫有的时候是必须的”——要做的是在具体投资和创业中规避明显的泡沫损失。

41. 与朱啸虎正面交锋:token涨十倍justify不了估值

  • 小珺转述朱啸虎:“至少三年内看不到泡沫,大家都在讲泡沫的时候泡沫肯定没到,这些论点都是无稽之谈——token消耗量今年爆发十几倍,明年还要爆发十几倍。”
  • 戴的回应不回避:“token消耗量肯定会持续非常快的增长,每年涨十倍是必然的。但同时token的价格也在下降……token量的上涨不能够justify说现在的估值就是合适的,token用量不一定能带来回报的必然到来——互联网里也出现过大量的场景:你花了更多的带宽usage,但你没赚到钱。“至于"大家都说有泡沫就没有泡沫”:你去问很多投资人,有没有泡沫其实还是很多争议的。

42. 空仓但不做空:价值观和杠杆的双重理由

  • 个人仓位:“我个人现在是基本空仓的。“但明确不做空:“做空是一个你希望别人变得很惨的事情,我觉得这个价值上不是一件好事情。”
  • 技术层面:“做空本质上是一件加杠杆的事情,你只能赚到百分之一百,但是你可以亏无限,并且你会很紧张——所以我是只做多,但是我可以降低我的仓位。”

43. 回调下的打法:不择时,投人就是安全边际

  • 二级若持续pullback会传导到一级:“美国的一级融资已经乐观到天使轮一百亿美金了,往上的空间已经不怎么大,但往下的空间还是有不少。“真格的应对是不变:“我们无法决定市场的价格……我们始终的原则就是投资最优秀的创始人,第一轮投的,这个就是我们的安全边际”——呼应巴菲特的"用合适的价格买入好的资产”。
  • 历史经验(他当年是狂奔的一员):阿玛拉定律(口述"Mara Law”,likely)每次都生效——短期高估、长期低估;“回调一定会来,长期也一定会发展”。优秀公司往往成立得早——亚马逊、Google都在互联网泡沫破裂前成立,但"亚马逊股价跌了百分之九十五差点破产”——活下去本身就是宏观帮你清场的机会。心法:“大家都非常乐观的时候做好悲观的准备,大家都非常悲观的时候做好乐观的准备。”

44. 极端假设:范式不突破,现有技术够撑什么?

  • 小珺的压力测试:如果技术不再提升、范式无新变化呢?戴:不是不提高,是从指数级进化到incremental的线性提升——这足以支撑L2级:“一个坐在电脑前面、按照某个流程做事情的人类白领,他做的工作应该都可以做”,因为大部分办公室工作是解决已经解决过的类似问题。
  • 但L3级(AI自主决策、自己承担决策后果)需要长时间——“L3、L4级别的自动驾驶其实已经是比较简单的任务了(二维世界运动),这个花了十几年”。所以"AI让人失业或让我们都不用工作"的预期,确实需要模型能力的进一步提升。

45. 给创业者的四条:前瞻、全球、牌桌、垂直

  • 一,对技术进展要有高质量判断:“你做的应用是为了六到十二个月之后的SOTA去准备的”——杨植麟2023年对长文本、2025年对agentic的判断;Manus团队做agent前先做AI控制浏览器的研究、Pig的加入带来对模型前沿的了解。应用创始人可以不是技术背景,但要有预判,“或者要招一个人”。
  • 二,立足全球市场:肖弘在Manus发布之前没去过美国——关键不是在国外生活,而是懂全球市场的产品设计、审美与运营。
  • 三,不下牌桌持续翻牌:“每年都有新的牌翻出来”——Manus是第三次尝试(Benchmark→Monica→Manus);Typeless从Shopify插件→Max AI→语音输入;口述“黑剑”从电商模特换头(Surreal/诗云科技)→虚拟人。“不要拘泥于某一个事情,持续迭代,留在牌桌上就会有很多新的机会。”
  • 四,垂直壁垒还包括分发:美国做医院transcription的Abridge,大投资方Epic是美国大部分医院的软件提供商——“医院不是简单的你装个chatbot就能用的”,独特分发渠道是垂直里很重要的价值。

46. 看人:四象限、年龄无关、只投引领者

  • 真格内部框架:小天才、老司机、操盘手、科学家四象限——“杨植麟是当年的小天才,现在的老司机”。回应"只投00后"传言:今年确实有小一半00后创始人(更AI native、需要的人更少),但也投了70后的景鲲、张怀林,即将上市的公司创始人也是70后;肖弘和杨植麟都是92、93年——“年龄真的不是判别因素”。
  • 更硬的过滤器是引领者:“每次技术革命真能赚到大钱的基本上还是第一波甚至第一个提出创新形态的创业者”——美国有并购退出,不做到前两名也能赚钱;“在中国如果你不是前三名甚至不是第一名,那可能大家都没有什么赚大钱的机会。“内部的三个关键词:大黑马、引领者、key makers。人形机器人已经150家,“每次跟风的公司还是挺多的”。

47. 团队:攒局是裂痕,室友是信任投票

  • 变化越快团队构成越重要,警惕"攒局”——没准备好、被大潮赶鸭子上架的组队。反例清单:美团核心是王兴同学室友、字节创始团队多是张一鸣室友、米哈游同学室友、Kimi的植麟和Tim是清华同学甚至一起玩乐队。
  • 今年的《F1》电影观后感:“创业真的是像F1赛车一样对团队有极致考验的过程——任何团队上的裂痕、互相不了解、信任不够,都很容易产生崩掉的情况。“名校大厂出来后,“周围这些优秀的人有多少人愿意跟你干,尤其在一切都还不确定的时候——这本质上是一种leadership和说服能力”。

48. Manus的人事内幕:所有VC都看过Monica,但都不投

  • Pig:高中做猛犸浏览器被真格投资、后卖给第四范式,来真格做EIR帮看项目——“他还是更像一个chief scientist,对技术非常狂热,但他确实不想去管人”;张涛:大学写博客圈认识、跟老王(王慧文)做光年之外,被并购后在等"真正属于自己的大机会”,2024年加入还在做Monica的团队当产品负责人。
  • “说实话Monica当时中国基本所有VC肯定都知道,很多人都看过,但是大家都不投,都觉得是一个套壳”——真格的逻辑是团队总能干出点什么。戴给过一个自认关键的产品建议:Manus最早是Devin式三栏布局,“我当时觉得普通用户会觉得三栏太复杂,建议改成更像chatbot的布局”——AI干活的区域默认折叠、点击再展开。

49. 错过王星星的反思:投人就是刻舟求剑

  • 当年有同事见过王星星但没推进,“这肯定是我们当时看人哲学的一个很大的漏洞”。修正后的过滤器是obsession(沉迷、痴迷):“王星星是痴迷做机器人的……他在B站上的机器人视频就很火,他一定是很早就脱颖而出的人。”
  • 但保持诚实:“很多时候是因为我们已经知道了宇树和王星星的现在,去反推他的当时——投人很多时候就是刻舟求剑,你只能根据现在优秀的创始人去反推他早期的特质。“另一个不见第二次的红线:人品问题,以及"半推半就型的创业”——他最关注创业的内生动力;对他自己而言,“让普通人变得很强大的产品很伟大"加上不想在大公司做棋子,创业是很自然的答案,不用说服自己。肖弘同样"创业是一种注定的生活方式”。

50. E人I人与白马黑马灰马

  • 小珺借朱啸虎的"不适合投I人"发问。戴的观察:“很多大神的创业者是I人,但是他学会了E人的技巧”——深度思考得到非共识判断需要I,谈判招人需要E;“王兴、张一鸣、黄峥应该都是I人吧”。千亿美金公司里马老师(马云)是E人。
  • Club deal的风险框架:白马(共识好、贵但胜率高)能赚钱,黑马(没人投、便宜)也能赚钱,“我们一直要警惕的是灰马——白马的价格,但胜率其实就跟黑马一样”。杨植麟当时是大模型公司里估值最低的,“你可以认为它是大模型公司里边的黑马”;Red(原音称“Red”)当时也是黑马——甚至有人说他是草根创业者,“一个华中科大毕业、二十多岁做SaaS公司卖了几个亿的创业者,居然是草根创业者?“最好的情况是"实际上是白马,但你以黑马的价格买到”。

51. 2026年的四个方向bet:token用量、多模态、memory、voice

  • 给LP的AGM四判断:当token价格降十倍、用量升十倍,什么让大家用更多token?——agent是大逻辑(Manus年初出来时"比一个chatbot要多用一千倍的token”);video与图片的生成理解;memory带来的个性化context;以及voice——“声音是我们跟人和跟计算机交流最自然的媒介”,Siri、Alexa是杀手应用的雏形但当时AI太笨,今年Plaud、Granola、Wispr Flow(口述"Whisper Flow”)、Typeless证明语音交互到了魔法时刻。
  • Typeless的具体体验:按一个键语音输入,说"我说三点"它给你结构化的1、2、3;选中文字说翻译就翻译——“更大的愿景是把Siri没做到的事情做好,你跟一个非常强大的AI之间只有一个键的距离”。
  • 杀时间应用为何还没来:“你要从抖音、王者荣耀抢时间,你的对手很强;但生产力应用对比的是没有智能”——加上情感投射要改变人性,“可能不是我们这一代,是下一代”。

52. 智能充沛时代的生存指南:agency、taste与OOD

  • “我们要学会在一个智能很充沛、很丰盛的世界里面生活。“人类历史上智能一直是奢侈品——能大规模动用聪明人的只有顶级企业和君王(看《大明王朝1566》才有国师),现在二十美金就买到好多智能。执行力变廉价后,agency和taste变得最重要:你要做什么、AI给你三个方案你选哪一个。
  • 思维方式的迁移:从线性到并行(“给不同的Agent不同的任务,自己主要负责给AI牛马下指令——做好AI的老板”);从"我就差个程序员"到多去try;用一次性代码解决一次性问题;以及永远用最先进的工具体验未来——他ChatGPT发布当晚用到凌晨四点,“最早用ChatGPT的人、最早买iPhone和特斯拉的人,都是提前感受未来”。
  • 最深的一条来自AI训练本身:OOD(out of distribution)——“如果你做的事情、你的思想基本上都是well in the distribution,AI可以很好的复制。毕加索、莫扎特能产生非常不一样的数据,所以才会成为大师。我们对人类这样一个集合体做出的贡献有多少是在已有的分布之外?”

53. 彩蛋·超级入口与萨提亚的AGI标准

  • 录制前闲谈进入更锋利的部分。ChatGPT想讲超级入口的故事?“超级入口是中国投资人和创业者非常熟悉的概念,美国其实并不追求大而全”——大DAU产品最好的变现就是广告,而"当所有大家都去花很多钱训自己的模型的时候,你分的这个蛋糕的百分之八十还是同一个蛋糕”。
  • 援引萨提亚:什么是AGI?“AGI就要能让地球的GDP以十个点的增速来增长——你要创造新蛋糕,不能只是瓜分已有巨头的蛋糕。“广告和电商有点像分已有的蛋糕。为什么大家愿意投千亿美金?基于AGI假设:极强生产力加成(发现新药、新科学)+投入形成别人进不来的壁垒——“但现在发现,第一超级AI还没有来,第二你无法阻止中国公司很快做一个开源的、你的百分之八九十能力、百分之十成本的模型。那你的投入是不是还要这么继续?我认为明年是一个关键年。”

54. 彩蛋·容器论:Chatbot是AI 1.0,别拿上个时代的形态定义自己

  • ChatGPT"挺像一个AI 1.0的产品”——一问一答很general但不够主动、不够多模态、复杂任务里很别扭。历史规律:技术进化需要新的产品和交互——PageRank配极简search box,推荐引擎配抖音的上下滑,“新的容器才会给用户带来完全不一样的体验”。Chatbot是2022年底语言模型最适合的容器,“再过五年它还是最适合的容器吗?不一定”——1.0形态的王者未必是2.0的王者,互联网1.0最强的雅虎就是被搜索引擎这个2.0干掉的。
  • OpenAI自己的五步阶梯:Chatbot、Reasoner、Agent、Organization、Innovator——最适合agent的形态可能不是chatbot。“Manus有点像给大家一点preview,剧透一点2.0时代的agent会是什么样”——可视的sandbox、画布、agent自己操控的环境。
  • 对AI浏览器的判断(Manus探索过又放弃):“当你叫浏览器的时候,你就面临要符合大家对浏览器已有的期待”——Arc很难说服用户就是例证;移动时代想做"移动上的某某某”(浏览器、搜索)的都没成,成的是抖音这种新物种。“不要拿上一个时代的产品形态去定义自己——你可以满足一样的需求,但它叫不同的东西。”

55. 彩蛋·OpenAI是泡沫吗:七分啤酒三分泡沫

  • 分两种泡沫:完全没价值被炒高(Web3、元宇宙式)vs 高估。“OpenAI显然是现在用户最多、收入最多的AI应用,它下面的价值是有很多实在的,只是估值有可能有很多调整的空间——这至少不是那种下面没有啤酒的泡沫。啤酒和泡沫的比例是什么?有时候七分啤酒三分泡沫,啤酒没有泡沫也不好喝;有的领域可能纯泡沫没有啤酒,那就很危险。”
  • 烧钱的死结:如果大家都卖广告,“OpenAI卖广告显然是不划算的——抖音的边际成本很低,你还有inference cost、那么贵的人、那么贵的训练成本,为什么要在你这卖?“推理成本会随平衡点下降(翻译不需要越来越强的模型),但训练的固定成本不会少太多——“这可能比互联网在很长一段时间内都还是一个边际成本更高的生意”。用户付的二十美金不变,但"你肯定不会说三年之后的二十美金还买来现在这个二十美金的智能”。

56. 彩蛋·ChatGPT vs Google:品牌加memory,对抗资源加分发

  • “我觉得Google是很有可能会完蛋的”——但立刻加上另一面:Sergey Brin进入founder mode、合并DeepMind和Google Brain全力做Gemini,“它其实表现出了一个在位公司非常强的竞争力……你试想如果他反应慢一拍,可能现在就很难扳回来了”。这不是每家在位公司都能做到的。
  • 反方向也没定论:“我并不认为现在Gemini就已经确定了它可以阻止ChatGPT的增长”——ChatGPT留存远好于Gemini,一靠memory,二靠品牌:“对普通用户来说,ChatGPT可能就是AI的代名词,就跟互联网早期雅虎就是互联网的代名词一样。"《跨越鸿沟》的龙卷风暴理论:技术进入主流市场时的number one会获得大量自然水用户,第二名很难竞争。他自己已经用ChatGPT取代了搜索引擎——只有要具体link时才用Google。
  • 对Meta威胁反而没那么大:“还看不到ChatGPT对人们社交关系的影响,这是Facebook、WhatsApp的基石”——但长期十亿DAU高时长的应用必然挤压所有大DAU广告生意的时间盘子。

57. 彩蛋·工具没有网络效应,就会收敛到最好用的那个

  • 为什么AI产品都没有网络效应?“工具型产品一般都缺乏网络效应”——例外是Excel/Word靠文件格式形成的网络效应;搜索引擎是规模效应加品牌(query越多长尾优化越好),切换成本又近乎为零,“没有任何理由去使用一个第二好的搜索引擎”,所以第一名占九成。Chatbot很可能走向类似格局——除非memory建立起飞轮:“也许以后Gemini模型更强大,但因为你没有记忆,我还是能提供更好的体验,这个是很有可能发生的。”
  • 这就是三年前假设的坍塌:“当时大家觉得我投一百亿一千亿,得到一个你没有的模型就可以一直领先——但现在你不能阻止一个中国公司拿出来一个相当的模型”,模型成了同质化商品,而OpenAI又没有Google当年的空白竞争环境——“它一上来竞争对手就是Mag Seven这几家超大型公司,包括字节”。也因此"中国模型公司的价值是被大大低估的:全世界能拿出八九十分模型的公司没有几家,在美国是千亿美金估值,中国可能是几十亿美金”。

58. 彩蛋·Anthropic、Cursor与先驱变先烈

  • 对Anthropic:“当它没有自己的产品的时候,它会有很大的风险——只调API切换起来很快,就好像你造一辆好车,发动机换掉其实影响没有那么大。Claude Code是很重要的一环。“最近开发者反馈:可能是Opus 4.5(口述音近“OPENS 4.5”),虽然SWE-bench没高多少,实际体验好很多;Gemini 3"得分很高,但实际使用中可能反而比不过Anthropic的模型”——benchmark又一次高分低能。
  • 对Cursor:“感觉还是有点难”——Codex、Antigravity(原音称“Windows Server Team”去Google做的)加Claude Code,三家基础模型公司都有了自己的coding agent还通过云分发。Perplexity是前车之鉴:AI搜索的先驱,但当ChatGPT、Gemini都把搜索带上,“它的天花板就很明显了,甚至会被模型native的产品逐渐消磨掉”——共同病灶是"用户得到的和模型给它的差别不大”。应用要把context层和工具环境层的增量价值做厚,“壳"才不薄。

59. 彩蛋·中国大模型公司的出路:都得解决R

  • 点评Kimi、DeepSeek、MiniMax、智谱?“这个又太得罪人了哈哈”——但给了方向:“只做大模型可能还是比较难,模型最后要变成产品,不管是出海还是有中国特色的产品,都得解决R的问题——我可以钱还没赚来,但我能看到钱是可以赚来的。“中国还有"羊毛出在猪身上"的间接商业模式可选。
  • 牌桌论收尾:“AI每年都会有很多新牌局,这个牌局错过了等下一场——肖弘第一张牌是Monica,第二张牌就是Manus。移动互联网到了后期一年可能就一张牌,甚至都没有牌”,那时创业者才真正尴尬。new labs(米拉、伊利亚、李飞飞)那种科研导向的组织,“钱不是越多就越好,甚至很多人认为科研型lab适不适合投资都是一个问题”——中国也没有太多这样的标的。

60. 快问快答:牛肉粉、天坑、鼻子与书单

  • 常德牛肉粉(圆粉,跟长沙扁粉不一样);最爱的地点是墨西哥坎昆的天坑溶洞——顶上一束光打下来,“柏拉图有岩洞的暗喻……如果能在洞穴上凿开一个缺口打下来一束光,那是对人类的一个启蒙”。
  • 冷知识:你其实看得见自己的鼻子,是大脑不断把它抹掉了——戴上反转视觉的眼镜几天后大脑会自动"正过来”,“我们看到的世界并不是真正的世界,是我们大脑经过处理之后的世界”。
  • 年读约一百本书。年度推荐《智能简史》(从海洋古细菌讲到ChatGPT-4的诞生,一月份读的,推荐给了姚顺雨);《第一只眼》的光开关理论——寒武纪三叶虫进化出眼睛,“在一个所有人都是瞎子的世界,突然有一个生物进化出了眼睛”,push整个生态大发展,像极了技术进步推动应用的过程;必读还有《跨越鸿沟》。论文只敢列耳熟能详的AlexNet、Transformer、Bitter Lesson(口述“Beat Lesson”)——“我们并不假装我们懂这个技术本身,我们更多的是跟不同的优秀人去聊,尝试找到共同的规律”。今年读R1论文(口述"R Y”,likely)时觉得基于结果的reward"理论很优美”,但"我说实话没有能力判断”。基于当下认知最关键的bet:“中美AI的差距——技术上、应用上、商业化上——会缩小,这个gap最宽的时候已经过去了。”

Verification Notes

  • Raw captions leave several entities uncertain; the digest preserves that uncertainty for “O P E N S 4.5,” “Dreamline,” “达瑞,” “Red,” and “Windows Server Team.” 王星星/王欣欣 also varies in the raw hearing.