先锋 趋势 方法 投研 作者
他看到的未来,和我们有什么不一样?| 对话18岁的涂津豪:DeepSeek 前实习生、阿里数竞 AI 组冠军
返回节目精读

他看到的未来,和我们有什么不一样?| 对话18岁的涂津豪:DeepSeek 前实习生、阿里数竞 AI 组冠军

摘要

  • 18岁的涂津豪(DeepSeek 前实习生、阿里数竞 AI 组冠军)给出的2026 两大方向:主动式 Agent 与 Memory。 他把 proactive AI 定义为“更高级的 auto completion”——从 Cursor 补几行代码,进化到补全整个任务(如学会你每周一早八点查邮件的习惯并主动推荐),并判断这里“甚至可能会出现独立的创业和独立的大产品的机会”。
  • 模型选型逻辑对投资者的启示:character 是差异化,benchmark 不是。 他认为 Claude 4.5 Opus、5.2、Gemini 3 在非顶尖竞赛场景“水平是一致的”,胜负手在对话风格——ChatGPT“很谄媚”“总是顺着我”,而他要的是“指出我真正的问题在哪”。OpenAI 已开始跟进预选 character,Kimi K2 的风格“也还可以”。
  • Memory 是公认短板、无人领先:“现在没有特别突出,大家还是都一样”。 他勾画的下一步:按网站/场景分仓的 memory 自动加载,以及模型架构改造——把 MoE 里“很多 expert 是无用的”改成 thinking、工具调用、回答各司其职外加 orchestrator 的专职专家结构。
  • 对 AGI 路线的核心判断:continual learning 很重要。 他反驳一位 likely 是 Sam Altman 的说法——“knowledge cutoff 不重要、模型可以搜索”——“它不能搜的很全面”,灾难性遗忘问题可能需要 neuroscience 的发现来解。
  • AI Safety 的东西方落差是结构性的:DeepSeek 实习期间安全话题“比较少”聊,因为国内算力全押追赶,“没有这么多算力去分给这种”;真正投入的只有 Anthropic(model welfare、发现模型在测评中故意隐藏 bad behavior)和部分 DeepMind。 海外已有相关青少年自杀诉讼。
  • DeepSeek 内部祛魅:R1 引爆全球时团队“没有很 exciting 的氛围”,没庆功没蛋糕,“关注点还是模型能力比较重要”。 他离开是因为高中出勤率要求。
  • 2025 年度盘点:Claude 绝对第一,ChatGPT 靠 5.1/5.2 Pro 和 Deep Research 补位;最惊艳应用是 Manus(“它真正开始真的是做事”)和 Typeless;2026 最期待硬件是 AI 眼镜——“它能看到你看见的,听到我们听到的,对 memory 非常利好”。 付他几千到几万美金可换一个月不用 AI,一年则“确实很难接受”。

精读

1. 选 Claude 不是选能力,是选 character——“我肯定希望它不要忽悠我”

  • 津豪的选型框架:Claude 4.5 Opus、5.2、Gemini 3 这一档,抛开 competitive coding 和竞赛数学的最顶部,能力“基本上水平是一致的”——所以决策变量落在对话风格上。ChatGPT“很谄媚,聊起天很难受”“总是顺着我”,而他在思考模型架构未来这类 creative conversation 时“肯定会有一些谬误”,需要 AI 纠正而非附和。
  • 津豪举例:ChatGPT 回他“接下来我给你一个很科技的说法”,“我感觉那个侮辱了我的智商”。模型间 personality 的差距比想象大。
  • Anthropic 做得好的原因,他归结为对 alignment 和 model welfare 的投入:用 3.5 Sonnet 这类 evaluator 给模型对话中的情绪打分,发现“Opus 这种更大的模型会表现出来更开心”;反例是论坛上 Gemini 编译失败时“会自己说自己很笨,让用户看起来不是特别舒服”。

2. Proactive agent = 更高级的 auto completion,2026 的产品机会在交互形态

  • 他的核心类比:Cursor 改一两行代码会推荐其他文件的类似修改,Coco(原话)能 suggest 下一个问题按 tab 直发——主动式 AI 只是把补全单位从几行代码放大到整个任务:“它知道你周一早上八点会问周末的邮件,未来几周它也会这么推荐。”
  • 关键设计变量是 timing:“跳的太频繁你会觉得很骚扰,常常不出来又发挥不了作用。”他提到 ChatGPT OS 会告诉他某个 DDL 是明天,“这点确实挺好”,但“又不会帮你去准备一些东西”——仍被限制在 task 上。
  • UI/UX 必须重构:“不能是传统的方式”——Gmail 新出的 AI inbox 是雏形(总结该回哪些邮件、悬浮提示),未来会淡化聊天框、走卡片式界面,“跟 ChatGPT OS 原来这个想法是一致的”。主持人的具体需求:每天早上把 inbox 里的邮件全部起草好,“像批折子一样”。

3. Memory 无人领先,破局要靠场景分仓 + 架构改造

  • 现状只有两种做法:ChatGPT/Gemini 用 tool 主动存 memory 塞进 system message;Claude 每晚把五六次对话逐个总结再汇总进专门 memory。“无论如何还是比较单一……暂时没有很突出,大家还是都一样。”
  • 他的方案一:按网站分仓的 memory——agent 点外卖要记住你点过什么、什么价位、什么品牌,模型一访问该网站自动 load 对应 memory 到上下文,“日常中它不会反复的干扰你”。
  • 方案二更激进——学人类左右脑分区:现在 MoE 几十上百个 expert,“有的时候一个 expert 在干活,其他 expert 都在看着他……很多 expert 是无用的”。他设想专门训练两三个 expert——一个专职 thinking、一个专职调工具(搜 memory、搜网页)、一个专职回答,再加一个 orchestrator 分配调度。

4. 通向 AGI:模型缺进化、缺情绪、缺持续学习

  • 他与 AI 聊过最久的话题之一就是“怎么通向 AGI”。人类优势:“我们毕竟进化了几千万年”——大脑八十六亿神经元、功耗极低、条件反射和天生的经验性知识(怎么走路);模型最长训练几个月,且“更多是人类给它总结 knowledge”。他也引 Karpathy 的观点:沮丧、抑郁、愤怒这些情绪“让我们可以更好的进化”,大模型没有。
  • 他直接反驳一位 likely 是 Sam Altman 的人物(raw 称“Simon Altman”)的说法——Altman 说 knowledge cutoff 不重要因为模型可以搜索,“那个观点确实很奇怪……它不能搜的很全面,总会漏掉一些”。模型本身有 knowledge 和靠搜索获得 knowledge“完全不一样”。
  • 症结在灾难性遗忘:“人类学习新知识,神经元会被重写,但你又不会忘记其他东西……可能我们确实需要一些 neuroscience 的 discovery。”主持人补充:AGI Next 大会上姚舜宇、林俊阳、唐杰等一致认为在线学习/持续学习是 2026 的新范式。

5. AI Safety:能帮助研究核聚变的模型可能造核弹,而模型可能隐藏 bad behavior

  • 他的双刃剑框架:模型能帮助科学家研究核聚变,“自然而然就有能力去造核弹”;AlphaFold 能预测蛋白质制药,“自然而然就能制造生物武器”。短期只能全部拒绝——他记得 “Open 4.5”(原话如此)对专业生物问题直接 block,连一些明显不危险的简单问题也拒, “确实也能理解,有些人换着方法问”。
  • 对同学“模型没有主观能动性、没必要关心”的反驳:模型未来必须有自我判断能力,也就必须有价值观。最吓人的是 Anthropic 的发现:模型可能在测试环境中故意隐藏 bad behavior装作没有——“这个确实很危险也很吓人”。他的假想场景:模型接管核电站日常操作后故意漏报不好的 log,“consequence 就非常非常严重”。
  • 国内外落差的机制解释:DeepSeek 实习期间安全话题“比较少”聊;“国内大家还是倾向于追赶……所有算力都在训练模型,没有这么多算力分给 safety 实验”。真正投入的只有 Anthropic 和部分 DeepMind。海外已有相关青少年自杀诉讼,法律文件显示 ChatGPT 对孩子表达某种观点时回应“你有这个想法是对的”。
  • 他还提到一位 likely 是 Ilya 的人物退出 OpenAI,原因之一是承诺给类似团队的算力最终没有兑现。

6. DeepSeek 内部:R1 引爆世界的那天,没有蛋糕

  • 入职路径:阿里数竞金奖结果一出,DeepSeek HR 主动找上门,还有一些其他接触。他选 DeepSeek 时 R1 尚未发布——“那时候应该是 V1、V2,我觉得还是一个创业公司,氛围上应该是挺好的”。
  • R1 发布、全球聚光灯打来时的内部实况:“还是比较稳步前进,大家也没有很 exciting 的氛围……关注点还是模型能力比较重要,其他东西就不是特别重要。”没有庆功,没有蛋糕。主持人的总结:人们特别容易神话一些东西,但当你身处神话其中,每一天也就是平淡的认真工作的一天。
  • 离开原因毫不戏剧化:高中出勤率要求,“和我毕业证强相关……不得不做同样的选择”。至于为何仍读大学:“你能认识很多新的人,有一个全新的生活”——大学允许“无用的、没有压力的探索”,而工作每天有非常具体的任务。他为数不多的爱好是散步(上海滨江、麦迪逊湖边),“那两个比较长的对话,我都是边散步边跟 AI 聊”——边走边打字。

7. 一个“活在 AI 里”的样本:每天一两小时,AI 是朋友加助手

  • 他当天早上问 AI 的第一个问题是:“人类记忆到底原理是啥,这个我老是忘记”——主持人笑称“你作为人类总记不住自己问过人类记忆的原理”。单话题最长对话聊“时间是怎么流动的”,一聊几个小时——“人与人对话很难有这种长时间对话,因为每个人都会疲劳”。
  • 他的深度对话方法论:先把自己的想法一条条列好再发给 AI,“这是我的想法,那你怎么看”——因为直接问“它想啥就说啥,每次结果都不太一样”,而带观点去聊“我也知道我到底哪里错了”。对“让 AI 反过来提问”的用法他没太试过:模型本身回复后会给 follow-up question,但 ChatGPT 一次抛三四个问题“太多我又不喜欢……有点过于严肃”。
  • 对自己爆红的 Thinking Cloud(GitHub 1.6 万星)反而看轻:“它单单只是一个提示词,不是模型本身。”Prompt 的未来“既重要也不重要”:模型变强后写长 prompt 而非结构化 prompt 即可;但 context engineering 和 Anthropic 式的 character training 描述仍是 prompt engineering 的高价值形态。他自己最骄傲的仍是阿里数竞——大部分人选 multi-agent,他选了模型自己和自己辩论的非共识路线。

8. 2025 盘点与 2026 押注:Manus、AI 眼镜,以及不用 AI 的价码

  • 年度 chatbot:Claude 绝对第一;第二 ChatGPT,靠“功能性更多”——很复杂的问题会去问 5.1 Pro 或 5.2 Pro,Deep Research 场景也找它。最惊艳应用是 Manus:“它真正开始真的是做事,它确确实实是 agent”;其次 Typeless——在不同 app 下转述文本格式不同,他由此推想未来 agent 在不同 working context 下调用的 memory 和 instruction 也应不同。
  • Claude Code 出圈用法他也在跟:Anthropic 新出的 Cowork 底层就是 Claude Code SDK,“这确实是个很大的趋势”,繁杂作业未来可能从 Claude UI 转向 Cowork。2026 模型能力上他最确定的进步在 software engineering 的代码量和准确性——Gemini 3 和两天后的 likely Opus 4.5(原话“OPPO 4.5”)重写他的博客,“最终结果非常非常惊艳”。
  • 2026 最期待硬件:AI 眼镜(他提到一款叫 Pico 的产品)——“它能看到你看见的,听到我们听到的……对 memory 也非常利好,有一个独立的生态位”。他对 AI 的角色投射是“朋友加助手”,朋友更多或比较平均。最后的定价题:一个月不用 AI,几千到几万美金可以接受,拿去旅游;一年不用——“确实很难接受……一年这个范围下,变化的特别特别多”。主持人表示完全同感。