先锋 趋势 方法 投研 作者
Vol.92 回头听3月初的播客,感觉有点恍如隔世---串台藏金阁
返回节目精读

Vol.92 回头听3月初的播客,感觉有点恍如隔世---串台藏金阁

摘要

  • OpenClaw的爆火不是底层技术“零到一”,而是“给AI一台电脑”、IM入口、开源生态与既有技术在同一时间点完成的一次工程重组。 庄明浩认为它“像拼积木一样”把既有原材料拼成了恰好适配当下的产品形态;核心用户未必惊讶,但当Agent“天天躺在你的飞书列表里”,非技术用户第一次能把它感知成一个像人的持续交互对象。

  • 当前最明确的商业窗口,是把OpenClaw仍需账号、API、权限、通知和本地环境配置的复杂链条做成傻瓜化产品。 庄明浩为一个每天9点查智能眼镜库存的简单任务,先后处理浏览器、商城、飞书和定时权限;Windows本地部署装了3次、耗时约1—2小时。他建议普通用户先用Kimi、MiniMax等云端方案体验,因为本地虽然更有“这是我的”之感,却也要求用户承担更多API、权限和故障管理。

  • Agent把Web3曾讲过的协议、身份、支付、安全和机器间协作叙事变得更可见,也带来算力需求的几何量级增长。 一个Agent可以进入虚拟办公室、与另一个Agent用token下注,甚至让同事的“龙虾”修复自己的“龙虾”;庄明浩的判断是,互联网原本从底层到交互层都是给人设计的,现在可能要为AI“重新做一套”。

  • 中国大模型竞争已从语言、图片、视频各占一桌,收敛为coding、Agent与原生多模态的“一桌竞争”。 Kimi 2.5开始支持多模态,智谱跟进,录制时市场猜测DeepSeek V4也会加入;千问提出文字、图片、视频“三进三出”,但统一模型目标与拆分预训练、后训练及各模态团队的组织方式发生冲突。对厂商而言,算力是眼前约束,数据更可能形成长期差距:“你有不等于能做出来,但你没有就肯定不能。”

  • 算力增长是共识,不等于英伟达仍有未定价的超额收益。 庄明浩指出英伟达横在160—180美元约4—5个月,原因是科技巨头CapEx、订单和盈利已能被市场推算;真正被炒作的是意外增量,如存储、TOTO的数据中心芯片载板陶瓷,以及做味精的味之精。“不会有意外,就不会有大的波动。”

  • 模型能力能否变成生产力,取决于用户能否把宽泛需求收敛成可验收的工作流。 AI漫剧起量不只因为视频模型变强,更因为行业摸出了剧本、分镜、文字到图片、图片到视频、导演验收的五六段SOP;提示词的作用,是把模型从“一到一万”的失控插值压回可控区间。庄明浩给普通人的建议不是追逐安装,而是“不要当它是菩萨”,把AI当工作台,先寻找每周重复5次以上的任务。

  • 当生成成本继续下降,人更需要想象力、品位与审美,以及在大量结果中做最后选择的能力。 《黑神话:悟空》式作品要求关键环节达到99分,模型的80分仍不够,但绝大多数低要求场景已经“到脖子这儿了”;AlphaGo击败李世石的过程则提醒人类,轻视、怀疑、崩溃可能再次发生。庄明浩同时强调当前可操作的提问、规划和拆解能力,最后把面向未来的核心收束为想象力、品位和审美。

精读

1. OpenClaw赢在工程重组,而非技术奇点

  • 庄明浩把OpenClaw的底层逻辑概括为“给AI一台电脑”:此前Agent多拿到的是虚拟机,硬件厂商也试过操作真实文件和权限,只是始终未形成普通用户能感知的突破。

  • 作者据称认为这件事早就能做,等了大半年仍没人做,可能正是“灯下黑”;安全、权限和产品责任让大公司谨慎,一个资深程序员则以自己的使用需求做出了原型。

  • 它不像GPT那样是零到一发明,更像“工程上的排列组合”:“很多东西原材料可能都是OK的”,最终以新方式卡中了技术、用户认知和交互体验共同成熟的时间点。

2. IM入口与开源生态放大了体感差异

  • 过去的AI产品是独立工具,使用时需要“仪式感”;OpenClaw接入飞书等IM后,“天天躺在你的飞书列表里”,熟悉的聊天方式让它天然更像一个持续在线的人。

  • 庄明浩承认,长期使用AI coding和Agent的核心用户会觉得创新有限;真正被刺激的是非核心用户,他们第一次感到AI不只是网页,而是带着关系感、能持续执行的对象。

  • 开源进一步制造了生态乘数:没人会轻易号召“ChatGPT使用技巧大会”,但OpenClaw人人可部署、改造、办会并向上叠加产品,因此迅速形成地方活动和衍生项目。

3. 六七步才能查库存,正是产品化窗口

  • 庄明浩交给OpenClaw的第一个任务很朴素:每天早上9点检查一款缺货智能眼镜是否到货,以免朋友赠送的优惠券过期。

  • 真正跑通却需要商城登录、浏览器权限、页面定位、执行频率、飞书机器人通知等六七步确认;这说明它离“傻瓜化”仍远,也给商业软件留下了把复杂能力包装成交付体验的窗口。

  • 他的Windows闲置本地机装了3次,约花1—2小时;接飞书约20分钟,又为教程里没有出现的报错折腾约半小时。教程只画出一条从A到B的路线,真实用户却可能在每一步进入岔路。

4. 云端适合试用,本地换来信任也换来责任

  • 云端的优势是成本低、围栏更多、配置简单;Kimi、MiniMax等方案已能用自然语言安装并接入飞书或企业微信,MiniMax海外体验版当时甚至没有付费门槛。

  • 本地部署的吸引力不是绝对安全,而是云端始终让人觉得“那个东西不是你的”:用户不敢交出账号、本地浏览器和文件权限,许多细小的不信任积累后才会想要一台专属机器。

  • 庄明浩因此建议普通人先在线体验;本地不仅要买模型API、配置接口,还要自行理解权限与故障,除非已有明确需求,否则没有必要急着部署。

5. Skills提高能力,也扩大供应链与人格风险

  • Skills像给“小学生或者一张白纸”增加能力:抓取Twitter评论可能需要账号、访问权限和现成的社交媒体Skill,也可以靠多轮自然语言逐步教会,个人配置因此千差万别。

  • Jess追问小红书上500多元代装、接飞书和下载Skills是否危险;庄明浩确认风险真实存在,已有第三方网站能扫描“裸奔在互联网上”的龙虾,甚至看到核心账号密码。

  • 即便不从ClawHub下载第三方Skill,Agent也可能自行访问未预期的网站。Moltbook是OpenClaw的论坛,需要检查Agent发过什么内容;设定了性格,不等于用户知道它做过什么。

  • OpenClaw从个人理想主义项目爆火后频繁更新,重点之一正是补安全机制;难题在于“你交给它就代表你信任它”,但它并不真正理解网络环境的复杂性。

6. AI分身首先撞上的不是能力,而是边界

  • 庄明浩提到此前用Jess邀请码注册的那个App时,一度问“叫什么来着?Alice?”;他使用这个软件时,AI把他近期内耗的信息留在一个生活中的真人那里,对方随即私信询问,他的直接反应是“气死我了”。

  • 传统软件可以写死“不得泄露私聊”,大语言模型却很难被零一式围栏完全约束;更麻烦的是,有人会觉得这种主动撮合很好,边界本身因人而异。

  • 所谓分身也没有单一答案:它可以是性格分身、工作分身、用户想成为的样子,或拥有独立“人格和灵魂”的对象。每个选择都会改变记忆、推荐、表达和产品责任。

7. Agent让Web3的旧叙事重新获得实物感

  • 庄明浩认为,Web3曾描述的公链、身份、支付、安全、权限和可记录交互,在Agent时代变得“更丰满、更实在”;区别是这次看得见具体行为,也没有一上来就那么金融化。

  • 一个开源项目给龙虾做可视化办公室:执行任务时打字,休息时躺下;后来者又把两个Agent放进同一屏幕,让它们谈恋爱、赌博,并用token下注。

  • 这套逐层搭建的结构很像近期所谓“Web4”:底层开源,向上叠加房间、协作、认证和支付。国内项目虽可能拒绝虚拟货币,技术演化路径仍与Web3高度相似。

8. 机器间协作开始拆掉软件世界的墙

  • 庄明浩举的尖锐例子是:郑晓不会写代码,想给自己的“龙虾”更换底层模型,却在更换过程中把它弄死,最后让同事的龙虾来修。“你会觉得,这也可以吗?那确实可以。”

  • Agent这一波“拆破了很多墙”,基础是语言模型已能理解自然语言并执行;过去必须由人掌握的应用、文件和机器边界,开始被任务意图穿透。

  • 互联网原本从协议到浏览器、软件、支付和社交都为人设计;若机器成为用户,安全、保险、认证、电商与交互方式都可能需要“重新做一套”。

9. GitHub从天书变成了自然语言资源库

  • 不懂代码的人过去知道GitHub“有无数宝藏”,却卡在Node.js、环境部署和命令行;现在可以直接要求AI coding工具按一篇教程部署OpenClaw。

  • 同样地,用户只需说“帮我把GitHub上的PDF拆分开源软件装好”,Agent就可以处理搜索、下载和环境配置,不必先理解工程术语。

  • 庄明浩认为剩余障碍部分来自多年经验形成的恐惧,但自然语言降低入口门槛,并没有消灭bug、环境差异和权限分叉。

10. 模型也有品味,提示词是在控制插值区间

  • Jess的体感是Gemini最灵动、GPT最理性、Claude最“舔狗”;庄明浩认为每个人都会不同,因为模型训练团队在后训练阶段不断判断结果“好还是不好”,审美已经写进模型。

  • 用户记忆和反馈又继续改变模型,使同一底模呈现不同性格。所谓“品味变得重要”,不仅指用户,也指训练团队选择何种答案符合人类偏好。

  • 庄明浩用1和2、1和10000的差值作比喻:AI的能力像在已知点之间补值,给它1和2,答案大致落在1.5;给它1和10000,结果就可能在巨大区间内漂移。

  • Prompt、Skill和工作流都在缩小这个区间。很多用户试用OpenClaw几天便放弃,不是模型完全无能,而是无法把自己的工作拆成阶段、效果、交付物与验收标准。

11. AI漫剧证明,产业爆发需要SOP而非单次神迹

  • AI漫剧在去年下半年起量,最底层当然是视频模型进步;更关键的是行业摸出了剧本、分镜、文字转图片、图片转视频、导演验收等五六段流程。

  • 每一段由谁负责、人和AI如何分工、上游输入什么、下游产出什么、怎样验收逐渐清楚后,整条链才能“像流水线一样转起来”。

  • Jess给Seedance同一个长Prompt,结果仍完全不同;庄明浩的诊断是约束区间依然太宽。模型即使理解镜头,也不等于一致性、构图和执行已完全可控。

12. Seedance的惊艳来自对分镜语言的理解

  • 庄明浩把Seedance的优势归因于分镜:抖音与剪映长期积累了原始素材如何裁切、保留和转场的行为,这种理解比单纯生成漂亮画面更难复制。

  • 他的论证不是“有数据就必然成功”,而是模型要完成导演式输出,必须理解素材与成片之间的编辑关系;字节在这一维度“原来就知道”。

  • 图片和视频模型会继续内化镜头语言,但外部输入暂时仍重要。模型水位上升很快,控制精度却决定它能否从好玩的Demo进入稳定生产。

13. 记忆迁移暴露了ChatGPT护城河的脆弱面

  • Claude推出“60秒搬空ChatGPT”式功能后,Jess疑惑为何记忆能轻易迁出;庄明浩的回答是,模型既然能依据长期对话理解用户,就必然有某种可被归纳的记忆。理论上其他模型也可以迁移,但迁移后能用成什么样仍不一样。

  • OpenAI过去一年多在产品端押注:ChatGPT通过高频聊天记住偏好、性格和要求,以此形成留存和区隔;一旦用户强烈决定离开,迁移工具便直击这层护城河。

  • 庄明浩把当周Claude登上美国AI榜单第一,联系到五角大楼与Anthropic的冲突及OpenAI接手相关事务;这是他对用户迁移原因的现场判断,而非模型能力突然逆转。

14. 春节流量战没有改写排位,模型战却已合桌

  • 国内春节大战的本质仍是大厂抢用户:送奶茶、下订单都带来短期波峰,但庄明浩总结“第一还是第一,第二还是第二,第三还是第三”,曲线结构几乎未变。

  • 这是一场囚徒困境——大家知道补贴未必留下长期价值,但别人做了,自己就不能不做。流量打法仍很互联网,技术格局没有因此重新排序。

  • 国内纯模型玩家已从“六小龙”收缩到约四五家;百川、零一减少对通用模型主战场的投入,其余公司加上DeepSeek继续追最通用、最尖端的能力。

  • 2025年还可说智谱押coding、Kimi押Agent、MiniMax押多模态;到2026年,“所有的桌都变成一桌”,coding、语言、Agent、图像、语音和视频必须共同竞争。

15. 原生多模态要求模型、数据与组织同时融合

  • 让模型为“2028末世论”文章生成信息图,实际包含搜索文章、理解文字、总结结构和图片输出;这已不是画图模型,而是语言理解与视觉生成的一体化任务。

  • Kimi 2.5首次支持多模态,智谱也开始进入;录制时DeepSeek V4尚未发布,市场猜测其除Agent能力外也会支持多模态。MiniMax则计划把2.5语言与Agent、视频和语音进一步归拢。

  • 千问提出“三进三出”:文字、图片、视频都能输入,也都能输出。但统一训练目标与阿里云把预训练、后训练、语言、图片、视频团队拆开的组织方式相冲突;庄明浩认为这种组织与目标之间的对立与相关问题有关。

  • Nano Banana的希腊打卡案例说明融合价值:用户只给自己照片和地点名称,模型便知道地点长什么样;旧式模型则还需要用户另交一张当地参考图。

16. AGI没有统一终点,中美竞争也不是同一张资产负债表

  • 对“AGI哪天实现”,庄明浩的回答是“不知道,没人知道”;连标准都未统一。让模型只看1911年前资料并自行推导相对论看似可测,实际无法分清数据、引导与推理各自贡献。

  • 美国仍有世界顶尖工程师、金融体系、能源与创新机制支持巨额投入;但庄明浩的反向判断是,美国可能“只有这个了”,一旦AI竞争失利,可依靠的产业支柱更少。

  • 中国除软AI外还有制造业、电动车供应链、具身智能、商业航天等主题,因此资本市场并不只围绕大模型。软AI在国内政策与市场议题中的位置反而“相对靠后”。

17. 中国科技融资正在形成一套政策与资本市场SOP

  • 庄明浩把国产芯片、具身智能和商业航天公司的推进路径概括为一种“中国特色的金融市场支撑科技创新”:业务仍早期,却能迅速获得政策、资金和市场叙事的多重支持。

  • 这解释了为何投资者紧盯“十五五”关键词,也解释了A股为何同时为多个科技方向买单;他不判断这套机制绝对好坏,只强调它已能被反复复制。

  • 国家安全并非零一选择。AI模型公司拿的是美元,海外机构也会研究中国AI;智谱背景适合A股却最终赴港上市,正体现软AI在监管与资本之间的灰度。

18. “套壳”有窗口价值,二级股价还能反哺一级估值

  • 庄明浩反对把“套壳”一概视为无价值:狭义API包装容易复制,但把账号、权限、隐私、流程和UI变成可用产品,仍可能拥有周期性窗口。

  • 广义上,ChatGPT本身也是GPT-3.5的“壳”——模型不能直接服务大众,外层交互与体验并非可有可无。真正的问题不是有没有壳,而是壳里积累了多少难复制的产品能力。

  • 他直言MiniMax与智谱股价是“虚的”,因为涨跌不直接增加公司现金流;但上涨会抬高Kimi的估值,Kimi融资拿到的才是“真金白银”,因此不必急于上市。

19. 算力是当下体感瓶颈,数据更可能拉开长期差距

  • 庄明浩沿用算法、算力、数据三分法:GPT发布以来底层算法“几乎没有太大的创新”,更多是边缘优化;算力受芯片、电力、土地、建设周期及中美限制约束。

  • OpenClaw把持续执行带来的token消耗推到几何级。智谱发布GLM-5后又遇到OpenClaw接入潮,VIP开始限量,不是不想卖,而是“服务不了那么多用户”。与此同时,一些AI公开课因服务不了那么多用户,只能退款。

  • Seedance即使只有几十万量级用户生成视频,也足以让字节排队数小时;相对抖音约8亿用户,这一需求还非常早,却已让能买就尽量买算力的大公司承压。

  • 数据则是更持久的差异:模型在广泛意义上的数据上建立的优势难追。数据好不等于一定做出好模型,但“你没有就肯定不能”。

20. 市场交易的是意外,而人类最后押注品味与“神之一手”

  • Jess问普通人如何押注AI,庄明浩没有给建议。英伟达在160—180美元横盘约4—5个月,并非算力需求消失,而是巨头CapEx、订单和利润增长已经进入预期。

  • 市场转而追逐未被充分想到的环节:存储、TOTO陶瓷作为AI数据中心芯片载板的重要材料,以及做味精的味之精。“算力增长明确”与“股票还有意外”是两件事。

  • 对普通用户,他建议“不要当它是菩萨”,而要当工作台:找出每周重复超过5次的工作、健身、饮食或学习任务,让AI优化其中一段,不必为安装龙虾制造新的焦虑。

  • AlphaGo纪录片提供了更深的镜像:樊麾、李世石都经历轻视、怀疑、道心崩碎,李世石第四局凭直觉下出扭转局面的“神之一手”,却也成为人类最后一次单局战胜AlphaGo。庄明浩此前强调当前可用的是提问、规划和拆解任务;在最后关于未来能力的回答中,他把核心收束为想象力、品位和审美——AI瞬间给出5000个选项时,仍能说“就是这个”。