先锋 趋势 方法 投研 作者
Apple 的 Siri-ous 难题 + Starlink 如何接管世界 + AI 正在让我们变笨吗?
返回节目精读

Apple 的 Siri-ous 难题 + Starlink 如何接管世界 + AI 正在让我们变笨吗?

摘要

  • Apple 的 Siri 延迟,首先是信誉问题,其次才是 iPhone 需求问题。 Apple 把具备上下文理解能力的 Apple Intelligence 宣传得仿佛已经准备就绪,最初目标是4月上线 iOS 18.4,随后推迟到5月,如今可能要到2026年甚至更晚;部分报道甚至称可能要等到2027年。Apple 承认这会“比我们原先想的更久”,但 Casey Newton 认为,iOS 生态护城河足够深,客户大规模转投其他平台的可能性不高。

  • 这次延迟暴露出3项执行风险:概率可靠性、羸弱的产品判断力和安全性。 Apple 的演示可能只能做到大约85%的成功率——这是 Casey 假设的数字——但闹钟和个人数据操作无法容忍这样的失败率;与此同时,已经推出的摘要功能会产出“链接已分享到 x.com”之类的名场面。提示词注入目前只是理论,没有任何报道证明它导致了延迟,但一封要求 Siri 泄露密码的邮件,足以说明 Kevin Roose 为什么认为 Apple 应先加固系统,再逐步放量。Casey 建议增加一个面向高级用户的自愿开启模式。

  • 仅靠分发,并不能把第三方 AI 转化为用户日常使用 Siri 的习惯。 两位主持人都在使用 ChatGPT App,而不是通过 Siri 调用它,部分原因在于多年糟糕表现已经固化了用户预期,Apple 关于向外传输数据的警告也让人望而却步。Kevin 认为,Siri 的平庸会让非技术用户低估强大 AI——“你见过 Siri 吗?”——而 Casey 认为,Apple 最终可能需要放弃这个品牌。

  • Starlink 的 Musk 护城河更深,因为 SpaceX 同时拥有发射体系和网络。 如今数千颗卫星已经服务120多个国家,订阅价格约75美元起步,在英国约为75英镑;竞争对手可能仅仅为了起步就要投入数十亿美元,有时还必须租用 SpaceX 的火箭。卫星、火箭和软件全部自有,构成了竞争对手和政府至今都没有复制的“全栈”优势。

  • 这道护城河已经变成国家权力,而不只是宽带经济学。 Musk 称 Starlink 是“乌克兰军队的骨干”,并表示如果他关闭系统,乌克兰前线将会崩溃;当波兰指出自己每年为乌克兰终端支付约5000万美元时,Musk 回应称“Starlink 没有替代品”。意大利约15亿欧元的国防与情报提案显示了这项战略资产的价值,而政治互不信任也暴露出对手方风险。

  • 尽管 Musk 背负政治包袱,Starlink 的分发仍在加速。 节目提到,它试图进入美国一项24亿美元的空中交通通信项目,可能获得调整后的农村宽带资金,已与印度最大的2家电信公司达成协议,计划登陆 United Airlines 航班,并正在建设一套五角大楼系统。Adam Satariano 表示,持续发射会强化服务能力,形成“飞轮效应”;但 Musk 的个人形象可能危及美国以外的合同。

  • Carnegie Mellon–Microsoft Research 的一项调查指向 AI 劳动力从生产转向监督,而不是证实智力出现崩塌。 在319名每周使用 AI 的受访者中,越信任 AI,受访者自报的批判性思考越少;一名工程师形容工作已经从编程变成“管理一个程序员”。但证据仍局限于一项英语主导、依赖主观感受的调查,AI 对实际工作表现未来5年的影响仍然未知。

  • 劳动力市场最难回答的问题,是 AI 究竟在消除苦差事,还是在侵蚀人们识别其错误所需的技能。 Vibe coding 可以让新手进入软件创作,但初级程序员的能力退化,以及 FAA 在2013年就自动化导致飞行员技能萎缩发出的警告,都说明人们可能失去核心能力。置信度标签、来源核查和相互竞争的观点或许有所帮助,但 Casey 想象中的“全世界最好的编辑”揭示了尚未解决的交换条件:产出更好,却可能少了人类思考。

精读

1. Apple 在还无法交付个人化 Siri 之前,就已经把它宣传出去了

  • 去年6月 WWDC 上,Apple 最突出的承诺是个人化编排能力:Siri 可以保存别人通过短信发来的地址,也可以回答“我妈的航班什么时候落地?”,方法是找到她的邮件、读取行程,再查询实时航班信息。Casey 称这“如果是真的,那就很大”(big if true)——当时没有任何产品能做到,在他看来现在也没有产品真正完整实现。Apple 之所以特别适合尝试这件事,是因为它控制着 iPhone 操作系统;但打通邮件、日历、短信和其他个人数据,也会带来重大的隐私与安全问题。

  • Apple 当时描述的是一套贯穿未来一年的分阶段发布计划。Bloomberg 最初报道称目标是4月和 iOS 18.4,随后2月的报道把目标改到了5月;Apple 发言人 Jacqueline Roy 最终表示,这会“比我们原先想的更久”,目前预计将在“未来一年内”推出。主持人引用的估计是2026年或更晚,其中包括可能拖到2027年的报道。

  • 真正造成信誉损伤的,是 Apple 把功能宣传成已经可用,而不只是描绘一个雄心。Apple 把这些功能当作购买新 iPhone 的理由,还投放了一则 Isabella Ramsey 的广告,展示 Siri 如何从个人上下文中找回用户忘记的熟人姓名;这则广告后来被撤下。与此同时,Amazon 表示 Alexa Plus 将在数周内上线,而它看起来不仅覆盖了 Apple 承诺的大部分能力,甚至还要更多。

  • Apple 已经交付的功能又暴露出另一层产品问题。通知摘要会把分享的推文和截图总结成“链接已分享到 x.com”或“黑底白字”,反而取代了用户原本可以直接看到的信息。Casey 的结论是:“这不是 LLM 的问题”;问题在于有人根本误解了人们如何沟通。

2. 概率模型撞上闹钟、密码和 Apple 式打磨

  • Bloomberg 的 Mark Gurman 报道称,软件负责人 Craig Federighi 以及其他高管发现,这些功能要么失效,要么表现得不像广告演示中那样。Casey 将技术冲突概括为确定性软件与概率预测的对撞:计算器可以可靠地执行“如果这样,那么那样”,而 LLM 给出的是统计意义上的可能性,并不会每次都产生同一个结果。

  • Casey 假设,去年6月某项功能的成功率是85%,这让 Apple 相信自己可以弥合差距;但到了2025年3月,剩下的15%失败率已经变得不可接受。奇怪的消息摘要可以当成娱乐;但如果用户让助手设置早上8:00的闹钟,它却设成了下午3:30,后果就完全不同。“生活中几乎没有多少产品”可以接受80%的可靠性。

  • 工程师兼博主 Simon Willison 提出了另一种可能:提示词注入。恶意邮件可能指示个性化 Siri 忽略用户命令,并把密码发送给攻击者。Kevin 强调,没有任何报道显示这导致了延迟,但 Apple 能够接触用户的私密联系人、凭证和支付信息,足以让这个理论值得认真对待。

  • 旧 Siri 的命令集是有边界的,工程师可以把整条代码链路从头到尾检查一遍;而接受开放式请求的 LLM,会让“网络安全空间”急剧膨胀。Kevin 认为,Apple 应先防住严重漏洞,再以低于传统打磨标准的状态开始推出。Casey 建议增加一个自愿开启的高级用户模式,让熟练用户先获得更广泛的能力,其他人则继续等待。

3. Apple 的 iOS 护城河争取了时间,但 Siri 的坏名声会持续累积

  • Casey 的宽容理由是结构性的:Apple “垄断了 iOS”,很少有客户会因为 AI 延迟,就放弃下一部 iPhone。即使 Google 的 AI 明显更强,也没有推出任何让他觉得“必须买 Pixel”的 Android 功能。他更大的判断是:AI 仍然“更像科学和研究故事,而不是产品故事”。

  • Kevin 的反驳来自产品文化。ChatGPT 老用户知道模型擅长哪些任务,但 Apple 的理念是把设备做得不易出错、也不可能被误用。这套 DNA 诞生于精致且可预测的产品仍然可以实现的时代;如今混乱的 AI 更依赖试验,以及对用户判断力的信任。Casey 则指出,Apple 确实发布过未完成的产品——通知摘要——而它目前的价值,恰恰来自那些荒谬的失败。

  • 两位主持人都没有通过 Siri 使用 ChatGPT,尽管他们已经连接了这项集成,因为独立 App 同样容易访问,而且已经形成使用习惯。Apple 关于向 OpenAI 发送个人数据的警告,也让整个交互显得“吓人”。Kevin 认为,多年表现糟糕的 Siri 会让 Apple 和 Amazon 都难以在助手突然宣称自己能力更强时,重新“给人类编程”。

  • 这种声誉包袱可能会塑造公众对 AGI 的看法。Kevin 认为,非技术用户听到“AI”,脑中想到的是 Siri,于是得出“这东西很蠢”的结论,并拒绝相信强大系统会在1到2年内到来。Casey 因而认为,或许应该放弃这个声名显赫却已经受损的 Siri 品牌:“Siri 已死,Apple Intelligence 万岁。”

4. 垂直整合的全栈体系,为 Starlink 建起物理护城河

  • 主持人将 Starlink 与 Tesla 进行对比:Tesla 股价今年下跌近40%,受到中国电动车竞争和全球抗议活动影响。汽车行业存在可信的竞争对手;卫星互联网则需要火箭、轨道基础设施、软件以及巨额资本。Starlink 还拥有更具现实后果的能力,可以“轻轻一拨开关”就启动或终止连接。

  • Starlink 的地面接收器看起来像一个小披萨盒或一台笔记本电脑,可用于家庭、飞机、船舶、城市乃至北极地区的连接。它已经运营于120多个国家,订阅价格约75美元起步,在英国约为75英镑。传统城市宽带可能更划算,但对偏远地区用户而言,Starlink 提供的是地面运营商难以交付的连接能力。

  • 它部署的数千颗低地球轨道卫星,与其说像过去系统中校车大小的卫星,不如说更接近双人沙发;数量增加后,服务稳定性和连接质量也会提升。Satariano 在报道期间与一位人士交谈过,对方曾在2000年或2001年与 Musk 讨论低轨卫星技术,但他不认为当时已经形成了完整的 Starlink 计划。

  • SpaceX 自己制造卫星、用自有火箭发射,并控制软件。一些竞争对手必须使用 SpaceX 的发射服务;一家传统卫星互联网公司则预计,仅进入低地球轨道就要花费数十亿美元。Satariano 的结论是:没有任何公司或政府复制出这套“全栈技术”。

5. “没有替代品”让连接能力变成地缘政治杠杆

  • 乌克兰清楚展示了 Starlink 的杠杆价值,因为这张网络正被用于现役军队的战争行动。Musk 写道:“我的 Starlink 系统是乌克兰军队的骨干。如果我把它关掉,他们整个前线都会崩溃。”主持人认为,威胁切断连接的能力,比影响一家汽车制造商的能力重要得多。

  • 波兰外交部长 Radosław Sikorski 回应称,波兰数字化部门每年为乌克兰 Starlinks 支付约5000万美元,并警告说,如果 SpaceX 变得不可靠,波兰就不得不寻找替代方案。Musk 则回应:“闭嘴,小个子”,并补充说波兰支付的只是成本中很小的一部分,“Starlink 没有替代品”。

  • Kevin 将这场交锋形容为通过 X 上的嘲讽进行的高层外交;Casey 则称之为“卡通反派式的行为”。Satariano 给出了令人不适的判断:Musk 最后那句话并没有说错。政府可能不喜欢这种做法,但今天要找到另一家供应商,祝你好运。正是这种事实上的依赖,让欧洲官员感到恐惧。

  • 意大利此前一直在谈判一项约15亿欧元的 Starlink 国防与情报能力协议。国内偏好本土供应商本已引发反对,但 Musk 关于乌克兰的言论以及他对意大利政治的介入,“向这笔交易扔进了一枚手榴弹”。由于官员不再信任这家潜在供应商,提案开始摇摇欲坠。

6. 政府寻求主权,Starlink 则不断强化网络效应

  • Satariano 表示,大多数官员并没有陷入迫在眉睫的恐慌;他们担心的是未来的不可预测性。台湾一直非常不愿与 Starlink 合作,因为 Musk 在中国的商业利益让人无法确定危机期间会发生什么;目前没有证据表明 Starlink 曾因中国方面的命令而关闭服务。真正的问题是:当不可预测性变得无法接受时,关键系统已经处于依赖之中。

  • 据报道,中国曾寻求 Musk 的保证,要求他不要在中国上空启用 Starlink,因为卫星接入可能绕过“长城防火墙”。Starlink 已经在伊朗等地展现出“零星”的规避审查潜力,但并未将其作为使命,也通常只在获得授权的地区运营。

  • Casey 认为,全球关键基础设施竟然被交给少数几家私人公司,而其中只有一家真正实现规模化,这一点令人震惊。Satariano 将其与政府开发的 GPS 进行对比,并表示欧盟正在投入数十亿欧元开发新技术或扶持竞争对手。但他也怀疑,政府是否已经等得太久。

  • Starlink 目前的雄心看起来更具战略性,而非追求覆盖一切。它正在为五角大楼建设一套防护能力更强的通信系统,已与印度最大的2家电信公司签约,开始在 United Airlines 航班上铺开服务,并争取美国航空和农村宽带机会。更多卫星会改善服务,进一步强化持续增长的飞轮;与此同时,Musk 的政治立场也在损害 Starlink 作为可靠政府合作伙伴的声誉。

7. 越信任 AI,用户报告的批判性思考越少

  • Carnegie Mellon University 和 Microsoft Research 调查了319人,覆盖不同年龄、性别、职业和国家,所有人每周至少使用 ChatGPT 等工具1次。每名参与者都提供了当周工作中的3个真实案例,并评估自己付出的努力、使用的批判性思考以及对 AI 正确性的信心。

  • 最受关注的结果,是信任与审查之间呈反向变化:员工越信任 AI,就越少报告自己使用批判性思考技能;信心下降时,审查反而增加。眼前的风险是,模型未被发现的错误最终会变成员工自己的错误。从更长周期看,更好的系统可能因此减少人们动用工作原本要求的那些能力。

  • 职业角色正在从完成任务转向监督自动化完成任务,也就是研究人员所说的 AI 监督。Kevin 联系到一名软件工程师的描述:工作已经从编程变成“管理一个程序员”。主持人认为,这种模式可能扩散到许多职业。

  • 两位主持人都强调了证据的局限性:这只是1项研究,参与者全是英语使用者,衡量的也是员工的主观感受,而不是实际观察到的认知或工作表现。Kevin 希望看到任务表现或考试分数研究,并且有跨越5年的证据,说明生成式 AI 的使用是否真的会让员工在工作中变得不那么有能力。

8. AI 扩大新手的能力边界,也可能让专家技能萎缩

  • Kevin 已经把采访准备交给 Claude 或 ChatGPT。它们提出的许多问题质量很差,但其中一些会成为最终问题的基础,或把他引向新的方向。AI 还让他能够完成此前做不到的 Vibe coding 等任务,尽管它也取代了一部分他过去会亲自完成的思考。

  • Casey 认为,Vibe coding 恰好是这项研究所担忧问题的反面:当一个人已有的批判性技能根本无法让他写出软件时,AI 反而能把新手带入学习过程。模型完成了大部分工作,但接触过程仍可能让用户学到东西,并激发原本不会出现的更多技术思考。

  • Kevin 的补充是专业工程师面临的风险。有一些轶闻显示,初级程序员可能因为依赖 AI,进入职场时已经无法很好地编程;更广泛地说,随着 AI 在某个领域变强,人们可能会越来越少亲自完成核心工作。航空业提供了对应案例:2013年,FAA 曾警告,对自动化和自动驾驶仪的依赖正在削弱飞行员的手动飞行能力。

  • Casey 仍然矛盾,因为消除工作量本来就是这项产品存在的意义。员工希望 AI 清除苦差事,或者接手一项任务的前10%、20%或30%,让人类专注于更高价值的工作。真正无法回避的临界点是:自动化做得太多,以至于员工开始问,“我在这个等式里到底还带来了什么价值?”

9. 可靠性提示或许有帮助,但人的贡献仍未被定义

  • 研究人员建议引入能够暴露不确定性、促使用户审查的反馈机制。Casey 偏好的界面可能会说:“我只有70%的把握这是真的。”它也可以询问用户是否核查过来源,或提供相互竞争的观点。这些提示或许能恢复用户的主动思考,但他也承认,急着去看 Netflix 的员工可能根本不会理会。

  • Kevin 预计,当人们开始对认知外包感到不安后,会出现一种“精神上的健身房”:暂时离开聊天机器人,花时间尝试生成原创想法。他不认为大多数人已经到了那个阶段,但旧金山那些重度用户最终可能会意识到,自己已经连续数周或数月没有产生过原创想法。

  • Casey 的另一面想象,是在1到2年内出现相当于“全世界最好的编辑”的 AI,住在他的笔记本电脑里:规划报道、提出来源和问题、组织文章结构、改善文字表达。即便这意味着承认自己完成的批判性思考更少了,他也会希望得到这种能力跃升。诚实的答案仍然是否定的:随着这些系统变得更强大,社会还没有决定究竟希望人类贡献什么价值。