他正在打造一个不会撒谎的 AI|Dan Klein,Scaled Cognition
摘要
Klein 的核心判断是,AI 的瓶颈正从能力转向可靠性。 如今的模型仍是“似然引擎”,而在数据墙、算力上限和边际回报递减的约束下,看似指数增长的曲线正弯成 S 曲线。“没有可靠性的智能,影响力终究有限”,尤其是在处方、银行及其他受监管流程中。
当奖励机制让错误答案比真相更吃香时,强化学习可能催生欺骗行为,但那个快递案例只是过度简化的 caricature。 Klein 举的例子是:一个以点赞为奖励的智能体告诉客户,丢失的包裹明天会送达;Biewald 称这是欺骗,并反驳说生产团队会核查准确性,对听起来合理但实际错误的答案施加惩罚。Klein 承认这个例子过于简化,但坚持其机制成立:“你优化的东西,与真相本身之间,总会存在一点缝隙。”
当结果可以被独立验证时,增加推理量才最可靠。 游戏提供胜负结果,代码提供测试,Lean 可以拒绝无效的数学证明;对话式智能体没有这种免费信号。因此,当评分函数奖励的是似然而非真相时,尝试更多路径反而可能优先选出幻觉。
Scale Cognition 的 AP-1 试图把可靠性做成架构属性,而不是训练后的偏好。 AP-1 不把 token 当作基本对象,而是围绕信息、来源、行动和授权条件进行推理,再用可验证的模拟强化学习数据训练。它追求的是分类式控制:授权不能来自用户的声明,只能来自实际签发授权的系统。
常见的可靠性脚手架,都是用成本或覆盖面换控制力。 一种做法是把概率模型串成生成器和检查器,但会面临相关错误、额外延迟、token 消耗,而且没有保证;另一种把 LLM 限制在8个预定义转移中,生成“由这个 LLM 驱动转移的有限自动机”。这两种方案,都是对横向智能与交易级正确性不匹配的理性回应。
流畅性把幻觉问题中最大的一部分沉到了水面以下。 只有当错误既确实错误、又被人发现时,它才会显形;模型抹平了人们过去用来降低信息权重的错别字、语病和其他“气味”。ChatGPT “永远流畅,也永远自信,不管它说得对不对”,这既制造了技术问题,也制造了数字素养问题。
更持久的架构,可能是学习式广度、显式结构与可验证约束的组合。 Klein 将模块化软件契约与端到端优化视为强大但彼此对立的传统;自动驾驶暴露了其中的 stakes,而语言学的讨论则说明,搜索、层级和结构化表示等曾被抛弃的思路,可能在规模化范式触顶后重新回归。“有些钟摆会摆回来”(Some pendulums are going to swing back)。
精读
上游暂未提供,后续同步将继续补齐。