先锋 趋势 方法 投研 作者
返回先锋
Category Theory
创新者 1 场深度对话收录

Category Theory

观点集合

用 Category Theory 让深度学习真正执行算法(Andrew Dudzik、Petar Velichkovich、Taco Cohen、Bruno Gavranović、Paul Lessard)

  • 🗓️ 日期2025-12-22 | 🎙️ 节目:Machine Learning Street Talk

前沿模型能够模仿算术,却无法可靠执行进位,说明惊人的规模与稳定计算仍有差距,也推动工具调用、架构先验和混合系统发展。范畴论试图把几何对称性扩展到递归、复合、权重共享和神经进位,但商业价值取决于能否推导出兼顾正确性与灵活性的架构。

查看访谈对话精读提要
  • 当今前沿模型是在模仿计算,却还不能可靠地执行计算。 Andrew Dudzik 的测试非常直接:在一道有规律的加法题中改动一个数字,ChatGPT 就无法继续正确进位;而 Petar Veličković 指出,一些当前前沿模型每个 token 要执行“数千亿次乘法”,却仍不能可靠地算出小数字的乘法。对投资者而言,能力规模与计算可靠性仍是两个不同的投资论点变量。

  • 工具调用有所帮助,但无法消除架构瓶颈。 模型仍必须预测计算器的正确输入,而更长的推理链可能需要反复调用、重新思考,以及模型与工具之间多次切换。Dudzik 认为,内化的基础计算“有机会稳定得多”,并可能显著提升推理效率。

  • Taco Cohen 否定“神经网络无法学习算法”这一最强版本的论断。 训练得当的模型或许能在记忆容量允许的范围内学会长加法,只是偶尔忘记进位,和人类一样;神经机制既可以执行某种符号化过程,也能保留世界知识,并处理难以用严格符号定义的模糊概念。争议在于能否可靠外推,而不在于神经计算是否可能表现得像一个程序。

  • 几何深度学习证明了正确架构先验的实际价值。 当对称性确实成立时,平移等变性和置换等变性可以在不引入偏置的情况下压缩假设空间,使所需数据量“几乎呈指数级”下降;transformers 在加入 token 和 position embeddings 后,本身也利用了置换等变性。但群对称性只能描述可逆变换,而真实程序经常会销毁信息。

  • Category Theory 被提出作为从空间对称性推广到计算本身的通用框架。 从群转向幺半群,意味着移除可逆性的要求;进一步转向范畴,也不再假设每个操作都能与其他任意操作复合。其目标是构建一张“神经网络元素周期表”,从中推导架构,而不是靠临时增加旋钮和反复微调来发现架构。

  • 这一框架的具体目标包括递归、有原则的权重共享,以及神经网络实现进位。 在2-范畴中,权重绑定成为一种连贯的重参数化,而不是无法解释的编码约定;同一抽象还可以表达超越字面复制的关系。Dudzik 更难的目标,是让神经加法器传递隐藏在状态变化中的信息,这可能成为“在神经网络中实现真正 CPU”的路径。

  • Veličković 设想的是混合系统,而非纯神经系统。 神经网络负责把嘈杂的现实翻译到抽象空间,计算则交给学习到的先验、精心设计的损失函数,或能提供正确性、收敛性保证的工具与算法组件。他的标准不是 100%准确率,而是系统知道一个问题需要多少计算,并能说:“这个问题……对我的能力而言,计算规模太大了。”

  • 🔗 原始收听与视频来源: 用 Category Theory 让深度学习真正执行算法(Andrew Dudzik、Petar Velichkovich、Taco Cohen、Bruno Gavranović、Paul Lessard)

收听完整访谈 →