先锋 趋势 方法 投研 作者
Brex 的 AI 背水一战——与 CTO James Reggio 对谈(Capital One 以50亿美元收购!)
返回节目精读

Brex 的 AI 背水一战——与 CTO James Reggio 对谈(Capital One 以50亿美元收购!)

摘要

  • Brex 的 AI 论是一个三部分的运营模型:加速所有企业职能、自动化受监管的金融运营,并向客户出售能融入其自身 AI 战略的智能体。 Reggio 称内部平台是“把一切串起来的东西”,可能形成服务成本下降与产品差异化之间的循环。目标也很具体:让内部工作流提速“10倍”,将初创企业和商业客户申请的自动批准率提高到80%,在60秒内完成决策且不需要人工介入。
  • 最清晰的近期经济价值,在于让过去不值得获客和服务的商业客户变得经济可行。 依赖人工的开户流程让律所、牙科诊所等增速较慢的企业“ROI 为负”;Brex 此前依靠规模推进的小企业业务也一度变得“几乎关乎生死”。目前的下限仍然是选择性的:年收入约100万美元,或每月卡交易额至少1万美元。
  • Brex 得出的结论是,真正有用的智能体金融需要一个专家网络,而不是一个塞满工具的全能助手。 面向员工的助手通过多轮对话,将任务交给差旅、报销、费用和政策智能体;MCP 风格的工具则把这些智能体连接到传统系统。Reggio 将其描述为一张“组织架构图”:行政助理通过私信调度各领域专家,而不是把协作压缩成一次工具调用或一张确定性 DAG。
  • AI 产品团队以一家约10人的初创公司方式运作,却拥有约40,000名客户的分发渠道。 3人小组由一名产品或客户导向的成员、一名熟悉“哪里藏着问题”的 Brex 资深员工,以及一名不受既有解决方案范式约束的年轻 AI 原生工程师组成。这让 Brex 可以测试“一家今天才成立、目标是颠覆 Brex 的公司”会做出什么,同时无需重组约300人的工程部门。
  • Brex 拒绝在基础模型和编程工具之间押注一个永久赢家,把员工选择同时变成适应能力和采购杠杆。 通过 ConductorOne,员工可以申请 ChatGPT、Claude 或 Gemini,开发者则可在 Cursor、Windsurf 和 Claude Code 之间自行选择。续约时,使用数据会变成市场信号:“我们的员工用脚投票,也用自己的预算投票。”
  • Reggio 不认同“AI 生成的代码越多,工程师就会立刻越少”这一简单推论。 主持人提到 Brex 在18个月内实现5倍增长并将烧钱减少99%,但 Reggio 强调,更广泛的执行纪律同样重要;他说智能体开发会放大“一切好的东西”,也会放大“一切坏的东西”——包括垃圾代码、薄弱架构、知识漂移和更困难的事故响应。他理想中的结果仍是:一年后工程师约300人,却服务于大得多的业务,效率或许提高“30%、50%甚至100%”。
  • Reggio 的叙述显示,Brex 可能在运营知识、评估闭环和跨智能体工作流设计上拥有优势,但这3项都尚未完成。 运营错误会转化为回归评估,多轮产品测试会模拟用户并使用 LLM 评审,审计网络则由不同智能体分别负责发现、判断和跟进员工。然而,当助手并不具备相应能力时,仍可能承诺“联系财务团队”;与此同时,Brex 的产品知识依然分散在内部、客户、销售和支持系统中。

精读

1. 创始人经历,而非后端履历,让 Reggio 走上 CTO 之路

  • Reggio 承认,拥有前端和移动端背景、最终成长为 CTO 的领导者并不多见。但在他看来,自己的晋升更多源于两次创业,而不是技术专长。CTO 的职责“既是领导岗位和综合业务岗位,也是技术岗位”。

  • 大约2年前,Pedro 提供 CTO 职位时,Reggio 正在考虑离开 Brex、创办下一家公司。如今 Brex 反过来拥抱这种张力,以“Quitters Welcome”为口号,庆祝那些日后成为创始人或部门负责人的员工,而不是假设留任必须是永久状态。

  • Brex 对前任或潜在创始人的吸引力在于“即时分发”:他们可以开发金融 AI 应用,并将其部署到约40,000名客户中,覆盖 Fortune 100 企业和数万家初创公司。组织层面的难题,是保留足够的初创公司质感,让这些构建者不会觉得自己被企业环境吞没。

2. Brex 在产品组织旁边搭建了一支初创公司规模的 AI 团队

  • Brex 约有300名工程师,工程、产品和设计团队合计约350人。大多数工程师分布在30至40人的全栈业务域,覆盖卡、银行、费用管理、差旅和会计,同时配有基础设施和安全等共享职能。

  • 唯一的例外,是一支约10人的集中式 LLM 团队;几个月前它还只有4至5人。团队成立时提出的问题非常明确:“一家今天才成立、目标是颠覆 Brex 的公司会是什么样?”Reggio 随后据此塑造了一个内部挑战者。

  • 典型的3人小组结合了客户或产品直觉、一名理解现有代码库的 staff engineer,以及一名更年轻的 AI 原生工程师。Reggio 提出了一个颇具挑衅性的观察:“过多经验,或者过多了解一个问题该如何解决,实际上可能妨碍”人们看见 AI 优先的方案。

  • 集中化并没有造成 Reggio 原本预期的抵触。Brex 的工程文化本来就围绕可衡量的商业影响来优化;例如,卡团队贡献了约60%的直接收入。AI 工具的采用也是全公司范围的——Brex 最大的 Cursor 用户之一就是一名工程经理。

3. 2023年1月搭建的网关,成为两代智能体的底层

  • Reggio 最初的 AI Labs 团队大约在2023年1月搭建了内部 LLM 网关,用于部署、版本管理和评估提示词;控制数据外流和模型路由;并监控可观测性和成本。“简单就是优雅”仍然是他的架构偏好。

  • 这套平台至今仍在支撑精准的运营应用,包括帮助自动化承保和 KYC 的研究智能体。其大量界面位于 Retool 中,运营人员可以管理提示词、工具及相关工作流,无需每次调整都等待工程师介入。

  • 新一代面向客户的智能体层使用 TypeScript,并通过公开接口与 Brex 基于 Kotlin 和 Elixir 的后端有意隔离。其存储组合包括 pgvector 和 Pinecone;目前约一半应用使用 Mastra,另一半使用 Brex 不断演进的内部多智能体框架。

  • Mastra 胜出,是因为它的人机工程与 Brex 现有框架相似,尤其是在追踪和可观测性方面。Reggio 预计技术栈仍会持续变化:由于智能体编程缩短了“代码的半衰期”,团队如今可以以远低于过去的成本测试技术并完成迁移。

4. 全能助手败在了专家对话面前

  • Brex 服务金融专业人士,也服务那些拿到公司卡的普通员工。对于后者,Reggio 设想的最佳体验是让产品消失:“Brex 最好的 UI/UX 就是那张卡。”短信和 AI 助手可以消除费用记录、政策咨询和差旅管理。

  • 这个模型来自 Reggio 自己的行政助理:她可以根据他的日历、邮件和差旅上下文推断业务目的。Brex 希望为每名员工提供一个软件版本,并连接到同类上下文信息源。

  • 一个配备大量工具的单一智能体,在费用、差旅、报销、采购和政策等场景表现不佳。动态替换提示词上下文的方案同样不理想,因此 Brex 把职责拆分给由编排器调度的专业智能体,让各产品团队可以独立改进自己的领域,而不必重做整个系统,也不必由一个团队负责所有可能的操作。

  • 多轮委派是关键区别。政策智能体被问到晚餐额度时,可能需要先判断这是客户活动、团队活动还是差旅用餐;它会告诉助手需要向用户确认什么,等用户回复后再继续。因此,Reggio 将 MCP 和工具视为“连接传统命令式系统的接口,而不是连接 AI 空间的接口”。

5. 3大 AI 支柱,把自动化变成产品反馈闭环

  • Brex 的企业支柱关注如何让采购的 AI 工具将所有职能的工作流提速“10倍”。运营支柱瞄准运营一家受监管金融机构的成本,包括反欺诈、承保、KYC、争议处理和支持;产品支柱则打造客户可以称为“企业 AI 战略组成部分”的功能。

  • 企业层面的采用主要由 IT 和人力组织推动;Reggio 则专注于运营 AI 和产品 AI。平台是一个非正式的第4支柱,提供网关、工具、模型和接口,供内部自动化与面向客户的智能体共同复用。

  • 运营部门带来的即时影响最快,因为 Brex 在服务密集型工作流中雇用了数百人。COO Camila 和 Reggio 正在重新定义这些岗位:从执行 SOP,转向“构建提示词、构建评估”,并将领域知识编码下来;同时他们坚持自动化不能损害 Brex 一贯较高的客户满意度。

6. 供应商可选性同时带来产品发现和议价能力

  • Brex 的明确政策,是不在基础模型、聊天产品或编程智能体的“赛马中挑赢家”。员工通过 Slack 和 ConductorOne 申请已批准的 ChatGPT、Claude 或 Gemini 访问权限;开发者也可以从 Cursor、Windsurf 和 Claude Code 等选项中组装自己偏好的编程工具栈。

  • 企业协议保留隐私和不用于训练的保障,但 Brex 避免强制全员部署。到了续约时,实际采用情况可以显示一个曾经炙手可热的产品是否已经失去相关性,为采购团队减少或重新分配席位提供事实依据。

  • 限制因素已经从最初的采用转向工作流惯性。Reggio 观察到,开发者可能拒绝测试一个更好但更慢的 Codex,因为他们已经花了9个月掌握 Claude Code:“我是 iPhone 用户,我就会一直用 iPhone。”

7. AI 编程的二阶成本,如今比采用本身更重要

  • Reggio 不会根据“我们的代码有80%由 AI 编写”这类头条数字来判断,因为共同创作者元数据无法形成站得住脚的衡量标准。采用已经十分广泛;当前的问题是“垃圾代码有点太多”、代码审查不够严格,以及长期可维护性。

  • 更快的独立变更也会造成知识漂移。随着代码持续演进数月,工程师对自己服务的理解会变得不够深入;这在事故响应时暴露出来:值班人员遇到的系统,可能并不是他们真正编写或审查过的。

  • 主持人认为,不能简单地在 AI 生成代码上再放一个 AI 审查器,就替代人类注意力。Brex 使用传统 lint 工具、仓库规则文件和 Greptile;Reggio 称赞 Greptile 的评论信噪比异常高,即使它会在一次 diff 上留下65条评论。

  • Reggio 曾在 AI 团队里连续一个月“基本上996”,随后经历了从“这会改变一切”,到担心工程师会消失,再到重新陷入不确定性的过程。大学生的用法让他感到意外:他们把智能体当作设计文档的共同架构师,但仍然亲自编写大量代码:“一切看起来都像导师制和管理。”

8. 简单的研究智能体,胜过复杂的信用学习方案

  • Brex 最初预计用强化学习复现人工承保人的授信额度决策,并与外部专家合作投入了相关项目。Reggio 后来彻底改变了看法:其表现“还不如直接构建一个网页研究智能体”。

  • 原因在于运营结构。受监管团队本来就会把工作拆解成细粒度、可重复、可审计的 SOP,这些流程可以直接映射到提示词、工具,有时甚至映射到单轮补全。真正困难的是提取未写明的机构知识,而不是发明更复杂的学习技术。

  • Brex 优先处理影响最广泛客户群的高频工作流。商业合法性研究先于卡争议文档自动化;后者要求发卡机构为卡组织和收单行整理一份3至4页的 Word 文档,成本高,但发生频率相对较低。

  • 自动化帮助 Brex 进入律所、牙科诊所等商业企业。Brex 此前依靠规模推进的 SMB 扩张留下了数万名 ROI 为负的客户,并一度变得“几乎关乎生死”;如今业务仍定位在真正的小企业之上,通常要求年收入100万美元,或每月卡消费超过1万美元。

9. 机构知识既是接地层,也是尚未解决的负债

  • 基础模型对 Brex 的认知可能比公司实际情况落后数年:要么只把 Brex 描述成初创公司卡,要么反过来只把它描述成面向企业客户。因而,智能体需要经过整理的产品和流程文档,才能理解当前能力、客户准入条件和 Brex 的理想客户画像。

  • 这些知识目前分散在内部运营和市场拓展文档、面向外部客户的材料、销售赋能资料,以及 Sierra 的支持语料库中。Reggio 希望这些应用从统一信息源获取知识,因为维护多套平行事实“很浪费”,还会增加幻觉风险。

  • 但 Brex 选择购买 Sierra,而不是重新搭建一套。Reggio 认为客户支持的差异化不足以证明有必要自建每一层,而 Sierra 为客户体验运营人员提供了低代码、以工作流为中心的管理界面,以及用“客户的语言”呈现的报告和遥测能力。

10. 评估正成为生产基础设施,但护栏仍比预期更轻

  • 运营智能体上线时,会由工程师和领域专家共同开发评估集。部署后仍会持续进行传统 QA,几乎每一个发现的错误都会变成回归测试,这与 Brex 对人工决策和 LLM 决策采用的 QA 流程一致。

  • 多智能体产品的评估更困难。Brex 让一个模拟用户的智能体接收目标,运行多轮对话,然后由 LLM 评审;如果完整对话会像一个范围过宽的集成测试,也可以用手写前置提示词隔离更窄的行为。

  • 准确性失败可能阻止发布,而语气和连贯性则作为指标持续跟踪。一位主持人提议保留那些当前不支持的行为测试,直到模型或产品有能力满足它们;Reggio 接受了这个想法,因为它可以展示助手如何从长期为红色的评估项,逐步走向最终具备相应能力。

  • 最严重的失败是虚构委派:助手可能承诺“联系财务团队”,尽管根本没有可联系的团队或工具。Brex 主要通过系统提示词应对这一问题。主持人惊讶于即使在金融领域,硬性护栏仍然并不普遍;Reggio 表示网关支持断路器,但他不认为目前真的在使用。

11. 流畅度、人员规模和智能体网络仍是未决的组织押注

  • 讨论提到了一个4级 AI 熟练度框架:用户、倡导者、构建者和原生用户。Reggio 表示,运营团队在结构化培训方面领先于工程团队。管理层的表态很直接:许多职责会消失,但“我们不认为这意味着你的工作必须消失,只是你的工作必须改变”。

  • Brex 通过即时奖金和每两周一次的公司全员大会 AI 展示环节强化采用;展示通常来自运营、财务或人力团队,而不是工程师。公司改版后的工程面试要求使用智能体编程,所有现有工程师和经理也重新参加了这项面试,不记录通过或不通过,只为暴露个人技能差距。

  • Reggio 目前不会把 AI 转化为裁员公式,也不会给出初级与资深工程师谁更容易被替代的判断。Brex 在扩大客户和产品线的同时,将工程团队维持在约300人;他更希望以相同的人员规模实现大幅更高的产出。其他部门的裁员究竟反映 AI 影响,还是普通的绩效管理,仍未有结论。

  • 他最坚定的产品判断,是智能体网络。审计智能体会积极标记诸如反复出现74美元消费、且低于75美元收据门槛的模式;审核智能体负责判断;随后由员工助手收集上下文。在财务智能体与员工助手互相通信之前,这种拓扑“更像一棵树,而不是一张图”;对 Reggio 而言,这也说明确定性 DAG 低估了智能体之间流动式规划的能力。