先锋 趋势 方法 投研 作者
⚡️ 年薪100万美元的10x AI工程师——Alex Lieberman 与 Arman Hezarkhani,Tenex
返回节目精读

⚡️ 年薪100万美元的10x AI工程师——Alex Lieberman 与 Arman Hezarkhani,Tenex

摘要

  • 10x 的创立洞见是:AI 原生工程让按小时计酬变得荒谬——产出更快的工程师创造的价值越多,反而可能赚得越少。 在一次裁掉90%工程团队的重组后,Arman Hezarkhani 被迫用 AI 重建 Parthean 的产品与工程流程,生产级产出随后“提升了10倍”。如今,公司按 story point 产出付费,试图为顶尖工程师提供“上不封顶的收益空间”。
  • 仅靠 story point 薪酬,这套模式就可能带来个人百万美元级别的现金收入。 Arman Hezarkhani 表示,10x 明年“可能”会有不止1名工程师赚到100万美元,而且“非常有可能”会有超过少数几名工程师跨过这一门槛。
  • Story point 仍然可以被操纵,因此10x把激励和招聘,而非计量本身,视为真正的控制系统。 公司筛选“自利,但着眼长期的自利者”(“selfish but long-term selfish”),再让工程师与按 NRR、留存率和账户增长获得激励的技术策略师搭档。这种内部张力会在客户看到成果前形成最后一道质量关。
  • 最有说服力的证据,是把原型开发周期从几个季度压缩到几周,甚至几小时。 10x 用两周将多个量化后的零售视觉模型部署到 Raspberry Pi 4、Jetsons 和 Nanos 上;一个月内做出全球排名第20的移动应用;还把一次被拒的销售提案在大约4小时内变成可运行的健身、健康和营养教练。Hezarkhani 仍提醒:“我们没有声称自己是什么魔法生物。”
  • 10x 当前受限于人,而不是 agent,顶尖技术人才招聘因此成为增长的硬约束。 公司设计了一道“难得不讲理”的 take-home 测试,约50%的候选人不会回复,但通过者最快可以在1周内完成整个流程。
  • 这套技术栈围绕 agent 反馈回路优化,但工具选择仍有意保持流动。 共享的 TypeScript schema 为 agent 提供约束和有用的错误信息;Claude Code、Codex 和 Cursor 会根据任务甚至当天的情况切换。Swyx 质疑这种基于个案的比较,追问是否有全面评测,随后用武士刀作比:工具一旦足够好,手感与匹配度就更重要;Hezarkhani 表示认同。
  • 全自主工程能否实现,关键可能不在原始智能,而在于防止小错误不断累积。 Hezarkhani 认为模型智能是主要瓶颈;Alex Lieberman 指向 context engineering;10x 工程师 Dan 则将问题重新定义为“控制熵”(“controlling entropy”),因为即使错误率只有1%,也可能不断累积,最终让自主回路失控。谈到 MCP,Hezarkhani 称它是“用3个字母表达 API 的词”,Lieberman 则认为它有用,但批评围绕这一标签的炒作和过高融资,同时强调更广义的协议并不只是 API wrapper。

精读

1. 一次被迫裁掉90%工程团队的重组,暴露了 AI 真正的工程杠杆

  • Lieberman 在2020年投资 Parthean 后结识 Hezarkhani。Parthean 是一家 AI 金融工具公司,业务从面向消费者转向金融顾问和 RIA。转折性的对话发生在这次访谈前大约9个月:Hezarkhani 将工程团队缩减了90%,旧有的产品与工程流程已无法维持。

  • 现实迫使公司以 AI 为核心重构流程。Hezarkhani 表示,生产级软件产出随后“提升了10倍”——Lieberman 起初并不相信,因为尽管 ChatGPT 和 Grok 带给他改变人生的体验,他此前从未亲眼见过这种程度的杠杆效应。

  • 由此形成的经济学判断是:一个产出达到原来10倍的工程师,不可能合理地按“每小时1000美元”报价,而按小时计费反而奖励低效工作。因此,10x 改为按产出付费,并追问如何让顶尖工程师获得“上不封顶的收益空间”。

2. 只有当激励延伸到 sprint 之外,Story point 才能发挥作用

  • Swyx 的核心质疑非常直接:软件产出的计量单位是什么——PR,还是 story point?“被计量的东西”难道不会被操纵?Hezarkhani 承认这套系统可以被利用;如果把每一行代码都等同于更多点数,薪酬就会被机械性推高。

  • 他的辩护建立在长期合作关系之上。工程师可以操纵今天的点数,但糟糕的交付会导致客户流失,机会也随之终结。因此,10x 招聘“自利,但着眼长期的自利者”(“selfish but long-term selfish”),同时也招募那些单纯享受与优秀同行一起写代码的人。

  • Lieberman 补充了一道组织层面的制衡:每个项目都配备一名 AI 工程师和一名技术策略师。策略师的激励指标包括 NRR、留存率和账户增长,并在 sprint 开始前对工程计划作最终批准——“以一种健康的方式让两个人彼此对立”,在客户看到任何成果前形成最后一道质量防线。

  • 10x 尚未遇到客户就点数分配或所谓故意压低交付量提出争议,不过 Lieberman 强调,公司还很年轻。Swyx 的解读是:交付不顺时,点数分配会变成政治问题;交付顺利时,所有人都会继续“一路狂奔”。

3. 原型速度正同时成为交付优势和销售武器

  • 最具技术含量的案例来自一家零售科技客户,该客户在门店使用 Raspberry Pi 4。10x 将现成模型与内部训练模型结合并完成量化,再让多个模型并行运行在 Raspberry Pi 4、Jetsons 和 Nanos 上,用于生成热力图、识别排队情况、判断货架补货需求,并通过身体分析支持盗窃检测。

  • 这个原型耗时两周,而 Hezarkhani 表示,以前由成熟工程团队完成可能需要几个季度。他同时保留了限制条件:这仍是一个研究项目,需要长期进行准确率和指标优化,并不能证明团队是“魔法生物”。

  • 快速原型也改变了销售方式。一名健身领域的网红认为10x还太早而拒绝合作,且10x 当时没有内置设计团队;随后,一名工程师在大约4小时内做出了一个可运行的个性化健身、健康和营养教练。该应用尚未上线,但10x 已在客户候选名单中升至首位,获得了开发机会。

4. 结构化代码有助于 agent,但没有哪一个编码 agent 能长期称王

  • 10x 的默认选择是前后端都使用 TypeScript,并共享类型和 schema。其吸引力在于,既保留 JavaScript 的灵活性,又利用 TypeScript 的约束和错误信息,让 Claude Code、Cursor 或其他 agent 可以运行代码、检查失败原因并继续迭代。

  • Hezarkhani 否认团队存在“年度、月度,甚至周度最爱 agent”。团队今天下午4:42可能更偏好 Claude Code,明天却会发现 Codex 在特定任务上更好。

  • Swyx 反驳称,这些判断带有个案性质,如果没有全面评测,就容易受到“抽签运气”的影响。他也提出了另一种基于实际体验的看法:编码 agent 一旦足够强,最终取决于它是否适合使用者——包括协作方式,以及它写出的代码是否符合工程师偏好的风格。Hezarkhani 表示认同。

  • 尽管工具带来了巨大杠杆,Hezarkhani 仍称10x“100%受人力约束”。眼下的瓶颈是找到足够多的优秀工程师,并建立能够维持交付质量的流程;打造10x 自有技术则是更长期的目标。

5. 当错误在自主回路中不断累积,自治就会被熵拖垮

  • 许多同行已经放弃 take-home 面试,但10x 仍然保留,并将题目设计得“难得不讲理”;约50%的候选人不会回复。代价换来的是更短的流程:两次通话、take-home 测试、评审,以及1至2次最终面试,最快可能在1周内完成。

  • 当被问及什么阻碍了一个完全自主的高级工程师时,Hezarkhani 认为主要瓶颈是模型智能,并指出现有训练对 Python 和 Django 的泛化明显优于对完整后端分布式服务的泛化。Lieberman 则强调 context engineering,即把正确的信息输入 LLM,并准确引导其注意力。工程师 Dan 将问题进一步概括为“控制熵”(“controlling entropy”):即使准确率达到99%,剩余的1%也可能在自主回路中不断放大,直到累积误差令 agent 偏离轨道。

  • MCP 的讨论体现了双方关注点的差异。Hezarkhani 称 MCP 是“用3个字母表达 API 的词”,并以一种不作价值判断的社会学视角看待技术社群如何创造术语。Lieberman 认为 MCP 有用,但批评围绕一个改名概念展开的炒作和过高融资,同时强调更广义的协议并不只是 API wrapper。他还认为,真正的争论比一场无人质疑的演讲更能暴露问题。