Agent 原生云:300万用户、每周10万注册、数据中心与死亡 PR——Railway 的 Jake Cooper
摘要
Railway 的核心押注是,未来10年,agents 将成为软件构建的主导“物种”,因此 agent-native 基础设施会成为一种长期平台迁移,即便今天的热潮最终撞上推理瓶颈。 Jake Cooper 沿着从 assembly 到 C、C++、JavaScript,再到“文字”的抽象阶梯展开分析;终点是数千个 agents 并发工作,此时协调、安全干预和算力效率的重要性将不亚于代码生成。
这条增长曲线是6年扩张、痛苦收缩,以及有意修复糟糕单位经济性的结果。 Railway 曾每月烧掉约50万美元,而月收入可能只有5万美元、银行余额为2000万美元;免费用户又吸引了 bots 和 crypto miners。公司一度限制免费使用,重建业务,如今只有35名员工,却每周新增约10万用户。讨论中同时出现了200万和300万用户两个数字。Cooper 不认同理想化的持续向上曲线:“你其实不希望图表长成那样。”
裸金属既是 Railway 的利润引擎,也是支撑大规模并行 agents 的经济缓冲。 Cooper 表示,购买硬件相较于租用等量云容量约3个月即可回本,尽管硬件按4年折旧;metal workloads 的毛利率约为70%。Railway 称如今绝大多数 workloads 已运行在自有数据中心,只有突发需求才使用 hyperscalers。其运营原则是绝对的:“你永远、永远、永远不该再等算力。你永远应该等的是 intelligence。”
Railway 的架构护城河,在于它能控制网络、算力、存储和编排,并把这些能力推到传统抽象可能失效的 workload 规模。 Agents 需要许多与人类相同的基础设施——版本控制、feature flags、logs、traces、files、snapshots——但速度要快“1000倍”;Cooper 预计传统 CI/CD 会“融化”,认为 Git 之外可能会出现新的东西,并希望每个组件都能在 super-exponential workload 暴露下一个瓶颈时被随时拆除。
Agent interface 颠倒了传统产品设计:复杂度变成有用的输入,而图形化画布则成为审批和上下文界面。 人类可能讨厌一个带40个 arguments、600个 flags 的 CLI,但 agent 看到的是“这么多抓手”;Railway 衡量 agents 在哪里偏离 happy path,再增加抓手来闭环。因此,画布从输入端转向输出端,成为“风暴中的港口”:人类在这里理解变化、保留共享上下文,并批准或拒绝 agents 的操作。
没有廉价的生产级分叉、渐进式交付和可逆状态,自主修复就不安全。 Cooper 仍不相信可以把 AI SRE 直接放进生产环境:如果没有 copy-on-write volumes、只读生产数据、PII 转换、可观测性和受限 blast radius,“这不是它会不会炸掉数据库的问题,而是它什么时候会炸掉数据库的问题”。Railway 的答案是让 agents 克隆服务和状态,在接近生产的环境中验证假设,再合并或丢弃结果。
Railway 每月约30万美元的 coding-agent 支出,押注的是工程产出,而不是节省 token。 Cooper 个人每月使用约2.5万美元,并对这家35人的公司说:“如果你还在手写代码,那你就做错了。”工程师应当审查并整合生成的代码,而架构判断的重要性比以往更高。他提出的 ROI 指标,是最终进入生产环境的 token 占比;最优秀的操作者应被视为值得驾驶“300万美元赛车”的 F1 车手。
竞争重点与技术野心同样重要:Railway 不想只成为“新的 Heroku”,目前也暂不提供 GPUs。 Cooper 认为 Heroku 停滞的原因,是它在 Salesforce 核心业务之外处于边缘位置;Railway 则希望掌控完整的构建与部署闭环,但不照搬 hyperscalers 的架构。他明确表示 Railway 现在不会提供 GPUs,但未来“100%会提供”,因为垂直整合的基础设施最终需要 FLOPs——这更像是对发展顺序的清晰说明,而不是拒绝扩张范围。
精读
上游暂未提供,后续同步将继续补齐。