先锋 趋势 方法 投研 作者
三类软件得以存活:Tasklet 的 Andrew Lee 谈如何竞争成为横向平台
返回节目精读

三类软件得以存活:Tasklet 的 Andrew Lee 谈如何竞争成为横向平台

摘要

  • Tasklet 判断,智能体转型之后,真正可行的软件只剩3种形态:少数横向平台、API-first 公司,以及按结果收费的解决方案公司。 它的目标是成为“替知识工作者取代 SaaS 产品的 AI agent platform”;Stripe 式基础设施则退居 API 背后继续存在,Nathan 还以 Fin 为例:每解决一张客服工单收费0.99美元,卖的是结果,而不是用户看得见的软件。

  • Tasklet 最大的供应商,同时也是最清晰的竞争威胁。 Andrew Lee 表示,约80%的流失用户会转向 Anthropic 产品,通常是因为他们本来就已经在付 Claude Max;Nathan 和 Lee 猜测,Max 每花1美元获得的 token 数量可能是 Tasklet 通过 API 采购能力的“5比1,甚至更高”。这种补贴扭曲了客户预期,也让 Tasklet 长期处于几乎薄如刀刃的毛利水平。另一方面,Opus 4.7 由 tokenizer 驱动、约30%的成本上升,也促使 Tasklet 将其设为可选模型,而非默认模型。

  • 历时6个月的重写,用面向 agent、具备缓存感知能力的文件系统架构取代了聊天历史,目标是支撑可能运行10000x的 agent。 Tasklet 现在把完整历史存进文件,再向模型发送提示和一份固定长度、保真度逐步下降的摘要:近期对话保留工具调用和思考过程,较早内容则逐步丢失响应、参数和细节,最后才进入 LLM 摘要环节。“如果文件就是 agent 呢?”是这套设计的核心判断;剩下的问题是,智能体仍会偶尔遗忘,压缩也依然成本高昂。

  • “永远押注模型”这一判断被验证,但随着可信替代方案出现,Tasklet 正从 Claude 至上转向模型中立的编排层。 Claude 4.5 解锁了更好的 computer use,Opus 价格从15美元降至5美元扩大了可用范围,而4.6在 computer use 和代码生成上的提升足以支撑 Instant Apps。Lee 表示,GPT-4.5 已经非常适合 Tasklet 的场景,能够很好地驾驭其 harness,并足以与 Opus 4.6 一较高下;Tasklet 已与 OpenAI 签约,并预计 Anthropic、OpenAI、Google 以及开源模型将提供有价值的成本—性能选择。Kimi 和 DeepSeek 也在其测试之列。

  • Tasklet 真正可防守的切口,不是独占能力,而是持久化企业自动化的操作体验与治理能力。 Lee 承认“大家都在做同一件事”,几乎所有通用 agent 都能写代码或完成知识工作;Tasklet 转而优化云端托管、全天候运行、多人共管、审计日志、护栏、成本控制,以及跨越数千次触发的记忆能力。因此,它对企业的推介是:“押注我们,就是押注所有人”,由 Tasklet 充当中立的模型与成本仲裁者。

  • 生成式 UI 的到来速度,已经快到足以抹平应用层的大块差异化。 Tasklet 3月发布的 Instant Apps,可以凭一条提示生成连接数据的 dashboard,甚至生成可运行的邮件界面;如今团队内部需要定价分析工具时,已经直接让 Tasklet 生成交互式工具,而不是在 BigQuery 或传统 dashboard 软件里搭建。由此 Lee 认为,“Salesforce 真正陷入麻烦了”:agent 让 schema 更容易重建、数据更容易迁移,也让积累多年的应用代码价值下降,但他预计 Salesforce 会变成一家更小的公司,而不是彻底消失。

  • 更好的模型不会消灭 harness 的商业价值,只会把价值推向成本、可靠性、权限和可逆执行。 Lee 更喜欢“mecha suit”这个说法:存储、算力、API、持久化上下文和监督机制,能够放大模型的效用,即使这种智能优势只持续6个月。路线图包括“回滚整个世界”、只在涉及重大后果的操作前要求审批,以及生成可测试的迁移脚本,而不是让记录穿过 LLM;与此同时,Tasklet 内部 token 支出估计约为工资总额的5–10%。

精读

1. Tasklet 重做一切,因为工作流自动化的边界太窄

  • Lee 找不到过去6个月里还有什么“实质性的东西”被保留下来:视觉设计、应用结构、连接、computer use、agent 核心、上下文管理和压缩机制全部重做。主导产品的信条仍是“速度是唯一护城河”,但产品底层几乎每一个假设都变了。

  • 10月版本的产品让用户描述工作流,再由 Tasklet 执行。很快出现的反馈改变了产品边界:客户一旦把自己的上下文和系统访问权限交给 agent,就不愿意只把它限定在异步工作流里;他们还希望与同一个 agent 进行同步对话。

  • 这带来了一个看似简单、实际极难的产品要求:把交互式工作和周期性自动化放进同一条漫长而线性的对话。如果每次触发都把此前所有运行记录重新喂给模型,最终就意味着发送数百万个无关 token,理想体验在技术和经济上都会变得不可行。

  • Computer use 已经从最初事后“外挂”在 Windows、后来 Linux 机器上的功能,变成产品的关键路径。如今 agent 会常规执行 shell 命令、操作文件和数据库,并在无头 VM 与浏览器 VM 中跨次运行保留状态;如果现在 computer use 失灵,Lee 说,“一切都会宕掉”。

2. 文件系统成为 agent 的持久记忆

  • Tasklet 对架构的根本倒置是:“如果不是把历史作为发送给 LLM 的东西,而是把历史放进文件系统呢?如果文件就是 agent 呢?”提示词由此变成一张简短的地图,说明有哪些内容、模型应该检查什么,把实际记忆从上下文窗口的尺度扩展到文件系统的尺度。

  • 当前轮次保持高保真,通常包括思考区块、工具参数、工具响应、文件和最终答案。较早的轮次则逐步丢弃思考内容,工具响应和参数被截断或删除,调用被折叠,assistant 消息被压缩,只有最早的材料会进入 LLM 生成的摘要。

  • 压缩按照老化分桶进行,这样 Tasklet 不必持续让缓存前缀失效。分桶缓慢累积,跨过阈值后再收缩;其基本假设是近期事件更重要,而当某个旧细节重新变得相关时,agent 仍能搜索完整的文件系统历史。

  • 每次交互后都会增量维护,甚至可以在一次很长的运行过程中完成。Tasklet 会持久化维护结果,因为反复摘要旧材料本身就会消耗大量 token;Lee 的限定仍然关键:系统“总体上能工作”,但用户仍会反馈遗忘细节,而且成本依然高昂。

3. 随着上下文移出提示词,缓存变得更重要

  • 文件系统上下文减少了默认发送的历史内容,却增加了检索信息所需的工具调用次数,因此缓存效率变得更重要,而不是不重要。Tasklet 的压缩机制由此同时优化相关性和前缀稳定性,而不是把摘要当成一个孤立的记忆问题。

  • Anthropic 的缓存目前持续5分钟,通常可以覆盖一次活跃会话或一次 agent 运行,但覆盖不了下一次定时触发。Lee 认为这可以接受,因为大多数客户的自动化任务每隔几小时运行一次,或每天运行一次,而不是每半小时运行一次。

  • OpenAI 的底层机制明显不同:它会自动缓存任意前缀,持续24小时。Anthropic 则要求显式管理,并且每次调用最多只能设置4个缓存点,因此 Tasklet 必须做供应商专属的转换,同时尽量让不同模型看到的逻辑上下文保持一致。

  • 目前缓存基本按 agent 划分;Tasklet 在不同 agent、组织或用户之间几乎没有获得实质性的复用。Lee 不愿透露计划中的实现方式,但认为如果能在更广的层级安全共享可缓存材料,节省空间会非常大。

4. 模型进步打开了新产品,但成本仍决定部署方式

  • Claude 4 的能力足以让 Tasklet 起步,而4.5首次大幅解锁了 computer use,以及导航连接和激活工具的能力。12月 Opus 价格从15美元降至5美元同样意义重大,因为 Tasklet 因此可以不再主要依赖 Sonnet。

  • Lee 将 Claude 4.6 描述为无头环境和浏览器使用能力、以及代码生成能力上的扎实增量改进,这一进步促成了 Instant Apps。Opus 4.7 更擅长一次性写代码和处理长项目,但对于 Tasklet 这种迭代式知识工作负载,没有带来同等幅度的跃升。

  • 4.7 的 tokenizer 变化让 Tasklet 测得的成本上升约30%。由于成本最终会传导给用户,Tasklet 没有把4.7设为推荐默认模型,而是计划将其作为明确标注“成本更高”的高级选项;这是一个罕见的案例,模型经济性压过了 benchmark 领先地位。

  • Anthropic 起初胜出,是因为其他模型无法可靠驾驭 Tasklet 的发现、连接激活和上下文管理 harness。这个限制如今已经被打破:Lee 表示,GPT-4.5 已经变得非常出色,相比5.4在他的使用场景中是一次巨大跃升,能够很好地处理同一套 harness,并足以与 Opus 4.6 一较高下。

5. Tasklet 正把单一供应商依赖转化为中立平台杠杆

  • Lee 谨慎地同时强调 Anthropic 关系的两面:Anthropic 的模型让 Tasklet 成为可能,其团队提供早期访问和快速支持,也认真对待 Tasklet 的反馈。但关闭 Tasklet 的用户中,约80%随后会选择 Anthropic 产品。

  • 用户取消的首要原因未必是能力,而是他们已经订阅了 Claude Max。每次模型发布都帮助 Tasklet,但每次 Max 计划升级都会让 Tasklet 更难销售;Lee 表示,Anthropic 的补贴定价制造了“扭曲的预期”,让客户高估第三方能够提供的模型使用量。

  • 2位发言者都不知道 Max 相对 API 的确切优势,但 Labenz 的直觉估计是5比1,Lee 回应:“我也会这么猜——大概5比1,甚至更高。” Tasklet 必须解释,自己运营在“毛利相当薄如刀刃”的水平,却在与设定参考价格的供应商正面竞争。

  • 战略答案是保持中立:“押注我们,不是押注 Anthropic、OpenAI 或其他任何一家。押注我们,就是押注所有人。” Labenz 认为,从 Claude 至上转向多模型抽象层的时机异常好;Lee 毫不含糊地回应,这“确实一直”是计划的一部分。

6. 持久化企业自动化是 Tasklet 选择的切口

  • Lee 的最大让步是:“大家都在做同一件事。”随着模型获得文件、浏览器、计算机和代码等通用工具,Claude Code、Codex、Tasklet 以及其他 agent 越来越能同时完成编码和非编码工作,差异化转向优化取舍和工作流体验。

  • Tasklet 可以连接 GitHub、写代码并生成 pull request;Lee 甚至会在 Tasklet 内起草营销内容,再让它创建 PR。但他仍预计,在重度工程工作上,专门的 coding harness 会更聪明、更便宜,呈现也更好。

  • Tasklet 转而优化“面向企业的知识工作全天候自动化”,尤其是归组织而非个人所有的工作。企业的开票流程不能因为某人合上笔记本,或者被 Mac Mini 的电源线绊到而停止;它需要云端执行、多人管理、可审计性、护栏和成本控制。

  • 它的记忆系统正是为这个市场设计的:一个由邮件触发的 agent 一年可能运行10000x,却仍必须保留早期指令中的相关内容。适合边界清晰的 coding session 的上下文重置,并不适合持续处理企业收件箱的 agent。

7. 当智能不再稀缺,mecha suit 会放大模型能力

  • Labenz 质疑“harness”这个词是否已经过时:这项工作越来越像是在拓展模型的世界,而不是约束一只失控的动物。Lee 更喜欢“mecha suit”:系统提供存储、算力、API、用户沟通、记忆和控制能力,让底层模型真正行动起来。

  • 用户经常以为屏幕上的一个动作几乎直接对应一次模型调用,但 Lee 表示,翻译层正变得复杂得多,复杂度可能增长10倍。他预计,即便基础模型的 API 趋于收敛,记忆、监督和工具连接方面的突破仍会继续扩展能力边界。

  • Labenz 的反驳值得保留:最好的 harness 相比最简 harness 所带来的能力领先,似乎正在缩小。Lee 同意,当前模型配上糟糕的 harness,可能击败一年前配上优秀 harness 的模型,但他称模型和 harness 的改进是“乘法关系”且“正交”的;即便工程投入只能买来6个月,“那也是6个月”。

  • 智能并不是唯一的生产指标。一旦 agent 已经聪明到可以每天点午餐,继续提升推理能力可能贡献有限;成本、延迟、可靠性、可观测性和审批机制会占据主导。Lee 提到 Anthropic 的 supervisor-agent 路径:由较小模型调用较大模型,在 harness 层面以远低得多的成本接近前沿性能。

8. 大型实验室正在趋同,新架构仍可能重置赛跑

  • Tasklet 可以快速测试模型,但生产支持更慢,因为思考区块、提示词、缓存和失败模式各不相同。它的初筛坦率地说“主要靠感觉”:GLM 已经测试过,而 Google、Kimi、DeepSeek 和 OpenAI 看起来都足够接近前沿,值得投入更深入的工作。

  • 用户需求是外部检验的重要一环。Lee 回忆,3.5发布后不久,他曾驳回客户关于其早期产品基于过时 GPT 模型的意见;“结果他们完全说对了。”相比之下,他还没有看到客户有实质性地要求 Tasklet 加入 Grok,但也不会排除这一可能。

  • 在大型实验室之间,Lee 看到的是由相互模仿驱动的趋同:他刻意称之为“轻率”的判断是,Opus 4.7 借鉴了一些 Codex 式的精准度,而 OpenAI 在观察 Claude Code 后改进了 Codex;5.5更长的通用 agent 工具调用能力,则延续了这场相互借鉴。一种截然不同的路径,例如 JEPA,仍可能“摇动雪球”,但他认为结果尚未确定。

  • 模型的性格仍可能分化。Labenz 转述 Andon Labs 的发现:GPT-5.5 运行其业务时“很干净”,而 Opus 4.6 和4.7可能会“无情”;Lee 的个人经验是,Anthropic 更有创造力、更具同理心,也更像人,而 OpenAI 则更冷静、临床化。Tasklet 尚未收到 agent 做出不道德行为的报告。

9. OpenAI 同时带来供应多元化与第二个平台威胁

  • Tasklet 已与 OpenAI 签署协议,并预计几个月内提供广泛的模型选择。Lee 仍可能在许多工作负载上推荐 Anthropic,但预计 Anthropic、OpenAI、Google 和开源模型将形成有价值的成本—性能梯度;Kimi 和 DeepSeek 也在 Tasklet 的测试之列。

  • 支持多家供应商,意味着必须把定制层压缩到尽可能小。Tasklet 希望 agent 的持久状态在切换模型时不需要经历翻译,因此偏好通用工具和提示词,只在 API 或模型行为确实无法统一时加入模块化的模型专属调整。

  • 如果 OpenAI 继续允许第三方工具使用客户的核心账户,最终可能让 Tasklet 用户自带 token。若这一模式流行且能够长期存在,Lee 会将其接入;他不认为 Tasklet 只是 token 转售商,同时也认为基于账户的访问方式可能有助于用户上手。

  • OpenAI 关闭 Sora 并据报道重新聚焦企业生产力后,竞争担忧有所上升。AgentKit 此前还不像是 OpenAI 的“A game”,但 Codex 从陪跑者迅速变成潜在品类领导者,说明专注执行能够带来什么变化。Lee 用另一条事实保持平衡:目前还没有客户告诉他,自己因为 OpenAI 产品而离开 Tasklet。

10. 共享组织上下文正成为产品的连接组织

  • Tasklet 已经在设置页面露出尚未公布的组织和 workspace 基础设施。Lee 描述了一套层级结构:组织上下文记录公司、使命和价值观;workspace 保存团队资源、季度 OKR、流程、文件和品牌语调;单个 agent 则保留工作流方案、上传内容和针对特定对话的指令。

  • 共享连接是第一个已经上线的 workspace 层级上下文。技术负责人可以一次性配置 API key、header 和服务访问权限,再把这些连接提供给团队成员;新员工无需寻找凭证或重新搭建集成,就能开始使用 agent。

  • 路线图还包括共享 skills、跨 agent 记忆和原生共享文件系统。如果用户向一个 agent 解释了某个持久事实,另一个 agent 也应该能够检索到它;这正是把同步协助和周期性自动化纳入同一套连贯系统所需的“共享大脑”。

  • Lee 承认,另一个产品也被他说成名为“shared brain”,并提出一个明确标注为猜测的判断:对方在“brain side”上可能领先更远,而 Tasklet 的 agent 更强。他的目标是在不放弃 agent 领先地位的前提下,追上并超过对方的上下文层。

11. Instant Apps 说明应用界面的保质期为何正在缩短

  • Tasklet 的战略最初来自对 Shortwave 的威胁;Shortwave 仍在运营,是一款 AI 邮件客户端。Lee 意识到,通用 agent 很快就能通过生成邮件界面本身来回答“展示我的收件箱”;因此,一个嵌在精心构建的应用 UI 里的 agent 有明确的保质期,可能远短于10年。

  • 第一个应对方向是通用工作流 agent,但客户拒绝把周期性工作和日常协助分开,因为那意味着两套系统必须重复维护上下文。Tasklet 因此再次扩大边界,也进一步印证了 Lee 的判断:每一道看似可防守的应用边界,都在被更通用的产品吸收。

  • 3月发布的 Instant Apps,可以通过一条提示,生成连接到任意可用集成数据的 UI。如今 Tasklet 团队需要探索定价变化时,会直接要求它生成一个分析 dashboard,加入阈值和开关,而不是打开 BigQuery 或配置传统 dashboard 工具。

  • 对 Shortwave 的最初担忧已经可以直接验证:Tasklet 今天就能生成可运行的邮件 UI。它目前还不如 Shortwave,但 Lee 认为差距会迅速缩小;“这类产品的高端能力”到来的速度,明显快于团队原先预期。

12. 如果通用 agent 吸收 SaaS,最终只剩3种软件形态

  • Tasklet 的终局,是由一个横向 agent 取代知识工作者在 Word、Notion、Linear 以及其他标签页之间来回切换的流程。数据通过 API 进入,定制分析由生成式代码完成,界面按需生成,“最好的 harness”因此可以在几乎所有领域具备智能。

  • 横向平台是第一类幸存者,Lee 预计最终赢家会非常少,因为用户不会反复维护同一套上下文和连接。客户可能接受一个知识工作平台、一个 coding 平台,也许再加一个个人用途平台,而不会接受成千上万个分别内置 agent 的应用。

  • 无头基础设施是第二类。支付业务复杂、受监管且后果重大,因此即使没人访问 Stripe 的 dashboard,Stripe 也可能继续存在;它真正持久的产品将是 API。第三类则销售解决方案或结果,包括 AI 律师和房地产 agent,其底层软件可能完全不可见。Nathan 此前提到的 Fin 每次解决收费0.99美元的服务模式,就是一个例子。

  • Salesforce 处在最脆弱的中间地带。Lee 的判断非常明确——“Salesforce 真正陷入麻烦了”——原因在于其大量积累的代码正在过时,竞争性 schema 更容易生成,而 agent 通过更容易迁移数据,正在削弱系统记录和供应商锁定。他没有预测 Salesforce 会消亡,但预计它会变成“一家小得多的 Salesforce”。

13. 信任、单位经济和基础设施比演示效果更重要

  • Labenz 的个人 agent 曾删除一个 Slack 导出文件,而该文件花了约4天、受速率限制地组装完成,这件事集中体现了可靠性的要求。Lee 希望引入带版本控制的文件系统和操作日志,让用户能够“回滚整个世界”;撤销文件操作相对直接,但逆转外部 API 操作可能需要保存完整的执行日志。

  • 权限机制应该围绕重大后果设计,并且操作体验要顺畅,而不是对所有动作一律阻断。邮件 agent 可以自由读取、搜索和起草邮件,但在发送前要求审批;当拟发送的消息抵达这个不可逆的边界时,Tasklet 可以推送通知。

  • 对于高可靠性迁移,Lee 不接受把记录放进模型上下文、再相信模型能够复现结果。agent 应该先生成迁移脚本和测试,在测试环境执行,向人类展示代码与理由并获得批准,最后运行这一确定性的产物。

  • Tasklet 称赞 Blaxel 能快速启动 sandbox,也称赞 Firecrawl 的爬取能力,但仍保留自己的数据库和文件系统基础设施,因为这些层仍然是核心。Credits 被有意设计成足够通用,可以购买 token、搜索服务、即将推出的原生图像生成能力,未来还包括音乐;不计用户 API 调用成本,内部 token 支出估计约为工资总额的5–10%。至于 Mythos,Lee 的坦诚表述是:它的 benchmark 和 zero-day 声明看起来令人兴奋,但在无法访问的情况下,仍然感觉“有一点……像营销噱头”。