先锋 趋势 方法 投研 作者
E231|从B2B到A2A:Agent新基建,如何让“一人企业”做全球生意?
返回节目精读

E231|从B2B到A2A:Agent新基建,如何让“一人企业”做全球生意?

摘要

  • 张阔的核心判断是,全球约30万亿美元的B2B贸易未来可能从数字化走向A2A;Agent要证明的核心不是聊天,而是能否把token变成交易效率和客户ROI。 Alibaba.com当前交易额约700亿美元,渗透率仍低;Accio截至3月已有1,000万MAU,且仍在快速月环比增长。其把从询盘到建立可靠商业关系的沟通周期由一周压到一天,即“缩短到原来的五分之一”。

  • 垂直Agent的壁垒不是再包一层大模型,而是把准确数据、强化学习、安全可靠性和超长上下文做成闭环。 商品真实价格、物流、关税和到手价的微小误差都可能决定利润;阿里26年的交易积累与每天上百万次沟通,使结果可能“百分之九十或者九十九地接近facts”,但张阔明确不承诺100%。成交、复购与试错失败又会回流为长期奖励信号。

  • OpenClaw展示了开放Agent的爆发力,Cowork则更像面向知识工作者的下一代工作台,但两者都绕不过逐步验证。 OpenClaw开放、泛化,却有配置门槛、强化学习和安全挑战;Cowork的对象更清晰,与Anthropic模型的磨合也更紧。张阔不认同“一次性完成才AI native”:18步流程若每步准确率90%,就是“百分之九十的十八次方”,最终结果几乎不可用。

  • AI不会一刀切地杀死SaaS,但计费依据可能从坐席转向usage,产品形态会从标准流程转向低成本个性化。 张阔举例,一款小时工招聘Agent能解释着装、报到、停车、病假和社保,较短信交互提高show-up率;这说明AI也可能强化垂直SaaS。真正的分野是能否把token变成客户可感知的ROI,而非产品是否被贴上SaaS标签。

  • Accio Work瞄准的是“一人企业”的完整后台:research到sourcing等前段可能只占日常工作的10%—20%,经营、补货、客服、库存和多平台发布才是其余部分。 张阔称中小企业中至少30%—40%可能是solo entrepreneur;平台将自有research与sourcing能力、Shopify等平台的browser use/computer use,以及HR、payroll、finance、tax等第三方sub-agent组合成“开箱即用”的多Agent系统。长期形态是master agent统筹多个sub-agent,企业内外都可能转向Agent to Agent。

  • 生成式搜索会压缩广告位,却未必压缩广告收入;能留下来的只会是可解释、强匹配的performance广告。 泓君指出,结果从1,000个压到5个,传统曝光库存必然减少,张阔认同“display那种广告肯定没有什么太大意义”。他的反论是,更丰富的意图和多模态输入会扩大query量,而候选广告若确实满足价格、认证、产能等标准,点击和转化可能提高。

  • 未来的收入仍会沿三条轨道展开:高价值token、精准供需匹配,以及支付物流等供应链服务。 Accio可能采用带免费额度或月度cap的usage计费;广告继续以performance为主;担保交易的take rate仅约1—2个点,还可叠加payment terms和物流。赢家不是token最便宜者,而是“单位token的智力密度”与经济价值最高者。

  • 衡量AI转型,最差的指标是token或代码量,最敏感的信号则是新模型出现时组织“兴奋、焦虑还是没感觉”。 阿里国际站每季度约有300个idea、150个上线、最终约50个work,AI的目标是增加真正产生business impact的数量;张阔同时称今年EBIT大概到18%左右,并表示相比去年仍是快速增长。兴奋说明新能力能解旧问题,焦虑说明可能只是wrapper,而“最差的结果就是你没感觉”。

精读

1. 硅谷的优势不是没有焦虑,而是生态位分得更细

  • 张阔观察到,美国AI创业生态不只聚集应用公司,模型调用、inference降本和构建工具也形成了多层市场。Together AI、Fireworks等公司为上层应用提供模型基础设施,垂直团队则像“永远在推土机前面几十米在跑”,靠几十米的身位持续生存。

  • 语音转文字就是这种独立生态位。Alibaba.com与Accio也在采用Wispr Flow等产品,因为多模态query的增速可能约100%:用户越来越愿意发语音、照片或视频,而不是只输入关键词寻找商品。

  • SaaS并未因AI天然失效。张阔举例,一家服务连锁超市和餐饮企业的小时工招聘产品,用Agent向蓝领解释着装、报到、停车、sick leave和社保规则,较原来的短信交互带来更高show-up率;AI在这里直接改善了既有产品。

  • 硅谷路演一晚能涌入500甚至1,000人,焦虑并不比国内少;但离开硅谷后,客户不会关心抽象的token economy。中小企业最先问的是“到底产生什么价值”,整个产业仍在证明底层token如何变成真实ROI。

2. OpenClaw能否穿越热潮,取决于能留下多少工作流

  • 张阔对GTC叙事的概括是token经济:单token所需算力和成本指数级下降,由此孕育更多应用,OpenClaw只是近期最具现象级的产品之一。

  • OpenClaw开源、泛化,可连接多个模型和工具,但并非真正开箱即用。配置仍要求技术能力;开放性太强又使“什么做得好、如何记住它做得好”难以定义,强化学习与安全也需要长期磨合。

  • 张阔给热度设置了一个留存检验:如果用户能沉淀长期工作流,它就真正解决了问题;如果“留住的工作流非常有限”,热潮过后就可能退潮。开放架构本身不是商业价值的替代品。

  • 相比之下,仍处research preview阶段的Cowork已显露下一代工作台或Agent platform的轮廓:对象集中在程序员、分析师、research、finance和lawyer等knowledge worker,分层架构清晰,与Anthropic模型的匹配度也更高。

3. 企业级Agent不是取消步骤,而是把每一步变得可验证

  • 泓君提出的分野很尖锐:OpenClaw似乎更适合在聊天框里完成爬网页、转录和修音频等To C任务;企业若把AI嵌入播客制作,则必须明确一二三步,并保证每一步质量,Cowork因而更像To B工作范式。

  • 张阔的修正是,一次完成还是step by step并非核心分野。最agentic的产品是“所有工具的工具”,不同专业人员会用出自己的流程,并以自身expertise定义成功标准、校正中间步骤,再让系统记住可接受的结果。

  • 他的误差例子构成整场对话的重要约束:制作播客若有18步,每步误差10%,最终就是“百分之九十的十八次方”。所以核心节点必须verify;学会之后,Agent才可能用更少交互完成后续推理和执行。

  • 可接受阈值也随stake变化:收集每日资讯只需达到偏好阈值;据此做量化交易要求更高;若信息要指导未来一年生产并影响整体ROI,模型、工具和工作方法都必须针对行业重新设计。

4. Alibaba.com与Accio正在并行推进B2B的两种重构

  • 第一条线是重构marketplace。Alibaba.com把AI嵌入搜索、推荐、沟通、交易、物流与payment terms,买家不再独自筛选海量信息,而是让AI推动从意图表达直到线上成交的订单流程。

  • 第二条线是从B2B走向A2A。Accio以sourcing为核心,截至访谈所称的3月已达1,000万MAU,且月环比仍快速增长;它向前延伸至research、ideation与产品设计,向后覆盖供应商筛选、沟通、交易、运输和售后。

  • 对中小企业而言,决定下一个killer product往往决定现金流方向。选错意味着高昂试错成本;选对后,企业才可能从单店、单品逐步scale,因此Accio试图自动化的并非简单找货,而是完整的产品定义过程。

  • 从询盘到建立较可靠商业关系,张阔称时间约缩短到原来的五分之一:原需一周的sourcing沟通,现在可能一天完成。AI还能把粗略想法整理为包含图片、文字和3D内容的design pack,减少语言、时差和专业表达造成的摩擦。

5. 垂直模型首先要解决事实,而不是生成更流畅的回答

  • 选品起点是索引全网碎片信息:类似商品、Amazon等平台的搜索与交易表现、评价、销量和定价区间,以及潜在margin。Web 2.0工具能提供数据,却很难同时保证足够宽、足够及时以及逐页读取后的准确性。

  • 张阔把Accio额外投入概括为四类:数据准确性、有效的reinforcement learning、安全与可靠性、超长周期上下文。泓君指出通用模型的deep research能力已经很强,但这些B2B约束仍需要模型之外的大量工程和工具组合。

  • 最critical的是商品真实价格和到手价:平台需从沟通上下文与合同中识别隐藏价格或额外费用,再扣入物流和关税。定价只差一点就可能决定商家利润,因此“市场最好的方案”不能建立在hallucination上。

  • Alibaba.com每天上百万次围绕设计与技术细节的沟通,加上26年积累和互联网索引工具,能为ideation到design pack提供信号。张阔谨慎地说,不能承诺100%准确,但若能“百分之九十或者九十九地接近facts”,就已明显优于无约束生成。

6. B2B强化学习的奖励来自交易闭环,而且反馈异常漫长

  • 高stake任务要求先把链条里的每一步尽量做对。用户会持续反馈某个设计分支好不好、技术能否实现、margin是否成立;平台记录这条逻辑链,形成比单次点赞更细的过程监督。

  • 张阔希望奖励的是“每个token能产生的价值更大”,而非漫无目的推理和搜索。若相同商业任务能以更短链条、更高完成率交付,单位token经济价值与系统效率才真正提升。

  • Alibaba.com的独特信号在结果端:idea最终是否成交、客户是否持续采购,还是尝试数次后发现“不work”。行业与用户越多,research、供应商匹配和执行工作流就越有机会沿闭环反馈校正。

  • 对“每个行业是否需要不同强化学习方法”,张阔没有装作已有答案,只确认To B与To C差别很大。物流、关税、交货、使用和复购信号周期很长,因此团队在长上下文推理上投入更多;行业级差异尚无足够信息下结论。

7. 安全、回滚和记忆不是附属功能,而是B2B Agent的主体

  • B2B任务既“严肃”又昂贵,平台必须判断信息是否完整、每一步推理是否严谨,并分层保障数据安全。Agent访问企业内部系统时需要保护用户数据并进行沙箱隔离。

  • 长链推理一旦出错,还要能够向前回滚,同时保持上下文连续。这里的可靠性不是把最终答案润色得更像真的,而是能定位错误节点、恢复状态并重新执行。

  • Accio最初是browser-based Agent;下一版Accio Work装在desktop上,把范围从设计和sourcing扩展至daily operation。前一段可能历时约一个月,商品销售、补货和售后则持续半年甚至一年,上下文因此近乎“无限长”。

  • 记忆必须分层:当前对话进入即时推理,多模态设计资料建立索引,其他信息按需访问,客户反馈则沉淀到下一轮产品优化。不是把所有内容永久塞进窗口,而是知道何时取回哪类证据。

8. Accio Work要成为“一人企业”的全球经营后台

  • 产品能力分三层:自有Agent负责research至sourcing;通用computer use与browser use帮助商家在Shopify等平台开店、发布和经营商品;HR、payroll、finance、tax则接入美国垂直产品,作为平台中的sub-agent。

  • 张阔称中小企业中至少30%—40%可能是solo entrepreneur。设计商品花三四天尚可接受,但随后还要在多店铺和多社媒发布、回复customer feedback、管理库存与补货;这些重复运营工作才持续吞噬一人企业时间。

  • 他的工作量拆分是,research到sourcing等前段可能只占日常工作的10%—20%,其余约80%是经营。Accio Work试图让多个Agent协作完成大部分后台任务,人只在关键节点提供标准和少量交互。

  • 客户并非只有微商户:Walmart和Amazon也会在国际站采购包装等产品;客户结构从个体经营者、单店和连锁一路延伸至大型企业。核心服务对象仍是从真实问题出发、依靠全球供应链逐步成长的实体中小企业。

9. 中小企业要的不是Agent零件,而是开箱即用的结果

  • 通用平台展示skills、hook、agent、connector和plugin,对技术人员意味着自由度,对美甲店、餐饮连锁或小型back office却意味着配置负担。泓君指出,很多未接触AI的实体经营者连搭起OpenClaw这一步都会卡住。

  • Agentic产品的变化在于,小企业可以直接输入自己的成功标准,让模型生成专属的产品定义、发布、营销和社媒工作流。过去通常只有规模或预算达到百万、千万美元级的大企业才可能有人专门定制,如今边际成本有机会显著下降。

  • 因此张阔反复限定产品目标:“开箱即用”、解决critical问题、ROI处于合理范围。底层是否拥有最开放的架构并非客户购买理由,能否少配一次工具、少维护一个系统才是。

10. 收费会从坐席迁移到usage,但平台仍保留双轨收入

  • Accio的第一类收费是token-based:自有工具执行任务消耗token,接入的tax、HR、payroll与finance伙伴作为sub-agent也消耗同一额度。张阔仅以不确定口吻举例,可能设置约20美元/月的cap,也可能提供免费额度,用户再按usage提高plan。

  • 这种方式被张阔视为相较传统per-seat更有潜力的下一代商业模型基础,价格最终仍需对应实际使用和产生的价值,而不是单纯按账号计费。

  • 第二条轨道延续marketplace商业模式,包括广告、支付、物流等供需服务费用。Accio Work因此不是单纯订阅软件,而是usage收入与既有交易基础设施并行。

11. 生成式搜索压缩候选数量,也把广告推向强匹配

  • AI让用户用完整上下文表达参数、限制和目的,也可上传语音、照片、design pack或PDF。匹配不再只看标题和关键词,还会读取商品全部上下文、工厂能力、certificate、use case及供应商私有数据库。

  • 张阔认为结果更好会提高query和交互频率;泓君的担忧则是,Accio已能根据需求匹配供应商并出现发邮件联系的环节,原来展示1,000个结果,现在只需5个,广告库存显然会减少。“这个理解肯定是对的”,张阔没有回避。

  • 他的边界是,“display那种广告肯定没有什么太大意义”,未来以performance为主。五个结果中的广告必须本身足够精准,并明确标识广告身份、解释满足了哪些标准,不能把不相关卖家硬塞给买家。

  • 张阔援引Google近期财报作为观察,称AI Overview或AI Mode同时提高了停留时长、query数和广告收入,因为更精准的点击减少广告主浪费;他也称Alibaba.com今年的搜索与广告是增长较快的两条轨道。

12. 30万亿美元市场足以容纳三种长期价值捕获

  • 第一种是对设计、research和全球sourcing按usage收费。这里的竞争标准不是绝对token价格,而是“单位token的智力密度更高”以及每单位token创造的商业价值更大。

  • 第二种是供需匹配。能生产相似产品的供应商可能有十家或一百家,卖家可以通过商品让利或performance广告争取更优质需求;只要匹配真实,这种商业模式就可能延续到Agent时代。

  • 第三种是供应链服务。Alibaba.com的担保交易take rate约1—2个点,本质类似保险:争议发生后平台先判断、补偿,再向责任方追索;payment terms和物流也可沿用相似收费逻辑。

  • 张阔给出的规模对比是全球B2B约30万亿美元,而Alibaba.com当前约700亿美元。其增长命题不是从存量客户多收一点,而是让更多中小企业进入全球交易,扩大平台scale并创造“增量GDP和增量价值”。

13. 数据飞轮与master agent定位构成Accio的护城河

  • 阿里26年的平台积累带来每天上百万乃至上千万级的沟通、query与transaction信号;在此基础上,团队会进行模型的中期和后期训练,也会把一些数据注入早期训练。国内开源模型主要是Qwen,对海外用户则尽量采用各场景最合适的SOTA模型。

  • Agentic产品还有工作流飞轮:更多用户会留下哪些工具在何种情况下表现更好的记录,随后改善下一轮task选择与执行。张阔认为,这种垂直反馈比简单拥有通用模型更难复制。

  • 但目标客户预算更少、对ROI更挑剔,这既是限制也是约束优势。系统必须持续压缩token,让“单位token的智力”和性价比优于服务高预算企业的产品。

  • A2A设想并非一个Agent垄断一切,而是高频master agent协调多个sub-agent。张阔承认Amazon在优化自身复杂后台上有vertical优势;他的信心限定在多平台经营、广泛产品设计和全球供应链,这些是Accio起步更早、投入更多know-how的方向。

14. 正确指标是客户价值和上线命中率,不是token与代码量

  • Accio首先看retention:用户是否持续回来做更多设计和采购。日常工具还需同时观察使用广度、每个垂直task的完成度、用户采纳率与持续使用,而非只看功能是否被调用。

  • 经济指标则是单位token的智力、价值和性价比持续提高。张阔认为,总token量很可能不作为标准,因为那会诱导团队“多让你浪费点token”。

  • Alibaba.com原有愿景是“让跨境B to B就像online shopping一样简单”,但跨境交易实际可拆成28步,涉及国家、币种、付款先后、资金安全和交付。AI的价值是继续压缩这些步骤,而非把复杂性藏进一次不可验证的回答。

  • 同理,代码量也不是AI工程成功指标:“你可以生成全世界最多的垃圾代码,不改变任何商业结果。”最终仍要回到产品是否被采用、商业结果是否发生非线性变化。

15. AI-native组织的真实压力测试,是新模型出现后的第一反应

  • 招聘模型与infra人才时,学历不如paper、research或开源贡献重要,面试可以直接讨论原创工作;产品经理则要为未来3—6个月的模型能力设计产品。PRD、交互和工程角色也在融合,由更少的人对闭环结果负责。

  • 泓君讲述了一次Anthropic波动约3小时的经历:她观察到硅谷工程师当时停止coding并产生panic。更成熟的结构是master agent管理写代码、读文档、code review和check-in等sub-agent,同时用沙箱与guardrail控制发布风险。

  • 她和张阔讨论的量化公司采用了更激进的方式:researcher在Slack讨论模型改动,随后@Agent读取上下文、写Markdown文档、生成代码,有时人工看一眼,有时在灰度保障下直接commit。关键不是照搬流程,而是让Agent适应公司的工程与风险环境。

  • Alibaba.com过去四年每季度约产生300个idea,其中约150个能上线,最终约50个work;AI若把有效结果从50提高到100,就是100%增长,若到300则触达人类当前idea上限。张阔同时称今年EBIT大概到18%左右,并表示相比去年仍是快速增长,但强调这是许多环节“add up together”的结果。

  • 最终诊断是“兴奋、焦虑还是没感觉”:兴奋说明新模型解锁了旧问题;焦虑说明产品虽建在模型上,却可能只是价值会被下一次迭代挤掉的wrapper;“最差的结果就是你没感觉”,如同高铁呼啸而过,组织仍在旁边开老爷车。

  • Nano Banana让商品图的尺寸与场景关系更易控制,computer use、browser use和长上下文则使daily operation终于可行,团队因此从春节起加班推进Accio Work。难点是Alibaba.com已有26年代码积累,甚至吴泳铭早期代码仍可能在库中;全系统AI native化需要逐步重写。