E223|应用爆发之年:聊聊模型技术进化与商业化
摘要
- 2025 年的应用爆发不是单一模型突破,而是 reasoning、指令遵循和 tool use 等能力共同进步,跨过了“够用”门槛。 徐栋把转折追溯到 2024 年下半年接近年底的 o1:模型从依赖固定 workflow,走向在充分 context 下自行平衡泛化与准确性;Claude Skills、MCP 等标准又把工具显性化,让 AI 从聊天框进入 SaaS、硬件与生产流程。
- 视频生成是当前商业闭环最清晰的模态,单位经济已经足以支撑短剧、漫剧和批量广告。 徐栋判断其能力已从“GPT-3.5 到 GPT-4”,AI 短剧合理成本可压到 2 万元以下,15 秒广告生成成本可低于 10—15 元、市场交付价约 25—50 元;Qwen 与万相组成管线后,“五六个人、十个人”一天可生成约 6000 条广告。
- 企业采购已从验证效果转向精细考核性能、并发和成本,这是模型进入严肃生产的信号。 客户开始分别规定 4K 与 10 万 input 的 TPS、首包延时,智能外呼甚至要求半小时完成 10 万通电话;重复任务和意图理解、抽取则转向小模型,“没必要去跑一个非常大的模型”。
- 推理成本仍在快速下探,徐栋给出的体感是每半年接近下降一个量级。 稀疏结构、混合精度、MTP、模型与芯片协同,以及云端调度和夜间跑批共同贡献降本;Qwen3-Next 以 80B 参数、3B 激活展示高稀疏比,而端侧 Omni 4B 已让约七成通用交互、语音和视觉理解任务有可能本地完成。
- 开源并未与商业化对立,Qwen 的路径是用社区覆盖拉动云,再以持续更新、并发和大模型能力出售 API。 “开出那一个刹那,它就是一个离线的版本了”,闭源服务仍可修正问题;Qwen3-Max 因部署成本未开源,而 DeepSeek 的发布反而活跃了开源生态,扩大了 Qwen 从 0.5B 到 235B 的采用面。
- 应用层的可持续壁垒不是简单套壳,而是专有数据、模型与工作流整合和行业决策能力。 Insta360 用自研模型理解稀缺的 360 度素材,再接通用模型编排,但三分钟全景素材自动剪辑仍需十几元;语义科技的高端家电案例则在一年半后实现销量增长 23%、客单价提高 6% 多,并从单一事业部扩展至集团。
- Token 量适合衡量当前使用热度,却不足以代表长期商业价值,收入最终可能来自 Agent as a Service。 最小与最大模型的成本、收入可能相差 1000 倍,多模态 token 口径也不统一;模型研发投入并未下降,下一阶段目标是让 agent “连续运行,比如说两个礼拜”,通过环境交互、工具和假设迭代交付完整结果。
精读
1. 模型能力“够用”后,讨论中心从缺陷转向商业闭环
泓君回看两年前,行业仍在争论大模型为什么难以进入工作生活;如今手机里普遍已有一个或多个 AI 助手,传统企业也开始大规模接入,问题变成技术演进与商业化如何相互推动。
徐栋把阿里的基模分成三条线:Qwen 挑战语言智能和生产工具调用;万相覆盖图片、视频及编辑,近期重点是 2.5 Preview 与 2.6;纯音频模型 Fun-Audio 则覆盖 ASR、TTS、声音克隆、多语言、方言和口音。
他的客户体感也发生变化:制造业、实体品牌和互联网公司仍是主体,但过去一年出现大量 AI native 公司,在碎片化市场里做出了“非常不错的一些 ROI”。
2. 视频生成正在经历自己的“GPT-4 时刻”
徐栋最鲜明的判断是,若类比语言模型从 GPT-3.5 到 GPT-4,视频生成“已经到 GPT-4 的状态”:它不再主要服务特效和娱乐,而开始进入漫剧、短剧与广告等生产环节。
时长是第一条技术轴线:过去常见的 5 秒、10 秒正在进入 15 秒,下一步可能到一分钟;他期待最终从几张图或一句话直接生成三分钟短视频,从根本上改变产品设计体验。
第二条轴线是镜头语言。模型已能在多个镜头间切换并改变光影,把过去需要导演、摄影和美术协作完成的能力,压缩为普通用户可通过提示词调用的“专业影视级”能力。
3. 角色一致性把视频创作从“抽卡”推向可控生产
徐栋把 Sora 2 带来的启发称作角色一致性(character consistency)能力:用户先录一段约 5 秒的自拍视频,转头并说几句话,模型便可能保持人物形象与音色,在后续创作中持续复刻。
泓君追问这是否意味着真人只需短暂出镜,后面便由 AI 运作;徐栋确认,核心改变正是生成内容的可控性提高,“原来我们可能还是依赖于抽卡”,现在可以在输入端加入更多参考。
动漫制作已经从参考图转向参考视频,因为视频包含人物和物体、背景的形态和大小,以及人物音色等更多信息;徐栋相信,这类角色一致性最终会成为视频生成模型的标配。
4. 短剧与广告已经跑出可计算的单位经济
按徐栋的观察,国内短剧市场已超过电影市场,内容生产正从真人拍摄和大量人工编辑,部分迁移至 AI;增长最快的漫剧先以图片微动的动态漫切入,连续叙事和商业化能力都较强。
按 S、A、B 等品质分层,一部 AI 短剧的合理成本可能低于 2 万元,结合投流后有机会打平或实现不错的收入;若追求精品,则仍需追加后期资源,成本与成片品质同步提高。
15 秒广告的 AI 生成成本可控制在 10 元以下或 15 元以下,而合格素材的市场价格约为 25—50 元。由 Qwen 与万相组成管线后,五至十人一天可能产出约 6000 条,再交付 agency、广告主或流量平台。
5. 语言模型的进步变得细碎,却直接决定速度与成本
高质量数据日渐稀缺后,模型公司转向“精工细作”:从不同角度重组数据、调整前后顺序,提高知识学习效率。徐栋认为,corner case 上越来越惊艳的表现,主要来自这种数据工程。
结构则继续稀疏化,并采用 MTP 等多 Token 预测技术。徐栋举例,首包延时未来可能从 2 秒降到 500 毫秒,但取决于上下文长度;TPS 从过去较好的 30—50,提高到 80—100 以上也“很有可能”。
更高速度意味着机器吞吐提升和成本下降;与此同时,团队仍在长期打磨指令遵循、上下文长度、coding 与工具调用,难点不只是会用一个工具,而是“泛化地用工具”、连续调用多个工具并向深处执行。
6. 2025 年的 Agent 爆发由四项能力共同触发
第一项是 reasoning。徐栋把根本转折追溯到 2024 年下半年接近年末的 o1:模型不再只是依赖所谓的概率,而开始表现出一定的逻辑偏好。
第二项是规模增大后的可控性。过去必须用 workflow 固定关键节点、交叉验证模型偏差;如今复杂指令的理解和遵循增强,只要 context 足够准确,模型便可在泛化性与准确性之间自行寻找平衡。
第三、第四项是 tool use 与开放标准。Claude Skills、MCP 等逐步被接受,工具由隐含能力变成可调用接口,模型于是“跳脱了原来的输入输出窗口”,进入 SaaS 流程、生产环节乃至硬件交互。
泓君追问指令遵循是否来自某项独有技术;徐栋的回答更克制:主要仍与数据集和上下文理解有关,“模型训练其实今天已经没有特别多的秘密”,各家都在精耕细作。
7. AI 硬件真正的新意是完成 action,而非多一个识别功能
徐栋指出,ASR、CV 与硬件结合已有十年;这一轮不同之处在于模型更拟人,能够听懂、看懂、回答并执行任务,而不只是识别摄像头、屏幕或麦克风采集的信号。
他以 Qwen App 点咖啡为例:用户用自然语言选择品牌、口味、糖量和送达时间,并完成支付。系统可结合距离、偏好和历史记录推荐卡片;若迁移到眼镜,理想体验不应照搬 App 菜单,而应依赖 memory 主动缩短操作。
泓君把输入理解为眼镜看到菜单或同事饮品、输出理解为语音;徐栋补充说,真正的输出是商业服务打通后的“action”。这也是 AI Phone、AI PC、智能座舱重新定义产品定位的原因。
8. 阿里的商业化分成企业生产力与产品体验两条主线
与云计算由手游逐步扩散到金融、制造不同,徐栋认为大模型从一开始就覆盖全行业,只是渗透率不同;因此商业化不再先按行业划分,而是看模型与企业、模型与产品两种结合方式。
企业内部的价值是围绕结果重做流程,覆盖设计、coding、research、sales 等角色;面向用户的 App、手机、汽车和消费电子,则借模型改变交互方式,进而改变整个产品定位。
对手机与汽车,低延时、本地化和隐私需求推动端云结合。阿里的 Omni 4B 面向算力较强的设备,但仍需处理功耗与发热;徐栋说,这套架构经过约两三年打磨,正在进入“深水区”。
他估计,通用交互以及基础语音、视觉理解“可能七成以上”可由端侧解决;企业还可通过百炼 MaaS 平台与设备和业务连接,并获得高并发、低延时、可观测与管控能力。
9. 客户已从“效果好不好”转向生产级性能采购
最早客户大量构建垂直评测集,首先验证效果;最近半年到一年,关注点明显转向性能和成本。徐栋把这视为模型进入严肃生产环节、效果基本得到验证的标志。
要求也变得极细:客户会分别给出 4K input 与 10 万 input 的 TPS 和首包目标。智能外呼因有效时段集中,可能要求半小时内完成 10 万通电话,模型并发能力因此直接影响业务可行性。
最近三个月,小模型需求尤其突出。重复任务无需调用最大模型,chatbot 或 agent 的第一步意图理解、意图抽取也适合小模型;客户开始要求将闭源数据与基于闭源模型的数据结合,进行 post-training 或 fine-tuning。
10. 推理成本下降来自模型、芯片和云调度的共同作用
徐栋给出的行业体感是,推理成本“基本上都是按照半年快接近一个量级这样一个下降”;这里的一个量级就是约十倍,但并非单靠模型算法实现。
模型侧依赖稀疏结构、混合精度和 MTP,芯片侧依赖与模型的垂直协同;云端还要提高利用率,通过模型切换、按时段调度任务和夜间跑批,避免算力只有 30%—50% 利用率时抬高单位成本。
Qwen3-Next 是具体样本:80B 参数、3B 激活,相比此前的 30B-A3B 模型,稀疏比更高;徐栋称开发者已能观察到推理效率、效果和速度的明显变化。
泓君以 Google TPU 的软硬协同作对照,认为阿里拥有云、模型和芯片,结构上形成“三位一体”;徐栋补充,垂直一体化不只是芯片与模型,调度红利同样来自云。
11. 开源是云商业化的获客层,不是免费替代品
徐栋回忆,约在 2023 年 8 月,Qwen 7B 的社区反馈打开了全球格局。开源既吸引已经熟悉模型的顶尖研究者和学生,也让推理框架、推理引擎及端侧部署开发者尽早发现 bad case。
Qwen 从 0.5B 延伸至 235B,企业可按场景选择;1.5B、3B 以下模型适合小型部署,32B 是一个“甜点模型”,因为单张显卡即可运行。
开源对阿里云形成正循环,但“开出那一个刹那,它就是一个离线的版本了”。API 可持续修正能力、提供更高并发和易用环境;部署成本很高的 Qwen3-Max 未开源,Qwen3-235B 无法满足的需求也会转向 Max 服务。
泓君问 DeepSeek 是否造成冲击,徐栋的回答相反:它的论文推动技术进步,发布后还活跃了整个开源生态。Qwen 广泛的尺寸跨度及高频更新,使双方更像相互促进。
12. Token 能衡量热度,却不能替代收入与产品价值
徐栋承认 token 是当下观察使用量的好指标,阶段性也可辅助创业估值;长期仍会回归收入,而且收入未必直接来自 token,也可能来自其上封装的 agent。
量纲存在明显缺陷:最小与最大模型的成本和收入可能相差 1000 倍;语音、文本等多模态 token 也缺少统一定义,各家公司口径略有不同。
Model as a Service 关注模型更新、API 可用性、realtime 和跑批等能力,类似 Assistants API 向 Responses API 的演进;Agent as a Service 则调用多个模型,封装标准任务结果,Deep Research 就是徐栋给出的代表。
13. 模型研发投入没有退潮,只是突破不再那么显眼
面对“行业是否更关心商业化”的问题,徐栋给出反共识判断:“模型的研发投入反而变大了。”每家公司和实验室都说自己“不够卷”,说明竞争结果仍能被定量衡量。
不同在于,行业较少再出现 o1 推理或 Nano Banana 编辑那样一眼可见的范式变化,更多投入落在数据清洗、评测标准和工程细节上;连过去基于规则的清洗与评价,现在也可由模型执行。
他期待的 agentic 能力,是让模型“连续运行,比如说两个礼拜”,持续与环境交互、自主思考、作判断和假设。tool use、长上下文、复杂指令与 reasoning 拼起来,才可能交付比单纯文本进出更好的研究或业务结果。
泓君概括这是精耕细作、未必属于“智能”跃升;徐栋保留了定义空间:如果智能可以打分,那么这些工程改进同样会让智能分数持续提高。
14. Insta360 的剪辑难题不是拼片段,而是猜中创作意图
齐鲁教授介绍,影石希望把用户一天乃至一年积累的素材,自动剪成愿意分享的成片;云端自动剪辑已经上线,是公司“更好地记录和分享生活”战略中的关键一步。
“真正的难点不是把用户的片段能够拼起来,而是能够去命中用户的一个剪辑意图。”有人要纪录片式连续故事,有人只要高光和爽快节奏,还有人更在意配乐情绪、镜头语言与转场风格。
合作分成两层:Qwen 多模态模型负责感知、理解、人物事件判断与结构化编排,万相系列负责视频特效生成。比如筛出滑雪失败瞬间,模型既要理解指令,也要从素材里识别真正的失败动作。
目前语义理解已能满足一定需求,更难的是意图可能根本不在素材中,用户也不知道如何表达。齐鲁教授认同泓君的类比:若必须让用户像“好甲方”一样精确定义从雪橇飞出的画面,体验本身就已经失败。
15. 360 度素材构成影石的专有模型壁垒,也抬高了成本
全景相机坚持“先拍后剪”:拍摄时记录完整 360 度现场,剪辑时再选最佳视角、节奏与运镜;即使场景相对单一,也可加入运镜玩法让素材更生动。相较海量平面素材,通用模型对 360 度素材的理解能力较弱。
影石自研全景多模态模型,先对全景素材进行高光提取,后接通用模型完成平面内容理解与编排;泓君把这部分能力类比为世界模型,齐鲁教授表示认同。
世界模型开发仍依赖真实数据、持续扩展的训练方法及稳定云端算力。CES 展示的 VR 无人机也能产生全景数据,但齐鲁教授特别强调,只有获得用户许可并满足合规要求,数据才会进入模型开发。
商业化瓶颈是成本:为用户处理约三分钟的 360 度素材,当前可能需要十几元。影石希望利用全景素材可压缩率较高的特性,先压缩模型输入和 token 数量,再降低自动剪辑成本。
16. 企业 AI 的终局从省五个人,走向找到可增长的需求
吕英杰介绍,语义科技为雀巢、宝洁、泡泡玛特等消费品牌提供消费者洞察 SaaS。2023 年后流量红利见顶,品牌从单纯买流量转向“流量加消费者思维”,客服对话由此成为可分析的意图数据。
客户直接用通用大模型给原始语料打标,准确率常低于 70%;团队从 2021、2022 年起训练垂直小模型,把信息分成消费者画像、产品与服务反馈,以及企业内部归因。某日化客户的退货判责由六人登记,降至一人复审。
吕英杰不认为 AI 会完全替代客服:经知识库校准后,单点产品问答可以比人更准;但优惠券叠加地区补贴、A/B 凑单等连续复杂问题,准确率仍会下降。基模还要负责意图识别、RAG 检索,以及清洗和梳理包含详情页图片、Chain 工作流等复杂知识源。
从 2024 年下半年起,客户重心由降本转向增效。某客单价 2 万元以上的高端家电品类,依据 AI VOC 画像重做卖点、主播及客服话术,一年半后销量增长 23%、客单价提高 6% 多,并于 2025 年扩展至集团各事业部。
对“人人都有 AI 后红利是否消失”的追问,吕英杰认为“AI 未来的价值核心还是掌握在人手里的”:垂直数据飞轮和行业专家构成中间层壁垒,最终仍由人识别机会并决定产品、营销与执行。
其收费由 SaaS license 加数据使用包组成,以处理 100 万通对话、语音或社媒帖子等单位估算 token 成本。AI 让客户接受“使用必然产生成本”,改善了中国 To B SaaS 的付费逻辑;语义科技上一年因此实现约 100% 增长。