先锋 趋势 方法 投研 作者
返回先锋
Marek Kozlowski
创新者 1 场深度对话收录

Marek Kozlowski

观点集合

波兰主权 AI:语言适配、本地控制与成本优势——Marek Kozlowski

  • 🗓️ 日期2025-12-06 | 🎙️ 节目:The Cognitive Revolution

波兰主权AI聚焦小型本地模型,在波兰语、文化和受监管工作流中匹敌更大系统,降低推理成本与外部依赖。PLLuM的护城河是人类后训练数据和本地部署,但语料稀缺、欧盟规则、供应商退步及企业适配门槛限制了市场空间。

查看访谈对话精读提要
  • 波兰主权 AI 的核心是专业化,而不是与美国或中国的前沿实验室竞速。 Marek Kozlowski 希望打造波兰语或特定领域适配模型:规模小几个数量级,但在特定语言、文化或工作流内达到参数规模大10倍模型的效果。其价值在于本地控制、更低的推理与部署成本、可在本地运行,以及即便外国模型不可用或依法无法使用,仍保留技术能力。

  • 随着厂商围绕核心工作负载优化,小语种获得的前沿模型支持可能恶化。 Kozlowski 表示,随着开发者将重点放在编程和其他优先市场,一些 Claude 和 GPT 版本在波兰语语言与文化评测上的表现持平甚至变差。对于深度集成模型的企业而言,这构成“巨大风险”:供应商可能改变优化目标,导致波兰语表现下滑,企业被迫回滚或迁移供应商。

  • 数据稀缺与欧盟监管,比参数规模更能定义波兰的结构性劣势。 Kozlowski 估计,前沿模型训练数据中90%或更多是英语或中文,波兰语约占1%或更少;PLLuM 去重和过滤后保留约2000亿个波兰语 tokens,而他称一个80亿参数模型要从随机权重稳定训练,至少需要1万亿个 tokens。欧洲规则可能进一步扩大差距,因为合规限制“可能从潜在训练语料中剔除80%的数据”。

  • PLLuM 将人类创作的后训练数据视为差异化资产。 其内部工具支持几十到数百名标注员编写和编辑指令与偏好,合成材料也必须经过人工核验,因为“语言质量差”的指令会损害生成质量。项目还发布了近100页的训练方案、Hugging Face 样本,以及“开源不只是开放权重”的原则。

  • 近期最强的经济性来自服务10个或20个工作流的窄域本地模型,而不是覆盖数千项任务的通用助手。 Kozlowski 表示,大约1000条特定任务指令就可能足够,更多则更好,可将小模型微调到与零样本或少样本调用的云端巨型模型相当、甚至更强。买方把16张 GPU、能源、隐私和运营控制纳入成本后,“最终总会走向下缩放”。

  • PLLuM 是公共基础设施,而不是传统意义上追求风险投资规模和市场份额的项目。 该项目由波兰数字事务部通过一个从6家扩展至8家研究所和大学的联盟资助,优先考虑法律合规、透明度、安全性、本地部署,以及面向公民和市政机构的助手,而非客户数量或短期 ROI。这里的主权意味着保留“构建模型的能力和可能性”,即便波兰模型略逊于全球领先者。

  • 企业领域适配有很高的数据门槛,显著压缩了可服务客户的范围。 PLLuM 曾为 PKO 展示持续预训练;Kozlowski 称,中央和东欧最大银行要实现有用的适配,需要约100亿个清洗后 tokens,过滤前可能要达到300亿–400亿个。正如他直言,“拿到100亿个 tokens 没那么容易”,因此数据盘点、权限确认和整理是前置条件,而不是实施细节。

  • 这套策略最终建立在一个仍有争议的前沿进展及成本曲线判断之上。 Kozlowski 将 GPT-5 相比 GPT-4 的表现视为改进日益“横向化”的证据,而 Nathan Labenz 反驳称,规模从10亿美元扩大到100亿美元的训练仍可能带来巨大跃升。Kozlowski 的回答以需求为中心:先定义业务任务并设定基准,因为他看到的大多数部署根本不需要前沿推理能力。

  • 🔗 原始收听与视频来源: 波兰主权 AI:语言适配、本地控制与成本优势——Marek Kozlowski

收听完整访谈 →