波兰主权 AI:语言适配、本地控制与成本优势——Marek Kozlowski
摘要
波兰主权 AI 的核心是专业化,而不是与美国或中国的前沿实验室竞速。 Marek Kozlowski 希望打造波兰语或特定领域适配模型:规模小几个数量级,但在特定语言、文化或工作流内达到参数规模大10倍模型的效果。其价值在于本地控制、更低的推理与部署成本、可在本地运行,以及即便外国模型不可用或依法无法使用,仍保留技术能力。
随着厂商围绕核心工作负载优化,小语种获得的前沿模型支持可能恶化。 Kozlowski 表示,随着开发者将重点放在编程和其他优先市场,一些 Claude 和 GPT 版本在波兰语语言与文化评测上的表现持平甚至变差。对于深度集成模型的企业而言,这构成“巨大风险”:供应商可能改变优化目标,导致波兰语表现下滑,企业被迫回滚或迁移供应商。
数据稀缺与欧盟监管,比参数规模更能定义波兰的结构性劣势。 Kozlowski 估计,前沿模型训练数据中90%或更多是英语或中文,波兰语约占1%或更少;PLLuM 去重和过滤后保留约2000亿个波兰语 tokens,而他称一个80亿参数模型要从随机权重稳定训练,至少需要1万亿个 tokens。欧洲规则可能进一步扩大差距,因为合规限制“可能从潜在训练语料中剔除80%的数据”。
PLLuM 将人类创作的后训练数据视为差异化资产。 其内部工具支持几十到数百名标注员编写和编辑指令与偏好,合成材料也必须经过人工核验,因为“语言质量差”的指令会损害生成质量。项目还发布了近100页的训练方案、Hugging Face 样本,以及“开源不只是开放权重”的原则。
近期最强的经济性来自服务10个或20个工作流的窄域本地模型,而不是覆盖数千项任务的通用助手。 Kozlowski 表示,大约1000条特定任务指令就可能足够,更多则更好,可将小模型微调到与零样本或少样本调用的云端巨型模型相当、甚至更强。买方把16张 GPU、能源、隐私和运营控制纳入成本后,“最终总会走向下缩放”。
PLLuM 是公共基础设施,而不是传统意义上追求风险投资规模和市场份额的项目。 该项目由波兰数字事务部通过一个从6家扩展至8家研究所和大学的联盟资助,优先考虑法律合规、透明度、安全性、本地部署,以及面向公民和市政机构的助手,而非客户数量或短期 ROI。这里的主权意味着保留“构建模型的能力和可能性”,即便波兰模型略逊于全球领先者。
企业领域适配有很高的数据门槛,显著压缩了可服务客户的范围。 PLLuM 曾为 PKO 展示持续预训练;Kozlowski 称,中央和东欧最大银行要实现有用的适配,需要约100亿个清洗后 tokens,过滤前可能要达到300亿–400亿个。正如他直言,“拿到100亿个 tokens 没那么容易”,因此数据盘点、权限确认和整理是前置条件,而不是实施细节。
这套策略最终建立在一个仍有争议的前沿进展及成本曲线判断之上。 Kozlowski 将 GPT-5 相比 GPT-4 的表现视为改进日益“横向化”的证据,而 Nathan Labenz 反驳称,规模从10亿美元扩大到100亿美元的训练仍可能带来巨大跃升。Kozlowski 的回答以需求为中心:先定义业务任务并设定基准,因为他看到的大多数部署根本不需要前沿推理能力。
精读
1. 本地化把竞争收窄到波兰能够守住的阵地
Kozlowski 对本地化的定义很宽:模型既可以适配一门国家语言,也可以适配一个业务领域。无论是哪种方式,目标都是提升模型在这条边界内的理解和生成能力,而不是在所有基准和任务上追求全球领先。
这一目标本就具有不对称性:打造规模小几个数量级、但在波兰语、波兰文化或特定领域上表现接近参数规模大10倍模型的系统。模型还应当开放、透明、安全,并且“尽可能多地采用有机数据”。
主权也是对未来中断风险的一种期权。外国模型的权重可能关闭,许可证可能变化,或被禁止在欧洲使用;届时,波兰宁愿拥有一个略弱的本土模型,也不愿完全失去构建能力。“有时它的意义比你想的更大。”
2. 跨语言迁移能传达意思,但说不出母语感
Kozlowski 估计,英语和中文贡献了前沿模型训练数据的90%或更多,其他所有语言合计不足10%;波兰语可能占1%或更少。因此,大多数能力和知识都是通过英语和中文样本习得的。
大模型会通过迁移来弥补差距:一个西班牙语数学问题,可以有效映射到模型用英语学会的解题过程。Kozlowski 将其比作儿童或语言学习者:先通过母语理解新语言,再组织答案。
这种机制可以生成可理解的波兰语,却未必像波兰人自然使用的波兰语。他举的典型例子是邮件中的 “I hope you stay in good health and condition”:逐字翻译能够理解,但这种表达带有英语文化特征,并非普通波兰语通信中的自然说法。
Labenz 追问,这究竟只是文化习惯差异,还是可衡量的推理差距。Kozlowski 的回答是,常见基准暴露的信息太少:选择题测的是识别、提取或摘要能力,却很少检验长篇生成的流畅度和结构。
3. 波兰语能力需要历史与惯用语,不只是词汇
PLCC,即波兰语言与文化能力基准,旨在测试语法、词汇、传统、历史、艺术、娱乐和典型文化表达等方面的语言与文化能力。它还会考察波兰语中的歧义词,以及短语是否被放在正确语境中使用。
Kozlowski 承认,即便是 PLCC,目前也不足以充分衡量长句和复杂的波兰语结构。他警告说,“我们受基准影响太深”:选择题得分很高,可能掩盖了母语者绝不会自然写出的生成结果。
他的核心表述是,“语言不只是措辞”。接近母语者的系统,必须把语法控制与惯用语、文化引用、真实地点、历史背景结合起来,并判断每一项内容在具体情境中是否该被使用。
4. PLLuM 的方法论让后训练数据成为真正护城河
Kozlowski 用学校作类比解释训练过程:预训练教会模型词汇、结构和信息片段;监督微调教会模型完成作文、摘要或计算等任务;偏好学习则提供评分,指导模型改正错误。
最终阶段可以采用基于人类反馈的强化学习、DPO 或 ORPO,但底层逻辑相同:预训练建立语言能力,SFT 构建任务能力,偏好反馈塑造模型应重复或避免的答案。
合成指令如果语言质量差,反而会削弱模型,因此 PLLuM 强调有机指令和偏好,或让机器生成的样本经过人工编辑。Kozlowski 认为,前沿实验室的部分质量优势来自大量人工指令数据,而这些数据仍是其专有资产。
PLLuM 发布了一篇近100页的论文或“菜谱”,并在 Hugging Face 上公开了数据集、指令和偏好样本。其目标是让可复现性超越权重本身:“开源不只是开放权重。”团队还发现,针对英语使用者对齐的模型,比针对波兰语使用者对齐的模型更容易被攻破,因此必须开展本地化安全工作。
5. 波兰暂缓制定 AI 宪法,先应对数据法约束
Labenz 询问,一个国家模型该如何在存在争议的价值观之间做选择,包括波兰历史上的天主教多数是否意味着应当打造天主教 AI。Kozlowski 指出,城市和乡村的宗教认同不同,而且一直在变化。PLLuM 当前追求的是广义上的合乎伦理,避免仇恨言论以及可能不道德或无礼的行为,并未制定复杂的政治或宗教宪法。
他在解释 PLLuM 发布 base、instruct 和 chat 模型时说,“我们现在拥有更多自由”。由于对齐约束可能破坏商业用例,企业可以在不同模型类型之间选择,而不是被交付一个约束过重的单一系统。
Kozlowski 预计,更明确的宪法可能在1至2年内出现,但波兰眼下面临的直接约束,是哪些数据可以合法使用。欧盟 AI Act 和波兰著作权规则对质量的打击,可能比行为原则更严重,因为它们可能让训练数据集中的“80%的数据”无法使用。
6. 欧洲筛出更小的语料库,美国爬虫却抓走其中大部分
Kozlowski 表示,PLLuM 总计拥有数千亿个 tokens,去重和过滤后约剩2000亿个。网页数据仍占多数,因为重复页面、格式错误的文本、特殊字符和低质量片段,会让任何一次抓取都损失很大一部分内容。
Kozlowski 称,团队在波兰网站上观察到“很多 Anthropic 爬虫”,包括出现在 robots 规则明确禁止其访问的页面上。他强调的现实问题是司法管辖权:波兰权利人可能掌握证据,却没有资源在美国法院挑战资金雄厚的美国公司。
非网页补充数据包括图书馆、科学文献、出版物,以及与出版商就未公开发布材料达成的双边协议。即便如此,Kozlowski 认为,OpenAI 或 Anthropic 可能已经拥有 PLLuM 能获得的波兰语数据中的80%–90%。
更具差异化的供给来自预训练之后:几十到数百名内部标注员使用 PLLuM 自有工具编写和编辑指令与偏好。未来可能仍需与其他参与者合作或开展授权,因为“总有一个地方,是你无法再往前走的”。
7. 本地 Agent 将优势转向小型专用模型
Kozlowski 预计,“Agentic AI 革命将建立在小型本地化模型之上”。受监管企业和公共机构通常不能把敏感工作发送到云端 API,因此本地推理、本地 GPU、能耗和可控性都会成为核心设计约束。
买方很少需要一个覆盖1000项任务的 ChatGPT 式系统。它们通常只有10到20个用例;一旦算清大约16张 GPU 以及运行所需的电力成本,就会寻找能够越过性能门槛的最小文本或多模态模型。
他的部署经验法则是:一个任务集合至少需要1000条有机或经过人工审核的指令,越多越好。在这个规模上进行监督微调,可以达到与巨型云端模型零样本或少样本提示相同、甚至更高的质量。
Labenz 同意这一点适用于受控工作流,但强调前沿 API 的便利性。Kozlowski 的反驳是运营层面的:云系统开箱即用、能力覆盖广;私有系统则以数据集准备换取可控性、数据本地化、更低的部署成本,以及对云厂商更低的依赖。
8. 前沿版本可能全球进步,却在波兰语上退步
Kozlowski 表示,某个 Claude 版本在其团队的波兰语语言与文化基准上出现下滑;他称 GPT 模型也存在类似问题。一些 GPT 版本在波兰语能力上没有提升,甚至变得更差。
如果供应商优先发展软件开发助手,因为这是核心付费用例,那么投入小语种写作的能力可能下降。波兰企业因此可能成功完成模型集成,却在几个月后发现下一版本已经无法满足既有要求。
Labenz 认为这一说法很不寻常:如果前沿实验室更愿意把训练资源投入合成编程任务,可能会放弃优质的波兰语数据。Kozlowski 接受数据合作会成为自然的未来方向,但强调外国供应商也可能只是把波兰视为非核心市场。
9. 公共部署比赢得模型市场份额更重要
PLLuM 不只是权重,还包括面向公民、城市居民和市政机构的助手与聊天机器人。Kozlowski 认为,现实瓶颈可能是“城市没有聊天机器人”,而不是某个基准领先模型再多拿一个百分点。
该项目由波兰数字事务部资助,以公共联盟形式组织,最初有6家、后来扩展至8家研究所和大学参与。这种组织结构改变了目标函数:团队首要优化的不是客户数量、订阅收入或传统意义上的投资回报。
其明确优先级包括开放性、监管合规、透明度、有机数据、安全性和广泛的公共部门可用性,尤其是封闭式本地部署。模型本身是资产,但只有针对公民和行政部门的实际工作流完成定制后,价值才能兑现。
10. 持续预训练替代了波兰无法负担的基础训练
PLLuM 曾尝试从随机权重创建模型,但 Kozlowski 表示,一个80亿参数模型要实现稳定且高质量的预训练,至少需要1万亿个 tokens。波兰约2000亿个经过整理的 tokens,不足以从零开始训练出质量中等或足够好的模型。
团队转而从 Llama 和 Mistral base 模型出发进行语言适配:在波兰语文本上持续预训练几个 epoch,随后进行 SFT 和偏好优化。团队也在测试多语言混合语料,以达到从随机权重训练所需的 token 规模。
持续学习会引发遗忘。模型适配波兰语后,其他语言能力会有所下降,但 PLLuM 不会有意将其裁掉;此前的知识仍足以让模型继续生成英语,通用知识总体也得以保留。
时间敏感事实是另一项问题。训练截止于2025年3月的模型,不可能记住此后发生的法律变化、事故或政治任命,因此 Kozlowski 倾向于从更新后的知识库检索,再由本地化模型综合检索到的证据。
11. 只有企业直面数据,领域适配才会奏效
PLLuM 曾为 PKO 进行持续预训练,Kozlowski 将其称为中东欧最大的银行。使用该银行的封闭领域语料后,部分金融任务的质量大幅提升,但不同评测中的改善幅度并不一致。
他的门槛是去重和过滤后约100亿个 tokens,这意味着原始数据可能需要300亿–400亿个。对于一家40人的公司,他不相信 Slack、Google Docs、Jira 工单、提案和修订历史能够可靠地经过这一规模的处理:“没那么容易。”
他估计,欧洲拥有1000亿个封闭内部数据 tokens 的企业可能不到100家。即便是大型组织,也必须排除敏感或法律状态不明确的邮件、网络安全材料、知识产权,以及其他授权边界不清的数据。
Kozlowski 的顺序是明确的:先盘点并清洗数据仓库,分类评估质量与权利,再训练或部署 AI。企业常常在不知道自己拥有何种数据的情况下就开始集成;这些项目“通常会崩溃”,因为数据整理被当成了事后补救。
12. 成本纪律挑战前沿扩张,但尚不足以决定竞赛结果
Kozlowski 提到 Llama 3.4 和 Kimia,称其许可证禁止在欧盟使用,并谨慎地将这一限制与 AI Act 第二章要求的通用模型文档联系起来;该章节于2025年8月发布。他表示,模型构建者必须披露训练数据、安全措施、数据集和资源,而部分供应商可能不愿公开这些内容。
对于边界清晰的数据提取或文档分析任务,他会考虑中国模型,因为这类场景的审查风险较低;但对于作文、历史或长邮件,他不会轻易采用,因为被审查的假设会更明显。模型来源的重要性,取决于任务是分析型还是生成型。
波兰目前主要聚焦 AI 工厂,财政部则通过联盟资助算力、模型开发和人才。Kozlowski 表示,波兰无法匹配美国的薪酬水平;他听说美国顶尖研究人员拿到的合同“就像 NFL 四分卫一样”。他认为中国和美国是两大主导者,欧洲没有实力相当的玩家,并提到 Mistral,同时称自己听说 Microsoft 持有其30%–40%的股份。
Kozlowski 认为,GPT-5 相比 GPT-4 的改进更加稳定,也更“横向化”,不同于2022年 ChatGPT、2023年 GPT-4 和2024年多模态能力带来的冲击。Labenz 继续保留分歧:100亿美元的训练规模仍可能决定性地击败10亿美元规模;Kozlowski 则坚持认为,大多数企业应当围绕实际需要的邮件、提取或交叉销售任务进行基准测试。
他的地缘政治矛盾同样没有解决:欧洲联邦式合作能够分散知识和权力,但快速推出产品通常需要集中的资金、算力和人才。联邦学习未来或许能解锁安全共享的数据仓库,但企业甚至还无法为自己的数据估值;这“不是下一年的事情”,即便互联网的有机数据储备似乎已经“接近满负荷”。