Arvind Jain 谈 Glean 的打造与企业 AI 的未来
摘要
Glean 的创立逻辑是企业搜索,但早期押注 transformer,让 2019 年的产品在生成式 AI 到来时占据了异常有利的位置。 Arvind Jain 从一个普遍痛点切入——研究显示,员工有 1/3 的工作时间花在寻找信息上——并使用基于 BERT 的模型匹配概念,而不是关键词。随着生成和推理能力提升,Glean 从“工作生活里的 Google”演变成了“工作生活里的 ChatGPT”。
Glean 在通用能力已经成熟的地方使用 frontier models,同时自行构建企业级检索能力。 它在客户语料上训练小模型,生成定制 embeddings;同时单独微调小型开放域模型,用于拼写检查、同义词处理和缩略词扩展等窄域搜索任务。综合回答和多步推理则交给 GPT、Gemini 或 Claude。Jain 的原则很直接:“不要重新发明已经被发明的东西。”
权限和数据新鲜度,而不只是模型质量,才是企业 AI 的核心约束。 Glean 从 Google Drive、Slack 和 Salesforce 等系统导入治理规则,将权限写入索引,只检索当前登录用户有权访问的文档。由于 embeddings 本身可能泄露受限信息,针对客户的模型只会在 Glean 判断安全的子集上训练。
Jain 的连续创业模式,是在其他人已经放弃的市场里押注普遍存在的问题。 Lukas Biewald 追问 Rubrik 和 Glean 是否体现的是非凡执行力,而非新颖想法;Jain 同意,企业搜索曾经“只有失败”,并成为投资人不愿投入的“死区”。他的信念来自两个变化:SaaS 让碎片化数据问题恶化,却也让数据更容易获取;transformer 则让语义理解在技术上成为可能。他从 Google 带来的运营模式是把创新放在第一位,招募聪明的工程师,并基本放手让他们构建。
一个具体的 ROI 案例,是对企业 95% 的非结构化数据进行推理。 在出现客户流失后,Glean 财务团队一名非工程师员工要求一个 agent 汇总 Salesforce 客户名单、共享 Slack 中的情绪信息和产品使用数据,将客户风险划分为绿、黄、红三档。Jain 认为,这份结果优于传统仪表盘,因为它能够纳入带有主观判断的文本证据。
Glean 评估的是完整的回答链路,同时承认企业 AI 不可能消除错误。 它从真实互动中提取“黄金”问答集,例如获得良好反馈的 Slack 回复,用来测试检索和模型变更,并使用 LLM 作为评审。针对幻觉,它会将回答逐行与提供的源材料核对,并可能压制缺乏依据的表述或直接拒答;但 Jain 表示,过时、缺失或检索不佳的知识,比模型凭空编造本身造成更多失败。
Jain 不认为减少人力是最有价值的 AI 策略;他更希望每名员工身边都有一支可规模化的“梦之队”。 他设想 assistants、coworkers 和 coaches 帮助每个人完成所需工作的 90%,同时企业保留甚至扩大团队,让成员能够完成“10 倍的工作量”。这场变革可能显得渐进——一次只改变一个任务——直到员工发现,自己已经与 2 年前截然不同。
精读
上游暂未提供,后续同步将继续补齐。