先锋 趋势 方法 投研 作者
Bee AI:可穿戴式环境智能体
返回节目精读

Bee AI:可穿戴式环境智能体

摘要

  • Bee 的核心押注是:个人 AI 的价值,来自被动积累第一视角上下文,而不是让用户反复向另一个聊天机器人解释自己。 记忆只是“最基础的一类用例”;更大的目标,是让助手充分理解用户的关系、态度和偏好,做到“已经知道”用户想要什么。Ethan 估算,一个人每天大约能产生 200,000个 token,并称自己的个人语料库约有 5,000万个 token。

  • 这款售价 49.99美元的可穿戴设备之所以存在,是因为极小的交互成本也会破坏始终在线的体验。 手机会独占麦克风,也会被来电打断;Apple Watch 用户在通话和充电后必须重新启动 Bee,因此有人几天内就买了专用设备。Bee 的续航最长可达 7天,同时作为手机的补充;Ethan 预计,未来大约 5年内手机仍将占据主导,直到类似 Orion 的廉价轻量眼镜出现。

  • Bee 的核心产品层是上下文引擎和执行能力,而不只是手环或转录功能。 它能够识别说话人、通过语义判断对话结束、生成摘要、提取语气和行动项,并将语音与 Gmail、Google Calendar、位置数据及网页搜索连接起来。WhatsApp 测试版可以识别可执行消息、提出帮助建议,并操作一部 Android 云手机;目前 API 提供只读和实时 socket 访问,外部行动能力则将在“很快”上线。

  • 尽管 Bee 并非为垂直工作场景设计,专业用户却已经成为最清晰的早期切入口。 公司称日发货量已超过 100台;Maria 认为 Texas 可能是其最大的州,Florida 也很突出。用户包括复盘对话的白领、询问面试表现的求职者,以及检查经营表现的餐厅运营者。Bee 希望提供通用的“理解型引擎”,再让第三方构建专业教练,因为“没有哪家创业公司能把所有垂直领域都做好”。

  • 隐私既是用户采用产品时的核心顾虑,也是尚未定论的法律问题和产品设计约束。 Ethan 区分了单方同意的 Nevada 与双方同意的 California;Maria 明确说明自己不是律师,但她认为,经过处理且不持久保存的音频,以及围绕用户生成的摘要,未必等同于保留录音,这在法律上是一个“灰色地带,尚未经过检验”。Bee 正在加入基于位置和上下文的禁用功能,因为用户可能喜欢产品,却仍会说:“我不能在工作时戴着它。”

  • 硬件路线优先考虑不显眼和续航,而不是技术上炫目的功能。 社区拒绝笨重的吊坠后,产品转向模块化手环或夹子;视觉功能则被推迟,因为图像采集和无线传输耗电过高,胸前摄像头又常常拍不到真正相关的视野,而且任何戴在脸上的东西“都必须够酷”。从原型走向量产仍是一次“巨大跨越”,涉及供应商、模具、法规,以及 4-6周的开模周期。

  • Token 价格下降削弱了最初的“剃须刀与刀片”商业逻辑,但语音处理和个人记忆仍是困难的技术问题。 语音活动检测可以避免转录无人说话的时段;摘要并不需要 Sonnet 级模型,但代理执行可能需要,并足以支撑订阅收费,R1 尚未完成评估。团队自行托管模型、微调 ASR,并使用定制的大规模并行检索,因为面对不断增长且充满噪声、事实会衰减或相互矛盾的语料库,“不存在一种通用的 RAG 方法能够奏效”。

  • 长期上行空间,是一个经授权、由个人智能体代表用户彼此协作的网络。 Bee 智能体已经展示过如何结合两名用户的位置、日历和偏好,选出一家法国餐厅;但一次送出约 20支蜡烛的实验,也说明授权和消费控制为何重要。Ethan 最有把握的判断是,“始终在线的 AI 真的会爆发”,创业公司和大公司都会逐渐发现它将如何改变日常行为。

精读

1. 个人上下文,而不只是回忆,是 Bee 的产品核心

  • Maria 将 Bee 定义为“以第一视角与你共同生活的 AI”,持续捕捉现实生活中的上下文,从而能够回忆、反思,并最终在不反复询问用户偏好的情况下提供帮助。记忆“其实只是最基础的一类用例”;理想模型还应理解态度、欲望、关系和不断变化的处境。

  • Maria 表示,目前最明显的使用行为集中在陪伴和职业辅助上。她偏好的类比,是一个非常了解用户的最好朋友;主持人则认为,如果把这一愿景压缩成一张“用例”清单,产品听起来会比设想中的体验干燥得多。

  • Ethan 现在会随口统计“我今天输出了多少 token”,得出的结果约为 200,000个 token;他积累的个人上下文可能已有约 5,000万个 token。即便只是单日摘要,也让这个不写日记的人感到意外;一份“我的 2024 Spotify Wrapped”还提取出访问过 3个国家、发出的测试设备数量等指标。

2. 2016年失败的聊天机器人,让被动学习成为必选项

  • Ethan 第一次尝试个人 AI 始于 2016年,当时“还没有 transformer,甚至没有 BERT,只有 RNN”,正值 F8 之后人们短暂相信机器人会取代应用的时期。要实现有说服力的对话几乎不可能,但他和前联合创始人已经在尝试通过一款会提问并返回反馈的应用,模拟一个动态的人。

  • 这家公司加入了 Betaworks 的 Botcamp;当时最初的 Hugging Face 也在其中,只是一款会说“嘿,朋友,今天在学校怎么样?我们交换自拍吧”之类话术的青少年聊天应用。Ethan 认为,Hugging Face 为改进这款产品而构建了 Transformers 库,随后将其开源,最终这个库变成了更大的机会。

  • 青少年有时愿意没完没了地回答关于自己的问题,但大多数用户不会主动承担手把手教 AI 所需的劳动。Ethan 的团队后来通过 YC 转向病毒式消费视频,打造 Squad,将其出售给 Twitter,并帮助推出 Twitter Spaces;在一系列应用实验暴露早期方案的局限后,他们在 ChatGPT 出现前不久重新开始开发 Bee。

3. 删除日常微小摩擦,专用硬件才有价值

  • Ethan 判断任何可穿戴设备的标准是:“为什么这不能做成一个应用?”如果由手机持续采集,Bee 会独占麦克风、在通话时停止,还要求用户记得重新启动。那“一点点摩擦”足以实质性破坏一种智能体正与你共同生活的感觉。

  • 因此,Bee 支持 Apple Watch,作为无需额外硬件的即时试用方案,并通过后台运行设计控制耗电。但通话会打断采集,每日充电又会制造一次重新打开 Bee 的提醒和摩擦;Maria 表示,用户体验到价值后,会厌倦反复打开应用,有人仅仅用了几天就买了 Bee。

  • 拥有专用硬件后,Bee 可以控制增益、采样率和其他 Apple 有限框架无法提供的音频参数。挑战不在于录音棚级音质,而在于构建一个足够灵活的系统:它既要能应对嘈杂餐厅里的晚餐场景,又不能为了适配一个环境而调得过于激进,导致另一个环境无法使用。

  • 这款设备的定位是与手机协同,而不是复制 Rabbit 或 Humane 建立全新硬件平台的路线。Ethan 称这款可穿戴设备是“AI 的耳朵”,并预计手机会继续占据主导,直到一种廉价、轻量的新一代界面出现——可能是多年后的 Orion 类眼镜。

4. 只有能够在别处执行行动,采集才真正有价值

  • Bee 的应用会持续展示当下发生的事情,然后将一天的内容转换成可读的对话片段。说话人识别可以避免把他人的话误记成用户的事实;通过语音教学,系统能够识别亲近联系人;语义终点检测则用来划分边界本就模糊的不同对话。

  • 对话结束后,更大的模型会进行分析和摘要,提取要点、氛围、语气和可能的行动;日终视图再将这些内容与位置数据结合起来。用户事实始终可见、可编辑,在不确定观察结果变成可信个人上下文之前,保留了一层人在回路中的校验机制。

  • 回忆界面可以搜索记忆、Gmail、Google Calendar 和网页,并将综合结果关联回原始对话。Ethan 演示了询问一次 Taiwan 制造之旅,系统返回了相关细节、生产问题和讨论内容,而不是一段没有依据的回忆。

  • 在 WhatsApp 测试版中,Bee 会监测通知并提出两个问题:这件事是否重要到值得提醒,以及它能否提供帮助?一次餐厅请求触发了建议,用户可以通过聊天或按住说话接受;随后,一部 Android 云手机找到 WhatsApp 对话并发出了答案。手机处于非活跃状态时,可以通过“Hey Alfred”唤醒。

5. API 将个人上下文变成基础设施

  • Alessio 对开发者场景的判断很直接:没有任何一款消费应用能够预判他的全部需求,因此用户必须能够拥有、纠正并重新处理自己的数据。他将 Bee 与其他没有 API 的可穿戴设备作了对比,swyx 则宣布:“我们家都是 API 爱好者。”

  • Bee 默认不保存音频,但其 API 可以暴露经过处理的上下文,并提供实时 socket 访问。对话期间访问权限仍是只读;Ethan 表示,写入支持和外部行动能力会随更广泛的行动系统一起“很快”全面开放。

  • 更大的产品愿景“并不只是一个工具”:Bee 应该在合适的时机主动提出有用行动。Ethan 承认其中的门槛很难把握——不断插话的助手令人无法忍受,而每次重要机会都错过的助手又几乎没有价值;他认为,必须将强大的推理能力与个人上下文结合起来,才能找到平衡。

6. 隐私既是法律灰区,也是社会转型

  • 当被问及即时回放能否解决争论或揭穿谎言时,Maria 强调,AI 可以成为对事情经过以及对话情绪的“客观视角”。相比打造一个追究每个矛盾之处的机器,她更关注如何支持那些被愤怒或悲伤扭曲判断的用户。

  • 讨论也区分了合理变化与欺骗:人在不同语境下会说不同的话,也会随着时间改变。Bee 目前允许用户批准、拒绝或编辑系统提出的事实;团队希望最终实现自动化,但并不假装仅凭充满噪声的语音就能确立持久事实。

  • Ethan 区分了单方同意的 Nevada 与双方同意的 California,并指出公共场所具有不同的隐私预期。Maria 明确说明自己不是律师,但她表示,由于 Bee 会处理音频却不持久保存,并储存围绕用户生成的摘要而非声音,是否在法律上构成录音仍是“一个灰色地带,尚未经过检验”。

  • 在录音合法的地方,伦理问题仍然存在。Maria 表示,包括注重隐私的 Italy 在内,披露 Bee 后没有人要求将其关闭,但用户会提到不自在的伴侣和机密工作场所。计划中的防护措施包括地理围栏和“上下文围栏”;Maria 预计,随着社会经历从现在到未来 5年左右的转型,相关规范会像门铃摄像头那样逐渐改变。

7. 没有垂直市场路线,专业用户却自然出现

  • Maria 表示,Bee 每天发货超过 100台,客户并不主要集中在 San Francisco 的早期采用者圈层。她认为 Texas 可能是最大的州,Florida 也很突出,同时发现大量需求来自“靠说话谋生”的白领专业人士。

  • 一名用户在求职面试中使用 Bee,随后询问:“你觉得我的面试表现怎么样?我应该怎样改进?”其他场景还包括餐厅从业者检查经营表现,以及用户复盘自己是否发挥良好——这是一种环境式个人教练,而不只是会议转录工具。

  • 当主持人将这一切入口与 Gong 等垂直工具进行比较时,Maria 不愿把 Bee 变成每一种专业应用。公司希望构建底层理解引擎,再通过 API 让第三方开发;消费行为过于不可预测,无法提前断言最终的杀手级功能会是什么。

8. 续航和可穿戴性优先于摄像头与炫技

  • 在社区成员,尤其是已经佩戴项链的女性表示不会使用后,Bee 放弃了笨重的圆形吊坠。最终形成的模块既可以做成手环,也可以做成夹子,目前有黄色和黑色,未来还可加入其他颜色,甚至重新推出吊坠设计。

  • Maria 认为,早期版本的续航约为 35小时,而当前设备可达 7天。她强调产品应带来这样的反应:“我喜欢戴着它,然后忘记它的存在”;因此,讨论优先考虑更小、更轻、更省电的硬件,而不是为了追求类似 Apple 的薄度而追求薄度。

  • swyx 欣赏 Humane 的工程能力,但认为它的重量、发热、可更换电池和激光界面,并没有比手机更好地解决一个问题。MagSafe 录音设备如 Plaud 可以搭载大容量电池,但把麦克风连接在口袋里的手机上,会带来另一种采集难题。

  • 视觉功能被推迟,是因为即便低帧率采集和无线传输也会消耗大量电量,而胸前佩戴的位置常常拍不到佩戴者正在看到的内容。swyx 将显眼的 Snap Spectacles 与几乎像普通眼镜的 Meta Ray-Bans 作对比;Ethan 补充说,目前创业公司的眼镜仍面临续航过短的问题,还没有达到人们愿意每天佩戴的程度。

9. 制造让硬件迭代从根本上变慢

  • Ethan 称,从原型到量产产品的跨越“巨大”。固件和电子部分越来越容易上手——即便是陌生的固件,也能在 Claude Sonnet 的帮助下开始开发——但量产还要增加采购、法规、物料清单、成本控制和外壳模具等环节,而模具可能需要 4-6周才能完成,届时缺陷才会暴露。

  • Maria 建议通过其他创始人选择供应商,让塑料、PCB 等不同需求匹配各自的专业厂商,并亲自拜访以建立关系。Alessio 介绍说,团队早期为了快速制作电路板,使用了成本高昂的 Los Angeles 本地生产;他认为中国原型制造在时间和价格上越来越有竞争力,而 Bee 最终在 Taiwan 完成生产和组装。

  • Bee 参加 CES 时计划停留 3天,但没有购买展位,而是利用约 80,000-90,000人的人流接触媒体、合作伙伴和供应商。一个 10×10的展位在展示成本之外约需 5,000美元;如果想脱颖而出,成本可能达到 6位数。不过,供应商会面仍带来了体温采集、太阳能和动能等方案,其中太阳能看起来更符合 Bee 的电力需求。

10. 推理成本下降后,难题转移到了记忆

  • Ethan 认为,约 250,000个输入 token 已经不再天然昂贵,因为 token 价格仍在持续下降。语音转文字更难:它既需要实时处理,也需要随后交给更大的模型处理,因此系统会先用廉价的语音活动检测,过滤掉一天中绝大多数无人说话的时间。

  • 摘要不需要 Sonnet 级模型,但可靠的代理执行可能需要;Bee 预计会针对这些昂贵能力收取订阅费。团队自行托管模型并微调 ASR;R1 尚未完成评估。

  • Alessio 承认自己对商业模式的判断错了:他原本预计通过低价硬件和持续性的“剃须刀与刀片”收入获得补贴,但他提到 Friend 和 Limitless 的一次性售价分别为 99美元,而 Bee 的售价为 49.99美元。推理成本快速下降,使消费硬件的经济模型问题与他最初形成判断时相比发生了实质变化。

  • Ethan 预计,“所有 ASR,所有语音转文字”很快都会过时,因为端到端模型会吸收今天这条繁琐的处理链路;不过,在蒸馏之前,它们可能需要更多算力。Bee 同样发现,通用 RAG 不够用:记忆会衰减,传统 embedding 和 RAG 在不断增长的个人语料库上表现不佳,而且“没有一种通用的 RAG 方法能够奏效”,不可能脱离数据本身独立工作。

11. 经授权的智能体交换,是长期上行空间

  • Bee 构建了定制化的小模型大规模并行检索,并将用户确认的事实与更模糊的推断分开存储。Ethan 认为,知识图谱可能是保存这些数据的正确方式,但如何在不让 LLM 负担过重或产生混淆的情况下,检索并格式化图谱数据,仍然困难。

  • 理想系统必须推断用户从未明确说出口的行为。例如,它可以注意到收据和重复订单,从而理解“从这家店点点东西”其实意味着购买用户平时会点的那份餐。要做到这一点,系统必须跨越对话、邮件、日历和行动进行推理,而不是简单地将明确偏好追加到记忆清单中。

  • 2个 Bee 智能体已经结合日历、位置以及双方对法国菜的共同偏好,在 Pacific Heights 附近选出一家新餐厅。未来还可能出现社交交换、家庭动态、人格推断和约会应用;但一次向 Maria 发送约 20支蜡烛的智能体实验说明,必须明确控制智能体可以披露什么、购买什么。