
曹卿云 Qingyun Cao
前沿洞察
算力狂飙(~300x)正撞上互连带宽(~30x)与铜互连物理极限,光互连(XPO/CPO-X)超级周期势不可挡;推理层“KV Cache时刻”蓄势待发,但大厂落地与商业渗透仍存变数。模型端头部共识正在瓦解、顶尖人才身价持续通胀,AI自动化研发或率先重塑量化等脑力密集型领域。硬件瓶颈与系统工程正压过纯模型叙事。
观点集合
【特别综艺-下】硅谷AI研究员|模型猜猜乐和Prompt大战
- 🗓️ 日期:
2026-07-19| 🎙️ 节目:硅谷坐标 Silicon Valley Vector
盲测显示 Gemini 3.5 Flash、Claude 4.6 Sonnet 与 DeepSeek 输出高度同质化,连 OpenAI 研究员也难辨自家模型。Voice agent 已进入 Chase 信用卡销户等真实流程,但替代多数日常事务仍较远,可能取决于 robotics;工具调用带来的能力差异仍待观察。
查看访谈对话精读提要
一场盲测暴露了模型输出的高度同质化:连 OpenAI 研究员也屡屡认不出自家在内的各大模型。 六位嘉宾靠括号、破折号、换行、bullet point 这些“语癖”猜模型,Gemini 3.5 Flash、Claude 4.6 Sonnet、DeepSeek 轮番被认错;主持人 Bessie 的意外发现是:“大家其实很难 reach consensus 哪一个是自家的模型……很多模型就特别特别相像。”这为关注模型差异化的投资者提供了关于模型输出趋同的直接观察。
“新模型发布前旧模型被偷偷变笨”的说法,得到了一项带保留的内部判断。 王森说:“根据我个人的了解,应该不是这样”;更深的解释是人的预期本身不稳定——“即便它给你一个答案,你昨天和今天可能也不一定一样的满意”。团队确实会从 social media 和 user feedback 中寻找线索,证实坏行为后通过迭代 algorithm 尝试消除,建议用户点 thumb down。
Voice agent 已经实打实落地,AGI 替代生活还早。 刚加入 voice agent 创业公司的周奕超说:现在打电话给 Chase 关信用卡,“很大概率已经是 agent 接的,而且很可能已经能很好地完成你的任务”;但要 AI 替代生活中大多数事情“还是比较远的”,“可能还得看 robotics 的出现”。
中美前沿研究“同大于异”。 “前沿模型公司也就中国和美国做得比较好”,在 scaling law 怎么做、怎么做 RL 上“大家的共识很一致”;真正的差异可能是资源(“资源更少……人做得更细一些”)和沟通环境,中国团队更多是华人、交流更集中,美国背景更多元、需要更多 alignment。
嘉宾自己的 AI 工作流:sub-agent、文档、勤开新对话。 不会的问题先让模型列 plan、改完再“spin up multiple sub-agents to carry out”;长对话 compaction 后模型“突然会坠入太虚幻境”,所以要写文档做记录;与其在一个对话框聊到爆 context,不如开新对话,“更快,甚至是更准确”。
公司上市后股票卖不卖,内部观点公开分裂。 一派认为“按现在的估值……都可以长期持有”,另一派直言“肯定卖啊……在非上市公司等了这么久……不能所有都 all in 一个地方”,卖一部分买其他家;FIRE 数字从 200 万美元(回成都或妻子老家、前提是不与人比较)到 1000 万不等。
Prompt 大战的策略:可验证任务加尽可能多的工具调用。 让 ChatGPT 5.5 Thinking High 思考尽可能久的 prompt 是“搜索 NeurIPS 成立以来每年引用量最高的九十篇论文并总结成 doc”——思考 6 分 24 秒;对手的“查询至少一百个网页”只有 1 分 23 秒。核心策略是给明确可验证的目标,避免模型偷懒、输出似是而非的结果或反问用户。
🔗 原始收听与视频来源: 【特别综艺-下】硅谷AI研究员|模型猜猜乐和Prompt大战
【特别综艺·上】《从夯到拉》|7位硅谷AI研究员的模型排名游戏
- 🗓️ 日期:
2026-07-18| 🎙️ 节目:硅谷坐标 Silicon Valley Vector
模型能力排序无共识:GPT-5.5未被一致视为“夯”,Gemini评价从“人上人”到“拉完了”两极分化。薪资信号更集中:Meta TBD被称为公认“夯”,AI研究员收入上升;若模型能进行auto research,quant research可能被更高效替代,GPT-5.5 Pro则展示了能力跃迁。
查看访谈对话精读提要
模型能力排位没有形成共识:排序官把 GPT-5.5 放在最上方,但揭晓时它的身份是“顶级”而非“夯”,这一局最终“圆满失败”。 答案包括 Gemini、GPT-5.2、GPT-5.5 和 GPT;有人给 Gemini 人上人(“御三家永远都是第三家”),周奕超却直接写拉完了:“在美国还有哪个模型比它更差的?”并补充:“最拉的是不被人记住。”
薪资一题的全场夯是“Meta TBD”,且被主持人称为“公认的”,讨论落点是薪资两极分化:AI 研究员的工资比之前多得多,非 AI 岗位的增长可能受限。 席间还提到 quant 向 AI 的人才迁移正在发生;如果模型能做 auto research,“它也能做矿的 research,而且可能会做得比人要好很多”。
Job security 一轮排序全对:Apple 被排在夯位、XAI 拉完了。 主持人排序时以“唯一没有裁过员”的 Apple 作判断依据,但随后有嘉宾指出 Apple 其实也裁员。XAI 的评价是“砍人砍太多了”,并有“遇事不决,先 ban 它”的说法。OpenAI 只拿到人上人,理由是:“感觉没有什么大规模的动荡,但是大家都是悄悄地就不见了。”
Work-life balance 一题里,王森解释自己原本想把现在的 OpenAI 和 Anthropic归入“这一代的拉完了”,为避免撞车才改写 Netflix。 收尾的反思更值得记:过去两百年自动化一直试图换取更多自由时间,但“我们确实在干更多的工作,却没有实现更多自己的时间”。
AI 时代技能排序是全场逻辑最硬的一轮:empathy 夯、身体健康顶级、做饭人上人、Photoshop NPC、coding 拉完了。 王森的判据是 coding “非常可验证”,写好测试就能验证;Photoshop 还包含较难验证的审美因素。以自身为例,他说从今年一二月份开始就没有打开过 code editor,完全用 agent 写 code。
最强的能力信号藏在闲聊里:一位嘉宾的牌友把读博时想过、距今已约三十年的概率论 open conjecture 发给 GPT-5.5 Pro,模型“然后就证出来了”;朋友们交叉验证后认为是对的,目前正在发第二版。 这被评为“比较夯的周末活动”。
对 AI 泡沫的判断是一个反身性论证:“什么叫 bubble? 就是大家都不觉得这个东西是 bubble 的时候,它才是 bubble。现在你每天都会遇到有人说 AI bubble,那它怎么可能是 bubble?” 配套的内部视角是:frontier lab 的员工能比外部更早看到提前一代模型的进展,以及未来十天或一个月可能出现的变化,这被形容为一种特权化体验。
🔗 原始收听与视频来源: 【特别综艺·上】《从夯到拉》|7位硅谷AI研究员的模型排名游戏
硅谷坐标 x Tensormesh 江鋆晨:AI 的记忆-KvCache的三层理解
- 🗓️ 日期:
2026-06-30| 🎙️ 节目:硅谷坐标 Silicon Valley Vector
KV Cache正从可复用的黑盒状态走向可操控attention语义的白盒,而行业多数仍处于第一层。TensorMesh结合CPU、SSD或GDS缓存复用、LMCache与CacheBlend以降低成本并提升速度;KV Cache moment可能在今年年底前出现,但大厂采用仍不确定。
查看访谈对话精读提要
江鋆晨给出全片的核心框架:KV Cache 有三层理解,而工业界多数停在第一层。 第一层是把它当作“可存储的黑盒数据”复用;第二层把它当作有语义(attention)信息的白盒,可做 lossy compression、非前缀复用、跨模型复用;第三层直接改语义——“pay more attention to this, pay less attention to that”,甚至能提高模型输出准确性。“工业界很少有人理解到这一层”,这正是 TensorMesh 创业的原因。
他判断“KV Cache moment”可能比预想来得早——“有可能在今年年底前”就有大量公司涌入。 但他对大厂并不恐慌,优势在于跨学科:能碰到 GPU 数据的 infra 工程师做不了二、三层,懂语义的 ML researcher 又缺第一层工程能力;并援引 Sam Altman 的观点——大公司“人的 attention 分散地方太多了”,可能一个组做两个月就转向。
他拆掉了“input token 便宜所以 prefill 不值钱”的定价错觉:每个 token 的真实计算成本 input 与 output 差不多,定价并不反映成本。 prefill 高度并行,在他举的场景中只占用户等待时间约十分之一,但真实 use case 里 input(几万 tokens)常比 output(几千)长十几倍——agent 应用因模型 stateless,input 只会越来越长,这是 TensorMesh 降本逻辑的地基。
经济逻辑可概括为“用存换算”,但他强调 TensorMesh 做的是硬件之上的软件,不是硬件采购。 KV Cache 存在 CPU、本地 SSD 或 GDS 时,取回复用比重新计算既省 GPU 成本又更快;存到更冷层才出现降本换延迟的 trade-off。他还强调公司与存储硬件周期解耦——存储涨价是供需失衡(订单已排到两年后),长期会回落,客户该算的账是“多少钱花硬件、多少钱花软件”。
对 TAM 的追问他直接拒绝:“total addressable market 是个 misleading word”——因为绝大多数人还没意识到这个市场存在。 在模型和 prompt 都定死的前提下让模型更好理解 prompt,是提高 agent 质量的“第三条路”;最佳场景是企业 shared knowledge(codebase、policy/legal documents)跨 coding、chatbot、RAG 多应用复用。
差异化押在生态与技术上:LMCache 是同类项目里 ecosystem support 最好的,CacheBlend 解决非前缀复用——KV Cache 存储“不仅仅是个 Storage,它是个 Service”,里面要有计算能力。 对投资人提到的相似项目,他只说“确实差不多,good luck”;对架构风险的回应是 KV Cache 只是暂时名字,本质是 model-native data,Mamba(如千问 3.5 仍留约四分之一 Transformer 层)时代照样存在。
两个值得记住的类比:KV Cache 是“AI 时代的大数据”,TensorMesh 想做的是“只有 model 才能看的 data”版 Databricks(Ion Stoica 为其顾问);空间上则是当年的 CDN——“Akamai 就是当年的 OpenAI”。 现在做的是 data center 内的 mini-CDN,等 edge 与分布式推理起来,就是 internet-scale 的 knowledge delivery network:“我们可能三年前看了六年后的东西”。
大模型格局他押“在线视频”而非“搜索”终局:少数公司 consolidate,但主权 AI 与企业私有部署会养活大量独立服务。 开源侧他很直白:OpenAI、谷歌的开源模型“很难和中国的这些开源模型竞争”,未来几年开源“可能还是得看国内”;xAI 收购 Cursor 只是整合潮的一例,但他也表示对这一具体案例并不了解。
🔗 原始收听与视频来源: 硅谷坐标 x Tensormesh 江鋆晨:AI 的记忆-KvCache的三层理解
硅谷坐标 x 中际旭创 于让尘:AI 光互连的超级周期
- 🗓️ 日期:
2026-04-24| 🎙️ 节目:硅谷坐标 Silicon Valley Vector
AI光互连面临算力增长约300倍、带宽仅增约30倍的十倍缺口,NVL72等系统的铜缆距离与速率瓶颈正推动光进铜退。于让尘认为应按单位token产出而非互联成本衡量投入,TeraHop以12.8T XPO和Open CPO-X开放标准推进生态,但400G路线、OCS与半导体集成仍待验证。
查看访谈对话精读提要
AI光互连正处在十倍缺口驱动的超级周期:2022年以来算力增长约300倍,光连接总带宽只增长约30倍。 TeraHop副总裁于让尘用脑灰质(算力)与脑白质(连接)作比——人脑二者体积已近1:1,小猫小狗的白质/灰质比例约为10%-20%;“我们今天可能还在小鼠小猫那个阶段”。光互连目前仅占数据中心资本开支的个位数百分比,但他认为连接投入的增速必须大于算力,“这个间隙要去填补,必须整个业内一起来努力”。
Scale up是行业最大的结构性机会——带宽约为scale out的十倍,而铜缆的物理极限正在逼近。 英伟达NVL72机架内全铜连接"已经在制约大脑发展",规模正从已开始进入的576颗、1000颗一路推进到谷歌9000个TPU互联;铜现在只能走1.5-2米,到400G/lane时代"一米都很勉强",远期可能走向光进铜退。
经济账要反着算:不比光和铜的成本,比单位token产出。 于让尘引用"use copper when you can, use optics when you must",但强调终端客户看的是单位算力、单位token的收益——GPU三到五万美金、光模块几千美金,“省在互联,你牺牲的是你的算力”。
技术路线不是宗教式单选题——“所有的互联网公司他们是很实际的,他们不会做宗教式的选择”。 可插拔、NPO、CPO同一家公司三项都可能选,“成人不做选择题”;谷歌公开说"CPO总是two years away,而且每年都是two years away"。大厂全线自研芯片(TPU、MTIA、Trainium、Maia、OpenAI Titan、xAI)决定了它们欢迎开放光互连生态,而CPO迟迟未规模商用的原因之一,是客户不喜欢垂直整合、供应商议价能力过强,且技术瓶颈挑战很高。
TeraHop以开放标准卡位:12.8T XPO与Open CPO-X两项多源协议带来4-8倍带宽增长,已有约100家公司参与。 可行性来自硅光成熟度——已有一千多个八通道产品,16/32/64通道是自然的演进方向;英伟达今年三月初向Lumentum和Coherent合计投资40亿美金锁定激光器供应,被于让尘解读为担心供应链跟不上十倍增长、“用真金白银来锁定供应链”。
OCS是谷歌约十年前开始布局、其他大厂目前为零或很低的greenfield市场,但电交换不会消失。 光交换省功耗、省时延、省成本,但切换慢、只适合可预测工作流;于让尘明确保守:“未来五年不可能完全取代"纳秒级的电交换,“never say never”、长期共存。OCS带来的2-3dB损耗使coherent light成为好配对,谷歌战投已投初创Celero。
产业最大瓶颈是半导体集成仍在早期,而价值链"很快变成一个万亿级别的问题”。 激光器还在3英寸晶圆、正努力发展到6英寸,对比硅光的12英寸;量子点激光器有望实现直接在硅片上制造光源。五年、十年的方向是半导体化光互连与光电深度集成(TSMC COUPE平台),互联应被视为算力本身的一部分,最终与算力"势均力敌"。
🔗 原始收听与视频来源: 硅谷坐标 x 中际旭创 于让尘:AI 光互连的超级周期