趋势 方法 投研 作者
返回方法

给 AI 的任务总跑偏?先查你的未知量

2026/07/28

深度思想,谈 AI 与向往

—— 字节深思圈

你有没有过这种体验:提示词写得很详细,结果还是不对,感觉 AI 总在跑偏。

以前你会怪模型不够聪明。但现在的模型已经强到能执行大多数任务,结果不对,大概率不是模型的锅,是你的指令和现实差得太远。

Anthropic 技术团队的 Thariq 把这个差距拆成了一个框架,叫"地图与领土"。

你给 AI 的提示词、背景、指令,是地图。任务实际发生的地方——代码库、真实约束、现实环境——是领土。地图和领土之间的差距,就是未知量。AI 遇到未知量只能靠猜,猜的质量决定产出质量。

模型越强,你的未知量越贵。这句话值得读两遍。

四类未知量

已知的已知。 写进提示词的内容,AI 能忠实执行。

已知的未知。 你知道问题存在但还没解决:功能边界没想好、方案没定。这类还有机会在开始前解决。

未知的已知。 你有偏好和直觉,但太理所当然不会写出来,只有看到结果才知道对不对。表现是不断说"再调整一下"、感觉还不对——因为你自己也不知道"对"的标准是什么。

未知的未知。 完全没想到的坑。它从一开始就不在你的地图里,等你发现时,通常已经在错误方向走了很远。

优秀的 AI 使用者不一定是提示词写得更好,更多时候是开始之前的未知量更少。这是可以训练的技能,不是天赋。

实施前:多数人完全跳过的一步

很多人拿到任务就开写提示词,干到一半发现不对再返工。前面多花十分钟清未知量,后面能省十个小时。

五个方法,写代码、写文章、做产品决策、剪视频,同一套逻辑:

盲点探测。 针对"不知道要问什么"。直接让 AI 做一次 blindspot pass,同时告诉它你的背景——你是谁、对这个领域了解多少。它知道你的起点,才能找到对你有价值的盲点,而不是列一堆你早就知道的东西。

头脑风暴与原型。 针对"知道要什么但说不清"。让 AI 给几个截然不同的方向,你反馈哪个对、哪个不对。你的反应就是信息。小需求在草图里改是几秒的事,深度实施后再改可能要推翻重来。

AI 反向提问。 针对"知道有模糊地带但不知从哪问起"。把背景给它,让它一次问一个问题,优先问"你的回答会改变整体方向"的问题。你不是在问 AI,是让 AI 采访你——把找问题的活交给对全局看得更清的一方。

给参考物。 针对"描述不出来"。对开发者,最好的参考物是源代码:指向一个实现了你想要行为的库,让 AI 读懂后重新实现。图表、文档、截图都可以,但源码信息最丰富。

实施计划。 让 AI 先拟计划,重点不是计划全貌,是把需要你拍板的决策和它能自己处理的执行分开——前者放最前面(数据结构、接口、文章结构),后者完全交出去。

实施中:维护偏差记录

做得再充分,执行中还是会冒出没预见到的情况。这个阶段的核心不是消除未知量,是遇到未知量时不乱。

让 AI 维护一个偏差记录文件:遇到边缘情况必须偏离计划时,优先选保守的处理方式,在偏差下面记一笔,继续推进,不要停下来等你确认。

解决两个问题:AI 做久了前后不一致;遇小问题就卡住等你指示。有了记录,它能自己往前走,所有决策有迹可循。这份记录还是下次任务的"更好地图"的原材料。

实施后:提案和测验

任务完成,两个收尾动作。

第一,把产出、原型和实施记录打包成一份别人看得懂的文件。这既是让别人理解你做了什么,也是强迫你自己搞清楚你让 AI 做了什么。

第二,让 AI 考考你。先给一份报告,把做了什么、背后的思路写清楚,最后放一个你必须通过的测验。答对了,才说明你真的理解了,而不是扫了一眼。很多情况下我们扫一眼觉得没问题就合并,真要问改了什么、为什么改,根本答不上来。

一个完整例子

Thariq 用 Claude 从零剪完 Fable 的发布视频。他不懂调色,视频出来颜色发闷。他让 Claude 做几个版本挑,做完发现自己还是不知道哪个对——他没有判断标准。这是未知的未知。于是他回到盲点探测,先让 Claude 教他理解调色,建立判断标准,再回来动手。

未知量不是在开始前一次性清完的。它在整个任务里持续出现。每次卡住,先停下来想:我现在是哪类未知量没处理好?

前期便宜的错误,好过后期昂贵的返工。这笔账很好算。

注:框架来自 Thariq Shihipar(Anthropic)公开文章与访谈;文中的浏览数据与项目细节来自视频转述,属原作者观点。

最后更新于