Posted in

AI 越用越贵,问题可能不在模型,而在你的思考方式

使用同一个模型、同一套工具,甚至面对同一个代码库,不同的人得到的结果可能天差地别。

有人会先说明目标和约束,让 Agent 提出方案,确认方向以后再改代码;遇到故障时,他提供日志、环境、复现步骤和已经验证过的假设。任务结束后,他会整理结论,让下一次对话从清晰的状态继续。

也有人不断重复「还是不对」「一次修好」「不要再出问题」,却不给现场信息,不允许系统检查日志。改坏以后立刻回退,回退后又沿着相同路线重来。对话越来越长,代码越来越乱,费用不断增长,问题却留在原地。

两者之间的差距,不只是会不会写 Prompt,而是能不能管理不确定性。

模型标价只是账单里最显眼的一行

谈到 AI 成本,人们往往首先计算输入输出 Token、模型单价和运行时长。这些数字当然重要,却不是成本的全部。

更昂贵的部分通常藏在工作过程里:

  • 模糊目标引发的多轮猜测;
  • 错误方向产生的大量无效代码;
  • 混乱上下文导致的连续误判;
  • 没有保存状态造成的重复调查;
  • 缺少验收标准带来的反复修改。

一条糟糕指令浪费的并不只是一轮调用。Agent 沿着错误方向生成的代码,会在后续对话里变成新的「事实」。它会继续理解、解释和维护这些代码,让一次判断失误逐渐积累成技术债与上下文债。

所以,真正昂贵的不是问得多,而是在错误的问题上持续投入计算。

高质量使用者一直在缩小搜索范围

有效的人机协作并不依赖神秘咒语。好的使用者会在每一步减少未知变量,让 Agent 更接近真实问题。

第一,先确认方向,再大规模执行。

对于复杂任务,可以先要求 Agent 输出目标理解、影响范围、候选方案和验证方法,在确认之前不修改代码。相比事后推翻数百行实现,在动手前纠正方案便宜得多。

第二,用可观察的现象代替主观感受。

「点击保存后按钮持续加载三秒,随后接口返回 500,服务端提示字段缺失」,远比「保存还是坏的」有用。前者缩小了排查范围,后者只表达了使用者的挫败感。

日志、截图、端口、环境版本和复现路径都会消耗 Token,但这是有信息密度的投入。它们能减少猜测,通常也会降低总成本。

第三,把人的专业判断接入任务。

使用者可以提出假设,例如「我怀疑上传缓冲区太小,请先设计一个最小验证,不要直接改实现」。这不是替 Agent 下结论,而是为搜索提供方向,并要求它用证据确认或否定。

人不应该把思考完全外包给 AI。更好的关系是:人负责目标、约束和判断,AI 负责扩展分析与执行能力。

上下文越长,不代表信息越充分

不少人把超长对话当作安全感,仿佛历史越多,模型越不容易犯错。实际情况往往相反。

旧方案、失效假设、过期文件和情绪化反馈混在一起,会让 Agent 难以判断什么才是当前状态。上下文像一个从不整理的仓库,东西都没有丢,却越来越难找到真正需要的那一件。

长任务需要主动维护状态:

  • 阶段结束后记录已完成事项与验证结果;
  • 明确哪些假设已经被证伪;
  • 切换任务时提供简洁的交接摘要;
  • 新会话开始前读取当前版本的事实文档;
  • 删除或标记已经失效的约束。

上下文管理不是形式主义,而是避免重复计算和错误继承的成本控制。

不让 AI 诊断,却要求它一次修好

复杂系统的问题往往来自一条链路,而不是单个代码点。

例如设备录音经过传输、解码再到播放器输出,任何一个环节都可能失败。合理的排查方式是逐段验证:源数据是否生成、传输是否完整、数据是否损坏、解码是否成功、播放器是否获得正确输入。

如果不给日志,不允许逐步检查,却要求 Agent 立即给出唯一答案,本质上是在要求它猜测。偶尔猜中会制造一种能力错觉,更多时候只会产生新的修改和新的故障。

回滚也有类似问题。回滚本身是重要的安全手段,但如果没有记录版本状态、失败原因和已验证结论,Agent 就会在多个版本之间来回摆动。同一条错误路线可能被反复尝试,已经修复的问题也可能被重新带回。

没有状态意识的回退,不是恢复,而是遗忘。

情绪也会占用上下文预算

对 AI 表达不满并不会直接帮助定位问题。「你到底会不会」「不要再瞎改」这类内容会进入上下文,却没有增加任何关于现场的信息。

它们甚至可能把后续响应引向道歉、安抚和过度承诺。为了显得已经采取行动,模型可能急于修改,而不是停下来重新诊断。

更有效的做法,是把情绪翻译成可验证的差异:

  • 预期结果是什么?
  • 实际观察到了什么?
  • 哪一步开始偏离?
  • 有哪些日志或数据可以证明?
  • 什么条件满足后才算修复?

AI 不需要被迁就,但它需要信息。沟通质量越高,试错空间就越小。

AI 素养首先是一种成本管理能力

企业培训 AI,如果只教员工套用 Prompt 模板,很快会遇到天花板。真正影响产出质量和费用的,是更基础的能力:描述事实、拆解问题、设置停止条件、保存任务状态、设计验证方法,以及在错误扩大之前及时暂停。

一个清晰的停止条件尤其重要。什么时候应该继续让 Agent 尝试,什么时候必须重新确认目标?什么时候可以自动执行,什么时候需要人工审批?没有这些边界,模型可能长时间在低价值路径上循环。

AI 普及以后,「是否使用 AI」不会再构成明显优势。真正拉开差距的,是谁能把混乱的问题整理成可执行的任务,谁能提供高质量上下文,谁能识别无效推理,并在合适的时刻停止。

模型价格决定了每一步计算的单价,人的思考方式决定了要走多少弯路。

因此,一张 AI 账单记录的不只是调用量,也在映照使用者如何定义问题、处理证据和管理决策。会思考的人用 AI 放大能力;缺少秩序的人,则更可能用它放大返工。

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注