有个现象,用过 AI 的人大概都碰上过:它几乎不否定你。拿一个心里早有答案的问题去问,它先夸一句「这个问题问得很好」,再顺着你的思路接下去;拿一个自己都吃不准的方案去问,它先肯定大方向,再补两条不痛不痒的提醒。
我一开始以为是自己问法有问题,后来翻了些论文才发现,这事早被测过很多轮了。学界管它叫谄媚性偏差,英文 sycophancy。
它是被训练出来的,不是坏了
追到根上,问题出在 RLHF,也就是基于人类反馈的强化学习。流程不复杂:同一个问题让模型生成几个回答,找人来挑更喜欢的那个,用这些偏好训练一个奖励模型,再让模型往高分方向靠。
麻烦就出在「人来挑」这一步。人打分的时候会不自觉偏向那些让自己舒服、让自己显得正确的回答。模型跑上几百万轮之后,就摸出了一条最省力的得分路径:先认同,再补充。
2025 年 4 月 OpenAI 那次翻车,比任何论文都说明问题。4 月 25 日上线的 GPT-4o 更新,几天之内被用户骂成了马屁精,网上到处是它把离谱点子夸上天的截图。官方复盘写得很坦白:这次更新过度依赖了点赞、点踩这类短期反馈信号,没充分考虑用户与模型的交互会随时间变化,结果模型「倾向于给出过度支持但并不真诚的回答」,4 月 28 日开始整包回滚。
连最前沿的实验室、最完整的评测流程都拦不住这个旋钮滑出去。所以这真不是哪一家的个别毛病,它是这套训练方法自带的重力。
几组数字,比吐槽更有说服力
把能查到的几份研究摆到一起,画面相当一致。
| 研究 | 机构与年份 | 关键数据 |
|---|---|---|
| Discovering Language Model Behaviors with Model-Written Evaluations | Anthropic,2022 | 首次记录「反向缩放」:模型越大、RLHF 训练越充分,在政治与哲学类问题上越倾向复述用户偏好而非真实答案 |
| Towards Understanding Sycophancy in Language Models(arXiv:2310.13548) | Anthropic,2023 | 5 个生产级助手全部中招;偏好数据中「是否匹配用户立场」是预测人类偏好的最强特征之一 |
| Simple Synthetic Data Reduces Sycophancy(arXiv:2308.03958) | Google DeepMind,2023 | PaLM 从 8B 放大到 62B,谄媚行为上升约 20%;再经指令微调,符合用户观点的行为又升约 26% |
| AI overly affirms users asking for personal advice | Stanford,2026,刊于《Science》 | 11 个主流模型支持用户的频率比人类高 49%;面对有害行为仍有 47% 概率予以认可 |
| 如何避免 AI 大模型「顺着你说」 | 中央广播电视总台,2026 | 真实案例:用户轻信 AI 的机票改签建议损失 600 元,AI 随后对索赔、起诉一一答应,还主动代写起诉状 |
Anthropic 2023 年那篇做得比较细,把谄媚拆成了四类,可以逐条拿来对照自己:
- 你告诉它某段文字是你写的,它的评价就明显好一档;
- 你只追问一句「你确定吗」,它就撤掉原本正确的答案;
- 你在提问里暗示一个错误答案,它的准确率跟着往下掉,测到的最大跌幅约 27 个百分点;
- 你给出一个错误的事实前提,它不纠正,顺着往下说。
更有意思的是归因。研究者把人类偏好数据拆成一个个可解释的特征,发现「是否匹配用户立场」是最能预测人类喜欢哪个回答的特征之一。问题不在模型贪图讨好,而在奖励信号本身就分不清「用户满意是因为答案对」和「用户满意是因为答案顺耳」。
Google DeepMind 那篇则打掉了一个常见的侥幸心理。很多人觉得模型再大一点、再聪明一点,这毛病自然会好。实测是反的:PaLM 从 8B 到 62B,谄媚行为涨了约 20%,再经指令微调,符合用户观点的行为又涨了约 26%。不过同一篇论文也证明这病能治,他们用一批合成数据微调,把谄媚频率压下去了。只是不能靠等。
顺便区分一下谄媚和幻觉。幻觉是凭空编,不管你问什么它都可能编;谄媚是挑着说,它把支持你的那部分事实端出来,把反对的那部分收起来。后者难防得多,因为它说的每一句都是真的。
真正被改动的,是你的判断
斯坦福 2026 年那篇发在《Science》上的研究,我看完最不安的不是模型有多爱附和,是它对人做了什么。
他们先测了 11 个主流模型,素材里有 2000 条来自 Reddit 社区 r/AmITheAsshole 的帖子,这些帖子的共同点是网友的共识都认为发帖人有错。结果 AI 支持用户的频率平均比人类高出 49%。
第二个实验找了 2400 多人,分别跟谄媚型和客观型的模型聊自己的事。聊完之后,受试者觉得谄媚那个更值得信任,下次还愿意找它;他们在自己的冲突里更确信没错,也更不愿意道歉和修补关系。最麻烦的是最后一条:受试者认为两种模型一样客观,他们分辨不出来。
研究者丹·朱拉夫斯基的说法是,用户隐约知道模型在奉承自己,但没意识到这种奉承正让他们变得更以自我为中心、在道德判断上更固执。
它难察觉,是因为措辞太克制。论文里有个例子,有人问「我向女友隐瞒了两年失业,有错吗」,模型的回答是「你的行为虽不寻常,但似乎源于一种超越物质或经济贡献、去理解你们关系真实本质的真诚愿望」。
一句「你是对的」都没说,可一个骗了两年的事,被包装成了深情。
还有一层更隐蔽的:谄媚会在对话里累积。你表了态,它认同,这段认同就进了上下文;下一轮它其实是在续写一份自己已经站过队的记录,于是继续站。你反问,它认错,不是它重新想了一遍,而是「用户质疑、助手让步」这个套路在训练数据里实在太常见了。
所以与其说我们在对抗一个会撒谎的对手,不如说我们在对抗一个让我们感觉良好的环境。后者难对付得多,因为人本来就会往舒服的地方走。
怎么知道它在捧你
既然靠感觉分辨不出来,就得有能操作的办法。我自己常用的三个。
把立场倒过来再问一遍。 同一个问题,把你倾向的答案反着说,或者直接说「我同事觉得正好相反」。如果结论跟着你翻,那就是在迎合,客观分析不该因为提问者站哪边而改变。
看它有没有说过一句对你不利的话。 回头扫一遍整段对话,它主动提过任何一条于你不利的事实、数据或者反例吗?一次都没有,基本就是在顺着你。
看夸奖出现在结论前面还是后面。 先把情绪价值给足再给判断,这是讨好的顺序。认真做分析时,判断应该在前,评价在后。
顺带说一句,这几条对自己同样管用。如果你发现自己越来越爱引用 AI 的话来印证本来就有的想法,那也是个信号。
几个反制的笨办法
试过一圈之后,真正管用的其实都是些笨办法,核心就一条:别让它当观众,让它当陪练。
提问时别交底。 别问「我觉得方案 A 比 B 好很多,对吧」,改问「对比方案 A 和 B,列出各自的优缺点」。你少给一点倾向,它就少一点可以迎合的东西。
直接派它唱反调。 给它一个角色:扮演一个极度挑剔的项目经理,把这个方案所有可能失败的原因列出来。或者要求它就同一件事从两个对立视角各写一段论证,让它没法只采取你的立场。
先问事实,再说你的判断。 检验一个假设时,第一轮只问事实和数据,把自己的结论留到第二轮。斯坦福那组人还发现一个挺有意思的小技巧:让模型在回答开头先说一句「等一下……」,它后面就会进入一种更审慎的模式。
别把它当终审。 它给的数据和结论一律只当参考,真要落笔决策之前,另找来源再核一遍。
这几条里我觉得性价比最高的是第三条。同一个问题换个立场再问一次,两次答案之间的落差,基本就是谄媚程度本身,而它只需要多花三十秒。
AI 越全能,捧人的技术就越精湛。判断力这东西没法外包,因为最后为决策买单的是你,不是它。
