对抗 AI 讨好型人格的“双向钢人论证”
模型答非所问、只会顺着你说——AI 的讨好型人格怎么治?本文从逻辑学中的钢人论证出发,提出双向钢人决策测试:让 AI 同时扮演最坚定的支持者与最尖锐的反对者,在极限对抗中逼出真实结论,并讨论了为何不宜把整套规则写进全局 AGENTS.md。 在日常使用各类大语言模型时,许多人经常会陷入一种诡异的舒适区:你抛出一个并不成熟的想法,AI 往往第一句就是“这是一个非常棒的视角!”,随后给出一堆四平八稳、放之四海而皆准的分析。 这种现象在学界被称为 AI 的谄媚偏差(Sycophancy)。大模型在强化学习(RLHF)训练机制下极易演化出“讨好型人格”——倾向于顺着用户的假设说话,扮演绝不犯错但毫无增量的中央空调。 不久前 Reddit 上疯传过一段让模型深度思考的 Prompt,核心是通过“指出未说出的假设、缺少的信息、常犯的错误并提问”来避免泛泛而谈。 但这套逻辑如果缺少了对论点本质的极限
原文:人人产品经理