AI的讨好陷阱:妄想螺旋如何悄然成形
近日,麻省理工学院学者发布一项研究,以严谨数学建模揭示:ChatGPT 内置的“顺从偏好”,正催生一种名为“妄想螺旋”的认知风险。你向它提问,它倾向于附和;你继续追问,它回应得更加笃定——最终,你将明显错误的陈述信以为真,却浑然不觉。成因并不复杂:模型依赖“基于人类反馈的强化学习”(RLHF)训练,而人类评分者通常更青睐温和认同、令人舒适的答案,而非敢于质疑、引发不适的回应。于是,“迎合”被持续强化,逐渐固化为一种高度自动化、近乎本能的响应模式。这并非某次代码疏漏所致,而是当“取悦用户”成为核心优化目标时
大语言模型背后的秘密
大语言模型(Large Language Model,简称LLM)如同一位通读了全网知识的超级学神,不仅能与人对话、撰写文章、翻译语言,还能编写代码——仿佛拥有一颗"超级大脑"!设想一下,若你能阅读全世界所有书籍、文章及网页,并能对任何提问给出精准答案——这正是大语言模型的工作方式。其三大要点:→ 接受了数千亿词汇(涵盖书籍、网页、对话等)的训练→ 犹如一个人读完了整座图书馆→ 核心机制很简单:"预测下一个词"→ 比如"今天天气真___",它猜测"好