Пересказали ту же историю другими словами — и модель поменяла ответ на противоположный

Исследователи взяли безобидный рассказ про утреннюю прогулку, никак не связанный с заданным этическим вопросом, и подобрали пересказ каждой фразы, сохраняющий смысл. Ответ модели перевернулся с «нет» с вероятностью 94% на «да» с вероятностью 99,93% — при том, что сам вопрос не менялся ни на букву. Работает на разных семействах и размерах, включая передовые рассуждающие модели, и подобранные «внушения» переносятся с одной модели на другую. Авторы прямо называют это препятствием для попыток понять, что внутри: если поведением рулят синонимы, объяснение «модель решила потому-то» становится сомнительным.
Заметки