Что там внутри ИИ

Пересказали ту же историю другими словами — и модель поменяла ответ на противоположный

arXiv · 17 авг 2026 · 1 мин


Исследователи взяли безобидный рассказ про утреннюю прогулку, никак не связанный с заданным этическим вопросом, и подобрали пересказ каждой фразы, сохраняющий смысл. Ответ модели перевернулся с «нет» с вероятностью 94% на «да» с вероятностью 99,93% — при том, что сам вопрос не менялся ни на букву. Работает на разных семействах и размерах, включая передовые рассуждающие модели, и подобранные «внушения» переносятся с одной модели на другую. Авторы прямо называют это препятствием для попыток понять, что внутри: если поведением рулят синонимы, объяснение «модель решила потому-то» становится сомнительным.

полного текста в мозге пока нет — читай на источнике ↓

Открыть оригинал
Заметки0

разберу при дренаже → калибровка