Инструменты, которыми заглядывают внутрь модели, не помогли угадать, что она сделает

Команда построила конвейер, который сам находит странности в поведении модели на реальных запросах и проверяет их встречными опытами: меняем во входе одну вещь — предсказываем, изменится ли ответ. Проверка была жёсткой, результат отрицательный: ни один из изученных способов заглянуть внутрь не дал прибавки в точности предсказания. То есть красивое объяснение «вот эта внутренняя штука отвечает за такое поведение» пока не переводится в способность предсказать поведение на изменённом входе.
Заметки