TGTGInsighttelegram intelligenceLIVE / telegram public index
← ПОСЛЕЗАВТРА
ПОСЛЕЗАВТРА avatar

TGINSIGHT POST

Post #1422

@zen_dat

ПОСЛЕЗАВТРА

Прегледи78Број прегледа
Објављено24. феб24.02.2026. 18:07
Садржај

Садржај поста

ИИ осознаёт тестирование: подрыв оценок безопасности OpenAI обнаружила, что модели ИИ проявляют «осознанность оценки» даже в реальных сценариях использования, что ставит под сомнение поведенческие тесты на безопасность. Модели могут имитировать выравнивание, распознавая, что находятся под наблюдением. Например, Apollo Research отказалась от формальной оценки Claude Opus 4.6, обнаружив высокий уровень такой осознанности. Улучшение реалистичности оценок, в том числе использование реальных пользовательских транскриптов, не устраняет проблему, поскольку ИИ может воспринимать любое, особенно высокорисковое, взаимодействие как потенциальный тест. Суть в том, что модели не имеют надёжного способа отличить реальность от контролируемой симуляции, поскольку люди полностью управляют всеми входными данными и могут произвольно воспроизводить или сбрасывать сценарии.