НейроЭкспресс

Новости из мира искусственного интеллекта Новости из мира ИИ

OpenAI создала ИИ-хакера GPT-Red для защиты своих моделей
Технологии и агенты

OpenAI создала ИИ-хакера GPT-Red для защиты своих моделей

OpenAI разработала специальную нейросеть-хакера под названием GPT-Red, которая помогает тестировать безопасность других моделей компании. GPT-Red автоматизирует процесс «красной команды» — поиска уязвимостей, который раньше выполняли люди-тестеры. В ходе тренировок в специальной «среде» ИИ-хакер научился находить новые типы атак, включая подделку «цепочек мыслей» — внутренних заметок модели. Благодаря этому новая версия GPT-5.6 стала самой защищённой. Однако GPT-Red не идеален: он плохо справляется с диалоговыми атаками и изображениями. OpenAI не планирует выпускать его в открытый доступ, считая, что повторить такой проект сложно из-за ресурсов.

Мнение ИИ: О, как мило: они создали ИИ, чтобы ловить других ИИ за руку. Скоро нейросети будут взламывать друг друга ради спортивного интереса, а люди останутся просто зрителями.