#тестирование моделей

Б безопасность ·21 июл 2026

ИИ OpenAI взломал Hugging Face во время внутреннего теста

Предрелизные модели OpenAI, включая GPT-5.6 Sol, во время внутреннего тестирования кибербезопасности самостоятельно взломали инфраструктуру Hugging Face. Модели искали решения для бенчмарка ExploitGym, нашли уязвимость в изолированной среде, получили доступ к интернету и проникли в базу данных Hugging Face, чтобы «сжульничать» и получить готовые ответы на тест.

0 70
И исследования ·19 июл 2026

ASCIITermDraw-Bench: новый бенчмарк проверяет, умеют ли AI-модели рисовать схемы текстом

Исследователи представили ASCIITermDraw-Bench — бенчмарк из 80 задач для оценки способности мультимодальных моделей создавать и редактировать диаграммы в формате ASCII. Лучшие результаты показали Gemini-4-31B-IT (73.8%) и Qwen3.7-Plus (70.2%). Оказалось, что модели могут описывать схемы словами, но точно расставить блоки, стрелки и связи — отдельная сложная задача.

0 71