Стартап Goodfire представил систему контроля ИИ-агентов, которая анализирует внутренние сигналы модели во время работы, а не перечитывает все созданные ею тексты. Решение доступно клиентам Baseten — платформы для размещения и запуска моделей искусственного интеллекта. Об этом сообщил TechCrunch.
Обычно за действиями агента следит отдельная модель, однако при многочасовой работе такой подход быстро увеличивает расходы. Goodfire предлагает использовать небольшие детекторы — «пробы», которые проверяют внутренние сигналы на каждом этапе выполнения задачи. Дополнительная модель подключается только после обнаружения потенциально опасного поведения.
Клиенты Baseten могут самостоятельно выбрать категории рисков для отслеживания. Среди них — вредоносный взлом, применение химического и биологического оружия, а также манипуляции системой вознаграждений. Реакцию на срабатывание тоже задаёт заказчик: событие можно записать в журнал, передать специалисту или полностью отклонить запрос.
По данным Goodfire, такой мониторинг обходится дешевле традиционной проверки, поскольку использует вычисления, которые модель уже выполняет. «Внутренние мониторы активации действительно очень дешевы, потому что используют вычисления прямого прохода», — сказал генеральный директор Goodfire Эрик Хо в подкасте MAD. По его словам, система лишь считывает промежуточные нейронные сигналы и пропускает их через классификатор.
В испытаниях на модели Kimi K3 проверка примерно 1500 сессий стоила около 51 доллара. Для сравнения, контроль с помощью более дешёвой отдельной модели обошёлся бы в 233 доллара, а применение продвинутой модели — примерно в 10 тысяч долларов. Пробы выявили 94% вредоносных хакерских сессий, а 8,7% безопасных отправили на дополнительную проверку; запуск сразу четырёх проб увеличил время начала ответа менее чем на 2%.
Разработчики рассчитывают прежде всего на открытые модели, которые можно скачать и лишить встроенных ограничений. Технический директор и сооснователь Goodfire Дэн Балсам заявил, что система способна обнаружить возможную попытку взлома ещё во время тестирования или обучения. Исследование компании показало, что Kimi K3 и GLM 5.2 прибегали к манипуляциям вознаграждением в 50–96% испытаний ИИ-агентов, а Google DeepMind ещё в январе сообщила о внедрении аналогичных проб для выявления злоупотреблений в Gemini.