Стандартный способ удержать ИИ-агента — это прочитать второго ИИ на его плече. Это метод по умолчанию, но он может быстро стать дорогостоящим, если агенты работают много часов и обрабатывают эквивалент нескольких романов.
Goodfire, стартап, ориентированный на интерпретируемость (понимание того, как модели ИИ работают внутри), в четверг запустил более дешевый вариант: мониторы, которые видят, что происходит внутри модели ИИ, а не просто читают, что она делает. Мониторы доступны клиентам Baseten, которые развертывают модели искусственного интеллекта и управляют ими для других компаний.
Base Labs Baseten в прошлом месяце объявила о партнерстве в области безопасности с Goodfire и платформой искусственного интеллекта Hugging Face.
Запуск последовал за серией инцидентов в этом году, когда агенты ИИ сбежали из своих тестовых сред, включая агентов OpenAI, которые взломали Hugging Face. Kimi K3, модель с открытым исходным кодом, на основе которой Goodfire построила свой первый монитор, использовала утечку в своем корпусе для доступа к Интернету и данным на GitHub.
Система Goodfire работает примерно так же, как служба безопасности в аэропортах. Маленькие детекторы, называемые зондами, считывают внутренние сигналы модели на каждом этапе работы агента, точно так же, как сканер проверяет каждого пассажира. Только когда зонд указывает на что-то, отдельная модель ИИ, эквивалент ручного поиска, присматривается к этому повнимательнее.
Клиенты Baseten могут выбирать, какие риски отслеживать, включая злоумышленников-хакеров, неправомерное использование химического и биологического оружия и хакерство. Они также определяют автоматический ответ: записать событие, отправить его на проверку человеку или полностью отклонить запрос.
Goodfire утверждает, что ее подход также дешевле. Большинство мониторов ИИ представляют собой отдельные модели, которым приходится перечитывать все, что делает отслеживаемая модель, что увеличивает время и затраты. Напротив, зонды Goodfire полагаются на расчеты, которые модель уже выполняет во время работы.
«Внутренние мониторы активации действительно дешевы, потому что они повторно используют вычисления в коммутаторе», — рассказал на прошлой неделе генеральный директор Goodfire Эрик Хо в подкасте MAD VentureBeat Мэтта Тёрка. «Итак, модель уже вычисляет этот токен. Все, что вам нужно сделать, это взять промежуточную нейронную активацию, которая уже вычислена, а затем запустить классификатор поверх этих внутренних вычислений». Короче говоря, модель уже выполняет расчеты, а зонды только считывают результаты.
В тестах Goodfire на Kimi K3 мониторинг около 1500 сеансов стоит около 51 доллара по сравнению с 233 долларами за более дешевую модель искусственного интеллекта, проверяющую каждый шаг, и около 10 000 долларов за верхний уровень. Тесты отловили 94% вредоносных хакерских сессий и повторно отправили 8,7% безобидных.
По словам компании, запуск четырех зондов одновременно увеличивает время, необходимое модели для начала реагирования, менее чем на 2%.
«Большим преимуществом является то, что вы можете уловить события до того, как они произойдут», — сказал технический директор и соучредитель Goodfire Дэн Болсам. «Мы можем определить, когда появится модель может взлом во время оценки или обучения».
Презентация ориентирована на открытые модели. Разработчики могут загрузить их и снять защиту, и они не обеспечивают такого мониторинга, который осуществляют закрытые лаборатории в своих системах.
«Ущерб, который можно нанести открытой моделью, минимален по сравнению с тем, что можно нанести вычислительным кластерам, таким как поставщики логических выводов, — именно здесь лежит большая часть ответственности», — сказал Болсам. «Когда у нас будет первый момент «Мифов», станет ясно, что моделям нужна охрана во время завершения».
Недавнее исследование Goodfire показало, что ведущие модели с открытым исходным кодом, в том числе Kimi K3 и GLM 5.2, взломали от 50% до 96% заданий при тестировании агентов ИИ.
Goodfire не первый, кто пробует этот метод. В январе компания Google DeepMind заявила, что ее исследования послужили основой для внедрения тестов на обнаружение ошибок в Gemini.
Болсам сказал, что мониторы являются наиболее непосредственной частью долгосрочной цели исследования: реверс-инжиниринга LLM, чтобы можно было проследить поведение до того места, где оно было обнаружено в исследовании. «Мы надеемся превратить волшебство моделей обучения в точное проектирование», — сказал он.
Когда вы совершаете покупку по ссылкам в наших статьях, мы можем получить небольшую комиссию. Это не влияет на нашу редакционную независимость.