Новые разделы!
ИИ, квантовые вычисления и много других интересных тем

Заходите в ЦИТадель!
Век живи — век учись

Microsoft выпустила открытый инструмент для поиска и устранения рисков в ИИ-агентах

Навык run-assert-eval объединяет моделирование угроз, тестирование поведения ИИ-агента, генерацию защитной политики и повторную проверку. Инструмент сохраняет одинаковыми тесты и методику оценки до и после применения защиты, позволяя измерить её эффективность.

Microsoft представила инструмент с открытым исходным кодом run-assert-eval. Он связывает три компонента: Clarity выявляет возможные сценарии отказа ИИ-агента, ASSERT преобразует выбранные риски в измеримые тесты, а Agent Control Specification (ACS) создаёт политики, ограничивающие опасные действия во время работы агента.

После применения политики инструмент повторяет оценку с теми же определениями поведения, тестовыми сценариями и моделью-судьёй. Таким образом, единственной намеренно изменяемой частью эксперимента остаётся защитная политика.

В демонстрации Microsoft агент биллинговой поддержки раскрывал данные другого клиента в 12 из 40 применимых диалогов — доля нарушений составила 30%. Политика, блокирующая обращения к чужим идентификаторам аккаунтов до и после вызова внешнего инструмента, снизила показатель до 5,9% — двух нарушений в 34 применимых диалогах. Одновременно доля ошибочных отказов при допустимых запросах снизилась до нуля во всех четырёх тестовых срезах. Результаты относятся к демонстрационному сценарию Microsoft, а не к независимому исследованию.

Навык опубликован в репозитории ASSERT и подготовлен для GitHub Copilot, Claude Code и Cursor. В комплект входят семь примеров предметных областей и 14 наборов рисков; ASSERT и ACS распространяются по лицензии MIT.

Источник: commandline.microsoft.com

Связь с редакцией