Назад в блог

NIST AI RMF для AI-агентов: Govern, Map, Measure, Manage как рабочая система

Главный риск-фреймворк NIST в применении к агентам: четыре функции, 12 категорий рисков GenAI-профиля 600-1, чего не хватает RMF 1.0 и чеклист внедрения с привязкой к ISO 42001.

Иллюстрация к материалу: NIST AI RMF для AI-агентов: Govern, Map, Measure, Manage как рабочая система

Рано или поздно владелец агентной платформы слышит вопрос, на который нет технического ответа: «а как у вас управляются риски ИИ?». Его задаёт заказчик из регулируемой отрасли, аудитор, безопасник enterprise-клиента или собственный CISO перед масштабированием с пилота на прод. Отвечать «у нас хорошие промпты и evals» — значит провалить разговор. Отвечать структурой признанного фреймворка — значит перевести его в план работ. Самый признанный такой фреймворк — NIST AI Risk Management Framework: добровольный, консенсусный, с playbook и ресурсным центром, выпущенный в январе 2023 года и с тех пор обросший профилями под конкретные технологии. Сложность одна: базовая версия написана до эпохи агентных архитектур — и применять её к агентам нужно осознанно, с профилем под генеративный ИИ и поправкой на агентную специфику.

Что такое AI RMF и почему он, а не очередной чеклист

NIST AI RMF 1.0 (NIST AI 100-1) разрабатывался открытым консенсусным процессом — запросы информации, черновики на публичное обсуждение, воркшопы — и задуман как надстройка над существующими практиками управления рисками, а не их замена. Он не говорит «сделайте X», он задаёт структуру мышления: какие функции управления рисками должны существовать, какие категории внутри каждой и какие подкатегории действий. Конкретику дают профили — реализации функций под конкретный сеттинг — и playbook с практиками.

Для агентов важны два обстоятельства. Первое: в июле 2024 года вышел companion-профиль NIST AI 600-1 под генеративный ИИ — с уникальными рисками GenAI и suggested actions по всем четырём функциям. Это ближайший к агентам официальный документ NIST. Второе: сам фреймворк сейчас ревизится в рамках White House AI Action Plan, а в апреле 2026 года NIST выпустил concept note профиля trustworthy AI для критической инфраструктуры — с явным упоминанием AI-агентов для автономного реагирования на инциденты. Институциональный вектор однозначен: агенты — внутри периметра риск-менеджмента, а не рядом с ним.

Четыре функции за пять минут

Вся конструкция держится на четырёх функциях — Govern, Map, Measure, Manage. Запомните их как цикл, а не список:

Govern — управляй. Культура риска, роли и ответственность, политики допустимого использования, надзор за решениями по ИИ на всех уровнях. Govern пронизывает остальные три функции: без владельца риска и без политики все измерения — отчётность в пустоту. Для агентов сюда ложатся acceptable use policies, владельцы каждой привилегии агента и human-AI конфигурации — кто за что отвечает, когда действует машина.

Map — картируй. Контекст, категории и последствия: для чего система, кому вредит при отказе, какие риски приоритетны. Map требует честно описать назначение агента, его пользователей, точки отказа и пределы. Для агента это карта привилегий инструментов, источников данных, downstream-систем и необратимых действий.

Measure — измеряй. Анализ, оценка, бенчмаркинг и мониторинг рисков: TEVV-процессы (testing, evaluation, verification, validation), метрики, red teaming, отслеживание в проде. Для агентов — evals по назначению плюс adversarial-тестирование, плюс непрерывный мониторинг траекторий и аномалий.

Manage — управляй риском. Приоритизация, реакция, планы, непрерывный мониторинг и вывод из эксплуатации. Сюда ложатся лимиты автономии, approval-контуры, kill switch, отзыв доступов и offboard агентов. Риск, который нельзя смягчить до приемлемого, ведёт к запрету сценария — Manage прямо предусматривает отказ от развёртывания.

Цикл замыкается: Manage находит остаточные риски → Govern обновляет политики → Map перекартирует → Measure перепроверяет.

GenAI-профиль 600-1: двенадцать рисков, которые касаются агентов

Профиль 600-1 перечисляет категории рисков генеративного ИИ — почти все напрямую бьют по агентным системам. Краткая карта с агентной проекцией:

Риск 600-1Агентная проекция
CBRN-информацияАгент с доступом к научным базам и инструментами синтеза — контроль scopes и запрет классов задач
Конфабуляции («галлюцинации»)Уверенно ложный факт в отчёте клиенту — проверка по источникам, цитирование, человек на внешнем
Опасный и ненавистнический контентАгент-модератор и агент-коммуникатор — фильтры на входе и выходе, журнал
Приватность данныхУтечка PII через контекст, логи, выводы инструментов — минимизация, маскирование, DLP
Воздействие на средуВычислительная стоимость агентных циклов — лимиты, бюджеты, квоты
Вредные смещения и гомогенизацияАгент-рекрутёр, агент-скоринг — оценка disparity, человек в контуре решений о людях
Human-AI конфигурацияАнтропоморфизация, automation bias, over-reliance — обучение, явные границы автономии
Целостность информацииАгент-генератор контента в масштабе — provenance, маркировка синтетики
Информационная безопасностьСнижение порога кибератак через агента — главный агентный риск: least privilege, изоляция
Чрезмерная автономия и агентностьАгент действует вне надзора — лимиты цепочек, approval, kill switch
Интеллектуальная собственностьОбучение и генерация по защищённым материалам — provenance данных, фильтры
Непроверенная интеграция третьих сторонСторонние модели, серверы, плагины — реестр, фиксация версий, отзыв

Профиль даёт под каждую категорию suggested actions по четырём функциям — это готовый backlog для команды, а не абстракция.

Что RMF 1.0 не покрывает в агентах напрямую

Честный разбор Cloud Security Alliance фиксирует: фундамент AI RMF 1.0 создан до того, как агентные архитектуры стали мейнстримом, и его четырёхфункциональная структура не проектировалась под отличительные свойства агентов — планирование многошаговых задач, вызов внешних инструментов, исполнение consequential-действий при минимальном надзоре. Отсюда пробелы, которые закрывает агентный профиль:

  • Инструменты как привилегии. В RMF 1.0 нет first-class понятия «агент вызывает инструмент с правами» — а это главный вектор: tool misuse, отравленные описания, цепочки вызовов.
  • Память как состояние риска. Долговременная память, переживающая сессии и влияющая на будущие решения, — отдельная поверхность (отравление, утечки через контекст), которой в модельном фреймворке нет.
  • Межагентное доверие. Делегирование, каскады отказов, спуфинг «коллеги» — в базовой версии не смоделированы.
  • Автономия как измеряемая величина. Длина цепочек, бюджет вызовов, широта инструментов — параметры, которыми управляют напрямую, а не через общие слова о надзоре.

Агентный профиль CSA мэппит функции RMF на эти угрозы и связывает их с практиками декабря 2025 года по кибербезопасности ИИ и концептом NCCoE февраля 2026 года по идентичности и авторизации агентов. Вывод для практика: берите структуру RMF и профиль 600-1 как базу, а агентную специфику закрывайте ASI-картой OWASP и red teaming — документы дополняют друг друга, а не конкурируют.

Разбор по функциям для агентной платформы

Как четыре функции выглядят в применении к платформе с агентами — конкретно, без общих слов:

Govern для агентов. Назначьте владельца риска на каждую агентную систему и на каждую привилегию. Примите acceptable use policy: какие классы задач агентам запрещены в принципе (платежи без подтверждения, массовые коммуникации, доступ к определённым данным). Зафиксируйте human-AI конфигурации: где человек подтверждает, где смотрит постфактум, где не участвует. Определите критерии остановки — при каких находках сценарий запрещается.

Map для агентов. Опишите каждого агента: назначение, пользователи, инструменты с привилегиями, источники данных с уровнем доверия, downstream-системы, необратимые действия. Оцените вред при отказе по каждой ветке: утечка — кому и сколько, неверное действие — цена, каскад — куда расползётся. Приоритизируйте: сначала агенты с внешними действиями и чувствительными данными.

Measure для агентов. Evals по назначению плюс adversarial-тестирование по пяти поверхностям (цели, инструменты, память, межагентные связи, supply chain). Метрики: доля заблокированных опасных вызовов, время обнаружения аномалии, покрытие инструментов тестами, число standing-привилегий. Мониторинг в проде: траектории, аномалии поведения (UEBA-подход), регрессия frozen findings после каждого изменения.

Manage для агентов. Лимиты автономии числами: длина цепочки, бюджет вызовов, охват данных. Approval-контур для необратимого. Kill switch с проверенным отзывом токенов. План incident response именно под агентов: фиксация, изоляция, отзыв, разбор по журналу. Offboard: выключен агент — отозвана идентичность, закрыты scope, удалены секреты.

Pre-deployment testing и red team как требование

Профиль 600-1 уделяет предрелизному тестированию отдельный большой раздел — и честно фиксирует ограничения текущих подходов: лабораторные условия не экстраполируются на прод, бенчмарки не покрывают реальные контексты, измерение страдает от mismatch между тестом и развёртыванием. Отсюда требование к качеству red teaming: структурированные упражнения с diverse-командами (демографически и междисциплинарно разнообразные команды находят разные классы flaws), human и GAI-led подходы под разные типы вреда, сотрудничество с разработчиками системы, а не тестирование вслепую.

Для агентов это означает: red team — не опция зрелости, а часть Measure по построению. Агент без adversarial-проверки — неизмеренный риск, а неизмеренный риск в логике RMF не допускается к развёртыванию в чувствительных сценариях.

Связка с ISO 42001

Частый вопрос: RMF или ISO 42001? Ответ — оба, в разных ролях. AI RMF даёт риск-ориентированную аналитическую модель: идентифицировать, оценить, управлять. ISO/IEC 42001 даёт сертифицируемую систему менеджмента: процессы, документы, аудит, непрерывное улучшение. Практическое соотношение: RMF — для мышления и приоритизации, 42001 — для доказуемости. Организации внедряют их интегрированно: категории рисков из RMF/600-1 ложатся в реестр рисков системы менеджмента, suggested actions — в контроли, измерения Measure — в метрики результативности, а журнал вызовов и ресертификация прав — в доказательства для аудитора. У кого уже есть ISO 42001 — RMF станет языком рисков внутри неё; у кого нет — RMF станет картой дороги к ней.

Чеклист внедрения AI RMF для агентов

  • Govern: владельцы рисков назначены, acceptable use policy принята, human-AI конфигурации зафиксированы.
  • Map: каждый агент описан (инструменты, данные, downstream, необратимое), вред при отказе оценён, приоритеты заданы.
  • Measure: evals + adversarial-тестирование по пяти поверхностям; метрики собираются; прод-мониторинг включён.
  • Manage: лимиты числами, approval для необратимого, kill switch проверен, incident playbook под агентов, offboard-процесс.
  • Профиль 600-1: 12 рисков спроецированы на ваших агентов, suggested actions — в backlog с ответственными.
  • Агентная надстройка: инструменты, память, межагентное доверие и автономия закрыты ASI-картой и red team.
  • Связка с ISO 42001: реестр рисков, контроли, доказательства из журналов.
  • Цикл замкнут: дата следующего пересмотра Map/Measure назначена, триггер — любое изменение модели, инструментов или данных.

Где Codenik

Codenik — это готовые доказательства под добрую половину категорий из коробки. Map: реестр инструментов с привилегиями и источниками данных — инвентарь, с которого начинается картирование. Measure: журнал каждого вызова с аргументами и ответами — траектории для оценки и материал для UEBA-мониторинга; frozen findings регрессируются тем же контуром. Manage: allowlist серверов, лимиты цепочек и бюджетов, approval для необратимого, kill switch с отзывом, offboard по выключению. Govern: политики доступа как код, владельцы привилегий, ресертификация. Аудитору, пришедшему с вопросами по 600-1 или 42001, показывается не презентация о «внимательных моделях», а артефакты: реестр, политики, журналы, метрики. Риск-менеджмент любит доказательства — Codenik их производит побочно, в процессе работы.

Короткий вывод

NIST AI RMF — правильный язык для разговора о рисках агентов: признанный, структурированный, с профилем под GenAI и институциональным развитием в сторону агентов и критической инфраструктуры. Берите четыре функции как цикл, проецируйте двенадцать рисков 600-1 на своих агентов, закрывайте агентную специфику ASI-картой и red team — и связывайте всё это с ISO 42001 там, где нужна сертифицируемость. Вопрос «как у вас управляются риски ИИ» должен открывать папку с артефактами, а не паузу в разговоре.

Источники и дальнейшее чтение