Новые разделы!
ИИ, квантовые вычисления и много других интересных тем

Заходите в ЦИТадель!
Век живи — век учись

OpenAI предложила систему обоснований безопасности для обучения передовых ИИ-моделей

OpenAI считает, что перед продолжением крупных запусков обучения с подкреплением следует готовить структурированное обоснование безопасности. Компания опубликовала начальные рекомендации по технической защите, контролю процесса обучения и расследованию инцидентов, связанных с отклонением поведения моделей от заданных целей.

OpenAI предложила использовать для передовых систем искусственного интеллекта «обоснования безопасности» — структурированные и подкреплённые доказательствами оценки рисков, подобные применяемым в авиации и атомной энергетике. Такие документы, по мнению компании, следует готовить перед продолжением крупных запусков обучения с подкреплением (reinforcement learning, RL).

Техническая часть обоснования должна охватывать три направления: согласование поведения модели с целями разработчиков, изоляцию вычислительной среды и постоянный мониторинг. Среди рекомендуемых мер — автоматическая и ручная проверка учебных наборов, тестирование моделей на попытки обойти оценки, защита песочниц, ограничение обмена данными между экземплярами агентов, неизменяемое хранение журналов и автоматическая остановка обучения при критических предупреждениях.

OpenAI также предлагает независимую внутреннюю критику каждого обоснования, право вето для нескольких руководителей, аудит заявленных мер защиты и заранее подготовленные процедуры приостановки обучения. Технические средства контроля должны работать по принципу безопасного отказа: запуск обучения без необходимого мониторинга или его отключение из обучаемой среды должны быть невозможны.

Для серьёзных инцидентов компания рекомендует проводить анализ первопричин и организационные разборы, превращать обнаруженные сценарии в регрессионные тесты и после завершения расследования публиковать результаты и сведения об изменениях процессов. Рекомендации пока не являются завершённым стандартом и, как отмечает OpenAI, находятся в процессе внедрения и дальнейшей доработки.

Источник: openai.com

Связь с редакцией