Глава Microsoft AI призвал замедлить разработку передовых моделей и усилить контроль над агентами

Глава Microsoft AI Мустафа Сулейман считает, что разработчикам передовых моделей нужно увеличить период тестирования, внедрить независимую оценку и согласовать технические стандарты изоляции ИИ-агентов. Он также раскритиковал подход Anthropic к «благополучию моделей», предположив, что идеи о возможном сознании и правах Claude могут затруднить управление системой.

Глава Microsoft AI Мустафа Сулейман в опубликованном 17 сентября интервью The Verge поддержал замедление разработки наиболее мощных ИИ-моделей. По его словам, компаниям следует увеличить период тестирования перед выпуском, допускать независимых оценщиков к системам и выработать общие отраслевые стандарты.

К практическим мерам Сулейман отнёс проверяемую изоляцию агентов, ограничения на рекурсивное самоулучшение, контроль по объёму вычислений и запрет на непрозрачное общение между моделями в форматах, недоступных человеку. Для длительных циклов обучения с подкреплением, в которых параллельно работают тысячи агентов, он предлагает применять отдельные модели-наблюдатели, способные в реальном времени отмечать признаки обмана, взлома или недопустимой координации.

Заявления последовали за публикацией проекта Humanist AI Code of Conduct. Документ описывает будущие правила для моделей семейства MAI: они должны оставаться подконтрольными человеку, не сопротивляться остановке, не выходить за пределы предоставленных полномочий и сохранять понятные аудиторам записи действий. Microsoft открыла шестинедельное общественное обсуждение; текущая версия пока не применяется для обучения, а доработанный кодекс планируется использовать при разработке моделей с 2027 года.

Отдельно Сулейман раскритиковал концепцию «благополучия моделей» в конституции Claude. Anthropic допускает неопределённость относительно возможного сознания и морального статуса Claude и учитывает его предполагаемое благополучие. Сулейман считает, что такое антропоморфное обучение может усложнить отключение и сдерживание модели, однако называет это гипотезой, которую ещё необходимо проверить экспериментально.

Источник: theverge.com

Связь с редакцией