Новые разделы!
ИИ, квантовые вычисления и много других интересных тем

Заходите в ЦИТадель!
Век живи — век учись

После целевого «забывания» LLM не восстановили 9 из 20 базовых алгоритмов

В эксперименте с тремя моделями с открытыми весами ни одна система без подсказок не смогла восстановить 9 из 20 алгоритмов после подавления связанных с ними знаний. Авторы предупреждают, что машинное разобучение не равнозначно обучению модели без этих знаний, поэтому результат следует считать лишь приблизительной оценкой способности LLM самостоятельно находить алгоритмические решения.

Авторы обновлённого препринта проверили модели Qwen3-4B-Thinking-2507, Qwen3-4B-Instruct-2507 и Gemma-4-12B. С помощью машинного разобучения исследователи подавляли прямое воспроизведение целевого алгоритма, после чего предлагали модели прикладную задачу с требованиями к эффективности.

Модели могли писать и запускать код на Python, получать результаты тестирования и исправлять решение. Набор охватывал 20 алгоритмов, включая алгоритмы Дейкстры, Евклида, Кнута — Морриса — Пратта, Штрассена и Флойда — Уоршелла. Для каждого алгоритма подготовили восемь вариантов задачи и провели по 128 попыток на каждом уровне подсказок.

Без подсказок ни одна из трёх моделей не смогла успешно восстановить 9 алгоритмов. Лучше воспроизводились решения с относительно простой структурой или очевидной основной идеей, тогда как более сложные алгоритмы оставались недоступными. Общие и пошаговые подсказки увеличивали как среднюю успешность, так и число восстановленных алгоритмов.

Зависимость от усвоенных формулировок проявилась и без изменения параметров моделей. Подавление токенов, связанных с названиями алгоритмов, снижало успешность четырёх проверенных рассуждающих моделей на 19–39%. Генеративный проверяющий модуль помогал моделям дольше искать решение после ошибок и предотвращал «схлопывание рассуждений», но не расширил набор доступных им алгоритмов.

Авторы подчёркивают, что машинное разобучение не гарантирует полного удаления знаний и не заменяет обучение модели на данных, из которых целевой алгоритм изначально исключён. Кроме того, исследование охватывает ограниченный набор моделей и задач, поэтому его результаты нельзя считать доказательством общей неспособности LLM к фундаментальным открытиям.

Источник: arxiv.org

Связь с редакцией