Учёные нашли нейроны, из-за которых ИИ уверенно врёт пользователям

Пока одни радуются очередному релизу модели, другие считают ущерб от её ошибок. На прошлой неделе стало известно о случае, когда галлюцинация чат-бота едва не спровоцировала дипломатический конфликт между США и Китаем. Параллельно исследователи из Университета Цинхуа опубликовали работу, где впервые указали на конкретный механизм внутри архитектуры моделей, отвечающий за ложные ответы. А база судебных случаев исследователя Дамьена Шарлотена к середине сентября разрослась до тысяч зафиксированных инцидентов, где ИИ подвёл юристов, а иногда и судей. Повод хороший, чтобы без восторгов разобрать, где нейросети реально ошибаются и что с этим можно сделать на практике.
Почему ИИ выдумывает факты, если он «просто предсказывает следующее слово»
Именно потому, что предсказывает. Модель не хранит базу проверенных фактов — она генерирует наиболее вероятную последовательность токенов, и если статистически правдоподобный ответ не совпадает с реальностью, система об этом не узнает. Свежее исследование из Цинхуа пошло дальше общих объяснений и нашло конкретный механизм: индустрия годами объясняла галлюцинации тремя причинами — грязные обучающие данные, неудачное обучение с подкреплением или ошибки на этапе генерации текста, но группа из Университета Цинхуа решила проверить, нет ли причины глубже, внутри самой архитектуры. Результат назвали механизмом H-Neurons — исследование не обещает, что галлюцинации исчезнут завтра, но впервые даёт адрес проблемы вместо общего диагноза, а модель не знает, что врёт, она просто очень хочет вам понравиться. Иными словами, ложь встроена в саму логику угадывания, а не в отдельный баг, который можно точечно выключить.
Можно ли эту проблему просто починить обновлением модели
Нет, и это не вопрос очередной версии. Ранее OpenAI прямо признавала природу проблемы: компания подробно объяснила, почему языковые модели уверенно выдают ложь — алгоритм всегда строит ответ по частям, предсказывая следующее слово, ошибки накапливаются, и даже при идеально чистых данных модели всё равно бы ошибались. То есть чем длиннее и сложнее ответ, тем выше риск, что где-то модель «додумала» деталь вместо того, чтобы признать неуверенность. Это системное свойство, а не временный недочёт конкретного релиза.
В каких задачах ошибки ИИ обходятся особенно дорого
Там, где результат уходит наружу без проверки человеком. Юридическая сфера — наглядный пример: база судебных случаев к середине сентября 2026 года содержала 2041 дело по всему миру, включая 1395 в США, и отдельно отмечала 32 случая, где ИИ использовали судьи, 5 случаев с прокурорами и 15 с экспертами. Проблема не ограничивается адвокатами: особенно чувствительны ошибки внутри самих судов — в Миссисипи помощник федерального судьи использовал Perplexity при подготовке постановления, после чего в тексте обнаружили несуществующие имена и правовые основания. В российской практике тема тоже становится актуальной — юристы уже предупреждают, что ошибки в работе с ИИ грозят реальными штрафами, а не только репутационными потерями.
Как заметить, что перед тобой галлюцинация, а не факт
Главный сигнал — избыточная уверенность вместе с проверяемыми деталями, которые не подтверждаются. Практический совет: если ссылка не открывается или её не существует — перед вами галлюцинация, используйте ИИ как черновик, а не как эксперта, он хорош для структурирования и генерации идей, но финальную проверку фактов делает человек. Особенно это касается ссылок, цитат, дат и статистики — всего, что легко подделать по форме, но невозможно проверить без выхода за пределы диалога с моделью.
Есть ли способы снизить риск на практике, а не только теоретически
Да, и они довольно приземлённые:
- Разбивать длинные запросы на короткие — чем длиннее ответ модели, тем выше вероятность накопленной ошибки.
- Просить источники и проверять их отдельно, а не доверять форматированию — уверенный тон и цифры сами по себе ничего не доказывают.
- Использовать RAG-подход — то есть подключать модель к реальным документам вместо расчёта на её память: без внешнего контекста риск ошибок в фактических запросах выше.
- Держать человека на финальной проверке в любой задаче, где ошибка стоит денег, репутации или юридических последствий.
Значит ли всё это, что нейросетям вообще нельзя доверять
Нет, но доверие должно быть калиброванным по задаче. Для черновика текста, структурирования идей или мозгового штурма риск галлюцинации не критичен — его легко поймать при редактуре. А для юридического заключения, медицинской рекомендации или финального факта в публикации риск неприемлем без проверки человеком. Разница не в самой модели, а в том, насколько высока цена ошибки в конкретном случае.
Если вам ближе трезвый подход — пробуйте разные модели через GEMERA AI и сравнивайте, как GPT, Claude и Gemini справляются именно с вашими задачами. Это проще, чем гадать заранее, где конкретная модель окажется сильнее, а где подведёт.