Что такое LLM, какие они бывают и в чём их отличия

Простыми словами: что это вообще такое

LLM расшифровывается как Large Language Model — «большая языковая модель». Это программа, которая умеет понимать текст и сама его писать: отвечать на вопросы, переводить, объяснять, придумывать, спорить.

Самый честный способ объяснить, как она работает: LLM — это автодополнение, доросшее до гения.

Когда телефон подсказывает вам следующее слово в сообщении — это крошечный родственник LLM. Большая модель делает ровно то же самое, только она «прочитала» почти весь интернет и научилась угадывать продолжение настолько точно, что из простого угадывания следующего слова рождаются связные мысли, аргументы и даже код.

То есть модель не «знает» в человеческом смысле. Она снова и снова отвечает на один вопрос: «какое слово вероятнее всего идёт дальше?» — и делает это так хорошо, что результат похож на разговор с понимающим собеседником.

Из чего она «сделана»: три кита

Чтобы дальше было понятно, достаточно усвоить три слова.

1. Токены. Модель видит текст не как слова, а как кусочки — токены. Иногда токен это целое слово, иногда часть слова или знак. Представьте, что текст разбирают на детали лего: модель собирает ответ из таких деталек по одной.

2. Параметры. Это «настроечные ручки» модели — те самые внутренние числа, которые подкрутили во время обучения. Чем их больше, тем тоньше модель улавливает закономерности языка. Именно отсюда буква L (Large): у современных моделей это миллиарды и сотни миллиардов параметров. Аналогия: параметры — это нейронные связи, как синапсы в мозге, только цифровые.

3. Обучение. Модель «выучивают», показывая ей горы текста и заставляя угадывать пропущенные кусочки. Ошиблась — ручки чуть подкрутили. Миллиарды повторений — и получается то, что мы называем LLM. Грубо говоря, модель не запоминает ответы, она запоминает закономерности.

Какие бывают LLM

Моделей много, но различать их удобно по нескольким осям. Одна и та же модель обычно описывается сразу по всем сразу.

1. По доступности: закрытые и открытые

  • Закрытые (проприетарные). Принадлежат компании, работают только через её сервис. Вы пользуетесь, но «под капот» не заглядываете и к себе не скачаете. Это как ресторан: блюдо подадут, рецепт — нет.

  • Открытые (open-weight). Их «внутренности» (веса) выложены в общий доступ. Можно скачать, запустить у себя, доработать. Это как набор продуктов и рецепт: готовьте сами, на своей кухне.

Закрытые часто мощнее «из коробки», открытые дают контроль и приватность.

2. По размеру: большие и маленькие

  • Большие модели умнее, тоньше рассуждают, но дороже и медленнее — им нужно много вычислений.

  • Маленькие модели проще и «глупее», зато быстрые, дешёвые и способны работать даже на ноутбуке или телефоне.

Простое правило: большая модель — как энциклопедия, маленькая — как карманный справочник. Для сложной задачи берут первую, для быстрой и массовой — вторую.

3. По набору навыков: универсальные и специализированные

  • Универсальные — на все руки мастера: и стихи, и код, и рецепт борща.

  • Специализированные заточены под одну область — программирование, медицину, юриспруденцию. Они уже, но в своей теме глубже. Узкий специалист против эрудита.

4. По «органам чувств»: текстовые и мультимодальные

  • Текстовые понимают только текст.

  • Мультимодальные работают ещё и с картинками, звуком, иногда видео. Вы показываете фото и спрашиваете «что здесь не так?» — отвечает именно такая модель.

«Модальность» — это просто тип данных, который модель умеет воспринимать.

5. По способу думать: обычные и рассуждающие

  • Обычные отвечают сразу, «с языка».

  • Рассуждающие (reasoning) перед ответом прогоняют внутреннюю цепочку размышлений — как человек, который решает задачу на черновике, прежде чем сказать результат. Они медленнее, но сильнее в логике, математике и многошаговых задачах.

6. По «воспитанию»: базовые и дообученные

Это различие незаметно пользователю, но важно для понимания.

  • Базовая модель просто продолжает текст — сырой, но эрудированный самоучка.

  • Дообученная (instruct / chat) прошла дополнительную «школу вежливости»: её научили следовать инструкциям и отвечать в диалоге. Почти все модели, с которыми вы общаетесь, именно такие. Базовая модель знает язык, дообученная — учится разговаривать.

Так в чём же разница между конкретными моделями

Когда сравнивают две LLM, на деле сравнивают по нескольким простым пунктам:

Что сравнивают

Что это значит на практике

Размер

Насколько модель «умная» и насколько ресурсоёмкая

Данные обучения

На каких текстах училась — отсюда её сильные и слабые темы

Доступность

Закрытая или открытая, можно ли запустить у себя

Модальность

Только текст или ещё картинки/звук

Окно контекста

Сколько текста модель удерживает «в голове» за раз — её рабочая память

Скорость и цена

Насколько быстро и дёшево она отвечает

Специализация

Универсал или узкий профи

Идеальной модели «на всё» не существует. Это как с транспортом: выбор модели — это не поиск лучшей, а поиск подходящей. Гоночная машина бессмысленна в пробке, а грузовик — на треке.

Коротко, чтобы запомнить

  • LLM — это очень умное автодополнение, обученное на огромных объёмах текста.

  • Она не «знает» факты, а предсказывает вероятное продолжение, опираясь на выученные закономерности.

  • Модели различаются по размеру, открытости, специализации, набору воспринимаемых данных и манере «думать».

  • Сильнее — не всегда лучше: важно, подходит ли модель под конкретную задачу.

Если держать в голове образ «гениального автодополнения с разными настройками», почти любая новость про ИИ становится понятнее.


Читайте также: Популярные LLM · Как общаться с нейросетью · Роли и персонажи