OpenAI o3 vs DeepSeek-R1: как две reasoning-модели решают задачи по-разному

В январе 2025 года на арене reasoning-моделей появились два тяжеловеса: OpenAI o3 и китайская DeepSeek-R1. Обе умеют «думать вслух», показывая цепочку рассуждений перед ответом, но архитектура, скорость и сценарии применения различаются. Разбираем ключевые отличия и практические рекомендации.
Архитектура и доступность
OpenAI o3 — закрытая модель, пока доступная ограниченному кругу исследователей. Компания анонсировала её в декабре 2024-го, но публичного релиза ещё не было. o3 использует усиленное обучение с верификацией — модель генерирует несколько вариантов решения, проверяет их и выбирает лучший. Это требует значительных вычислительных ресурсов, поэтому ответ может занимать десятки секунд.
DeepSeek-R1 вышла в открытый доступ в начале января 2025 года — с полными весами и Apache 2.0 лицензией. Модель также опирается на цепочки рассуждений, но обучена с меньшими затратами и работает быстрее. Открытость позволяет запускать R1 на собственных серверах и дообучать под специфические задачи.
Производительность в бенчмарках
По данным тестов ARC-AGI (абстрактное рассуждение) OpenAI o3 показывает результат около 75–88% в зависимости от режима вычислений — это рекорд среди публично протестированных моделей. DeepSeek-R1 в том же бенчмарке набирает около 60–65%, что всё равно выше, чем у GPT-4o и Claude 3.7 Sonnet без reasoning-режима.
В математических задачах (AIME, MATH-500) обе модели показывают сопоставимые результаты на уровне 70–80% правильных ответов, обгоняя стандартные чат-модели. В задачах на программирование (Codeforces) DeepSeek-R1 иногда обходит o1 (предшественника o3), благодаря более длинным цепочкам рассуждений и проверке промежуточных шагов.
Скорость и стоимость
OpenAI o3 работает в двух режимах: низкий и высокий compute. В режиме высокого compute модель может «думать» минуту и дольше, генерируя детальное обоснование каждого шага. Это даёт максимальную точность, но делает модель непригодной для реалтайм-задач. Стоимость запросов пока не раскрыта — ожидается, что она будет выше, чем у o1.
DeepSeek-R1 отвечает за 10–30 секунд в зависимости от сложности задачи. Открытые веса позволяют развернуть модель локально или через API сторонних провайдеров — это снижает издержки для команд с высокой нагрузкой. Для задач, где важна скорость и приемлемая точность, R1 часто оказывается выгоднее.
Когда выбирать o3, а когда R1
OpenAI o3 подходит для:
- Сложных исследовательских задач, где критична максимальная точность
- Верификации решений в математике, физике, формальной логике
- Сценариев, где время ответа не критично, а бюджет позволяет
DeepSeek-R1 лучше для:
- Задач, где нужна прозрачность рассуждений, но с ограничением по времени
- Кастомизации под отраслевые домены (медицина, юриспруденция, инженерия)
- Команд, которым важна независимость от закрытых API и контроль над данными
Если задача требует объяснения каждого шага для аудита или обучения — обе модели справятся, но R1 даст больше гибкости в настройке формата вывода.
Перспективы развития
OpenAI планирует расширить доступ к o3 в первом квартале 2025 года, вероятно, через API с уровнями compute. Это позволит разработчикам балансировать между точностью и скоростью. Ожидается, что o3 станет основой для агентских систем, где модель не просто отвечает, а планирует последовательность действий.
DeepSeek продолжает итерации — сообщество уже выпустило несколько файнтюнов R1 под конкретные языки и домены. Открытость модели ускоряет эксперименты: исследователи тестируют гибридные схемы, где R1 генерирует план, а более быстрая модель выполняет рутинные шаги.
Хотите протестировать reasoning-модели на реальных задачах? В GEMERA AI доступны как закрытые модели (o1, Claude), так и открытые альтернативы — вы можете сравнить подходы и выбрать оптимальный для вашего сценария. Попробуйте обе и оцените разницу в скорости, точности и формате рассуждений.