Почему миф о безусловном лидере среди DeepSeek V4 и Qwen 3.7 не работает

Стоит выложить в любой профильный чат вопрос «DeepSeek V4 или Qwen 3.7 — что лучше», и через полчаса там будет десяток скриншотов с разными таблицами, каждая из которых называет своего победителя. Проблема не в том, что кто-то ошибается. Проблема в том, что сам вопрос поставлен неправильно — и разбор свежих цифр показывает это лучше любого спора в комментариях.
Откуда взялся миф о едином чемпионе
Обе модели вышли практически одновременно и сразу начали конкурировать за звание лучшего открытого или почти открытого решения для кода и рассуждений. DeepSeek V4 и Qwen 3.7 показывают почти одинаковые результаты на самых цитируемых лидербордах: DeepSeek V4 и Qwen 3.7 post near-identical vendor coding scores (SWE-bench Verified 80.6% vs 80.4%), но они не оба открытые. Разница меньше одного процентного пункта — и именно она порождает заголовки в стиле «X обошёл Y», хотя разрыв в 0,2 пункта на SWE-bench Verified — это статистический шум; на нём никто не должен выбирать модель.
При этом на другом бенчмарке картина разворачивается в обратную сторону. По данным независимых аналитиков, Qwen 3.7 Max лидирует на агентных и терминальных бенчмарках (Intelligence Index, Terminal-Bench Hard, CritPt, SWE-bench), а DeepSeek V4 Pro — на чистых соревнованиях по программированию и математике (LiveCodeBench, Codeforces, AIME). И там же уточняется: различия небольшие в абсолютных цифрах, обычно 1-2 процентных пункта.
Что на самом деле показывают бенчмарки
Если разложить цифры по задачам, а не искать общий рейтинг, картина становится куда понятнее:
- Долгие автономные сессии. На Terminal-Bench 2.0, где агент работает без остановки несколько часов, Qwen3.7-Max набирает 69,7 балла, опережая DeepSeek-V4-Pro Max (67,9) — это бенчмарк на автономную работу в терминале с пятичасовым лимитом.
- Чистое программирование. На LiveCodeBench преимущество разворачивается: DeepSeek V4 Pro показывает 93,5% на LiveCodeBench — лучший результат среди всех моделей.
- Сложные агентные задачи. На более трудном SWE-bench Pro Qwen 3.7-Max обходит DeepSeek на harder SWE-bench Pro (60,6% против 55,4%).
- Математическое и научное рассуждение. На GPQA Diamond Qwen3.7-Max набирает 92,4, обгоняя Claude Opus 4.6 Max с 91,3, тогда как в чистой математике и олимпиадном коде исторически сильнее DeepSeek.
Получается своеобразное коромысло: чуть подвинь критерий — и лидер меняется. Это не признак того, что одна из моделей «слабее». Это признак того, что бенчмарки измеряют разные навыки, и усреднять их в один рейтинг — методологическая ошибка, а не объективная истина.
Открытость и цена меняют весь расклад
Здесь миф о едином лидере разваливается окончательно, потому что появляется третье измерение — доступность модели. DeepSeek V4 и Qwen 3.7 живут в принципиально разных мирах лицензирования: DeepSeek V4 по-настоящему открыт: скачал веса, запустил, дообучил, встроил в продукт. Qwen 3.7 таким не является — Alibaba не выпустила веса 3.7, и нет публичных признаков, что линейка 3.7 будет открыта. Иначе говоря, сравнение часто ведётся между открытой моделью и закрытым API — и это меняет саму постановку вопроса «что лучше».
Цена усиливает разрыв. Qwen 3.7 Max стоит 2,50 / 7,50 доллара за миллион токенов, DeepSeek V4 Pro — 0,40 / 1,20 доллара. Это шестикратная разница. При этом даже в облегчённых версиях расклад не однозначный: Qwen 3.7 Flash дешевле на входе и выходе — примерно в 4,7 раза дешевле на входе — и добавляет нативное зрение, тогда как DeepSeek V4-Flash выигрывает по глубине открытого кода и более глубокой скидке на кэш.
Как выбирать на практике, а не по заголовкам
Практический вывод, к которому приходят почти все независимые тестировщики, звучит одинаково: для большинства команд практический ответ в 2026 году — это стек из двух моделей, а не выбор одной: DeepSeek V4 как открытая дешёвая рабочая лошадка для основной массы кодовых и агентных задач, с флагманской моделью в резерве для самых сложных случаев, где разрыв в качестве реально ощутим.
Разложить выбор проще через задачи, а не через абстрактный «рейтинг»:
- Нужен самостоятельный агент, который часами разбирает баг-трекер без вашего участия — присмотритесь к сильным сторонам моделей, оптимизированных под длинные автономные сессии.
- Нужен дешёвый локально развёрнутый движок для потока однотипных задач с кодом — выигрывает открытая модель с MIT-лицензией.
- Работаете с мультиязычными или визуальными данными — здесь исторически сильнее модели с широкой поддержкой языков и встроенным зрением.
- Важна предсказуемая математика и олимпиадный код — смотрите на модель с лучшим результатом именно в этой узкой категории, а не на «общий балл».
Миф о безусловном лидере удобен для заголовков, но вреден для бюджета: команда, которая один раз «выбрала победителя» и закрыла тему, регулярно платит за задачи, где выигравшая модель объективно слабее конкурента. Гибкий подход — тестировать обе модели на своих реальных промптах и данных, а не на абстрактных таблицах из чужих обзоров.
Вместо вывода
Сравнение DeepSeek V4 и Qwen 3.7 — хороший урок для любой пары близких моделей, будь то GPT и Claude или Gemini и Grok. Разница в один-два процента на одном бенчмарке ничего не говорит о том, как модель справится с вашей конкретной задачей — маркетинговым текстом, парсингом документов или рефакторингом legacy-кода.
Если хочется не гадать по чужим таблицам, а проверить обе модели на своих задачах, в GEMERA AI можно быстро переключаться между DeepSeek, Qwen и другими нейросетями прямо в Telegram-боте или веб-кабинете — без установки, VPN и разбора чужих бенчмарков.