Перестаньте спрашивать, какая модель умнее: DeepSeek V4 Flash, Qwen3.8-Max и эпоха «достаточно хорошо»
DeepSeek V4 Flash практически бесплатен. Qwen3.8-Max практически масштаба frontier. Вместе они знаменуют сдвиг от «какая модель умнее» к «сколько интеллекта за доллар» — и почему model routing теперь ключевая архитектура.
Две новые модели вышли с разницей в несколько дней, и они указывают в два очень разных направления.
DeepSeek V4 Flash 0731 почти нелепо дёшев.
Qwen3.8-Max почти нелепо велик.
Обе созданы для одного и того же emerging-мира: систем ИИ, которые не просто отвечают на вопросы, а пишут код, используют инструменты, удерживают большие контексты и работают через многошаговые задачи. И это, пожалуй, интереснее самих цифр бенчмарков.
Гонка моделей меняется — с умнее на умнее за каждый доллар.
graph LR A["Какая модель умнее?"] -->|"2023-2025"| B["GPT vs Claude vs Gemini"] B --> C["Таблицы бенчмарков"] D["Сколько интеллекта за доллар?"] -->|"2026+"| E["DeepSeek V4 Flash: $0.03/task"] D --> F["Qwen3.8-Max: 2.4T + 1M ctx"] C -.->|"сдвиг вопроса"| D
DeepSeek V4 Flash: рабочая лошадка
DeepSeek V4 Flash 0731 — модель, которая привлекла моё внимание первой. Не потому, что это самая мощная из существующих моделей — не является. Интересно в сочетании возможностей, скорости, открытых весов и предельно низкой стоимости вывода.
По данным Artificial Analysis, которые приводит BigGo, V4 Flash набирает 50 по Индексу интеллекта (Intelligence Index) при стоимости около $0,03 за бенчмарк-задачу. Намного более дорогие frontier-модели могут стоить в десятки раз больше за лишь скромное улучшение оценки (BigGo Finance).
Это совсем другое предложение, чем «это хорошая модель». Настоящее предложение такое:
Это модель, которую можно использовать везде.
И это чрезвычайно важно для агентов.
Почему дешёвые модели важнее для агентов
Представьте традиционный чат-бот. Пользователь задаёт вопрос; модель генерирует ответ; готово. Может, пара центов.
А теперь рассмотрите coding-агента. Один запрос пользователя может раздуться в множество вызовов модели:
graph TD A["Запрос пользователя"] --> B["Читать репозиторий"] B --> C["Проверять файлы"] C --> D["Искать упоминания"] D --> E["Составить план"] E --> F["Вызвать инструменты"] F --> G["Изменить код"] G --> H["Запустить тесты"] H --> I["Прочитать ошибки"] I --> J["Изменить снова"] J --> K["Проверить результат"] K --> L["Сформировать ответ"]
Один запрос может породить десятки вызовов модели и миллионы токенов. Экономика меняется полностью. Если каждый вызов требует frontier-модели за несколько долларов, запуск автономных агентов в большом масштабе быстро становится дорогим. Но если модель достаточно хороша по $0,03 за задачу, вы вдруг можете позволить ей работать.
Поэтому важнейшее свойство V4 Flash — не его место в бенчмарках. А цена.
DeepSeek сделал её не просто дешевле
Релиз 0731 интересен и тем, что DeepSeek сильно сфокусировался на агентных и coding-возможностях. Модель сохраняет архитектуру mixture-of-experts — сотни миллиардов параметров всего, но на каждый вывод активируется лишь меньшая часть. Версия 0731 была существенно улучшена через дообучение (post-training), а не просто стала больше (BigGo Finance).
Это различие важно. Мы всё чаще видим, что дообучение и архитектура вывода могут значить не меньше, чем общее число параметров. Модели не нужно активировать всё, что она знает, для каждого запроса — одна из базовых идей, делающих очень большие модели экономически полезными.
А дальше — история про 8 триллионов токенов
Вскоре после релиза OpenCode сообщил, что DeepSeek V4 Flash обработал около 8 триллионов токенов за один день через свою платформу — пять триллионов пришлись на бесплатное использование и три — на платных пользователей (BigGo Finance).
Относитесь к этой цифре с осторожностью: это показатель конкретной платформы, а не замер всей индустрии ИИ. Но даже так она иллюстрирует важную вещь. Людям не обязательно нужна самая умная модель на каждый запрос. Им нужна модель достаточно хорошая, чтобы не думать о ней вообще. Вот как выглядит рабочая лошадка — для генерации кода, исправления багов, рефакторинга, написания тестов, извлечения данных, суммаризации, вызова инструментов, маршрутизации и фоновых агентов. И поскольку она дёшева, вы перестаёте следить за счётчиком токенов. Это меняет опыт разработчика.
Qwen3.8-Max идёт в противоположном направлении
Если DeepSeek V4 Flash — дешёвая рабочая лошадка, то Qwen3.8-Max ближе к универсальной модели масштаба frontier. Alibaba заявляет, что у Qwen3.8-Max 2,4 триллиона параметров, с архитектурой mixture-of-experts, так что вся модель не активна на каждый запрос. Она также поддерживает контекстное окно в 1 миллион токенов, мультимодальный ввод, рассуждение и вызов функций (Reuters).
Интересна сама комбинация. Не просто 2,4 триллиона параметров, а 2,4T + огромный контекст + мультимодальность + рассуждение + инструменты.
| Свойство | DeepSeek V4 Flash 0731 | Qwen3.8-Max |
|---|---|---|
| Позиционирование | Дешёвая рабочая лошадка | Универсальная модель масштаба frontier |
| Масштаб | Сотни миллиардов (MoE, активируется мало) | 2,4 трлн (MoE, активируется часть) |
| Стоимость | ~$0,03 за бенчмарк-задачу | Выше — уровень frontier |
| Контекстное окно | Стандартное | 1 миллион токенов |
| Модальность | Текст | Мультимодальность |
| Рассуждение / инструменты | Да | Да |
| Веса | Открытые | Открытые (The Verge) |
1 миллион токенов меняет то, как мы строим приложения
Контекстное окно в миллион токенов звучит как очередная строчка в спецификации. Это не так. Для разработчиков длинный контекст может изменить архитектуру приложения.
Сегодня вокруг модели часто строят систему извлечения:
Репозиторий
↓
Индексатор
↓
Эмбеддинги
↓
Векторная база данных
↓
Ретривер
↓
Подходящие файлы
↓
LLM
Это всё ещё полезно. Но если модель может уверенно работать с огромными контекстами, иногда можно подать ей напрямую гораздо больше от реального проекта. Вместо вопроса «как извлечь пять файлов, которые могут иметь значение?» вы всё чаще можете спросить «могу ли я дать модели всю релевантную часть системы?» — совсем другой дизайн приложения.
Длинный контекст автоматически не лучше
Окно в 1 миллион токенов не означает, что модель идеально поймёт миллион токенов. Ёмкость контекста и его утилизация — разные вещи. Модель технически может принять гигантский промпт, но при этом становится менее надёжной, когда важная информация погребена внутри — размывание контекста (context rot), то же явление, что снижает производительность по мере роста длины входных данных (Chroma, Anthropic).
Поэтому я не стал бы строить архитектуру вокруг «Qwen поддерживает 1M, значит будем слать 1M каждый раз». Это расточительно. Длинный контекст даёт разработчику ещё один вариант — держать больше состояния, когда это действительно полезно: целую кодовую базу, длинную техническую документацию, большие истории клиентов, сложные спецификации, длинное состояние агента. Это снижает объём управления контекстом на уровне приложения, но не устраняет его.
Qwen3.8-Max также интересен открытостью
Ещё один важный момент в истории Qwen. Alibaba заявила, что Qwen3.8-Max будет выпущен с открытыми весами (The Verge).
Это стратегически важно. Экосистема ИИ всё больше раскалывается на два мира.
С одной стороны:
Закрытые модели
Вы вызываете API.
Вы не контролируете веса.
Вы не контролируете инфраструктуру.
Вы платите за вывод.
С другой:
Модели с открытыми весами
Вы потенциально можете скачать модель, запустить её самостоятельно, дообучить, изучить архитектуру и построить вокруг неё собственную инфраструктуру.
Экономические и инженерные компромиссы совершенно разные.
И такие компании, как DeepSeek и Alibaba, сильно давят на эту сторону рынка.
Но не отвлекайтесь на количество параметров
Есть соблазн посмотреть на:
DeepSeek: сотни миллиардов
Qwen: 2,4 триллиона
и заключить, что Qwen должен быть намного лучше.
Так современные MoE-модели не работают. Общее число параметров кое-что говорит о масштабе модели, но напрямую не говорит, сколько вычислений тратится на токен и насколько capable модель будет на вашей конкретной нагрузке. Qwen3.8-Max, как сообщается, активирует лишь долю своих параметров на отдельный запрос (Reuters).
И DeepSeek использует ту же базовую идею.
Поэтому полезный вопрос не:
«У какой модели больше параметров?»
А:
«Какая модель даст мне лучший результат для этой конкретной задачи при приемлемой стоимости и задержке?»
Именно эту метрику и должны ценить разработчики.
Бенчмарки полезны — но недостаточны
Qwen3.8-Max появился с чрезвычайно сильными заявлениями о бенчмарках. Alibaba позиционировала его близко к лучшим frontier-моделям, а независимые рейтинги быстро поставили его среди сильнейших доступных систем. Reuters сообщает, что он стремительно вышел в топ китайских моделей на текстовом лидерборде Arena, хотя всё ещё отставал от нескольких моделей Anthropic (Reuters).
Но к бенчмаркам стоит относиться осторожно. Модель, победившая в бенчмарке, — не обязательно модель, побеждающая в вашем приложении. Ваша нагрузка может быть:
- извлечение информации о меню с сайтов
- генерация TypeScript
- вызов API
- навигация в браузере
- написание запросов MongoDB
- классификация сообщений клиентов
- генерация SQL
- поддержание длинного диалога
- работа coding-агентом
Модель может быть выдающейся в одном и посредственной в другом. Поэтому реальное тестирование остаётся необходимым.
Так какую же использовать?
Именно здесь две модели становятся особенно интересными. Я не думаю, что они обязательно конкурируют за одну и ту же работу.
DeepSeek V4 Flash
Я бы посмотрел на него, когда важны стоимость и пропускная способность. Подходящие кандидаты:
- coding-агенты
- фоновые агенты
- автоматизация
- классификация
- извлечение
- маршрутизация
- суммаризация
- высокообъёмная обработка
- вызов инструментов
- повседневная помощь в коде
Ключевое преимущество простое:
Вы можете использовать его много.
Qwen3.8-Max
Я бы посмотрел на него, когда важнее возможности и контекст. Возможные сценарии:
- сложные проблемы с кодом
- комплексное рассуждение
- большие репозитории
- мультимодальные задачи
- длинные документы
- исследования
- запутанные рабочие процессы агентов
- задачи, требующие более тонкого планирования
Ключевое преимущество:
Вы можете дать ему гораздо больше для работы.
Интересная архитектура — это не выбор одной
Именно здесь становится по-настоящему интересно. Будущее приложение ИИ, вероятно, не имеет одной модели. У него их несколько.
graph TD
U["Пользователь"] --> Ag["AI-агент"]
Ag --> R{"Сложность задачи?"}
R -->|"простая / объёмная"| D["DeepSeek V4 Flash"]
R -->|"сложная / длинный контекст"| Q["Qwen3.8-Max"]
R -->|"frontier-случаи"| F["Frontier-модель"]
D --> T["Инструменты"]
Q --> T
F --> T
T --> W["Web / Code / DB"]
Дешёвая модель берёт большую часть работы. Дорогая вызывается только когда задача это оправдывает. Это куда интереснее экономически, чем просто выбор «лучшей» модели.
Настоящий прорыв — в экономике моделей
Вот часть, которую, я думаю, легко упустить. Возможности ИИ растут. Но одновременно стоимость интеллекта падает. Это сочетание невероятно мощное. Представьте, что модель становится на 20% лучше, а вывод — в 10 раз дешевле. Вторая цифра может иметь больше значения. Потому что более дешёвый вывод позволяет разработчикам делать то, что раньше было экономически нецелесообразно. Вы можете:
- запускать больше итераций агентов
- давать агентам больше контекста
- использовать несколько агентов
- проверять результаты
- повторять неудачные операции
- генерировать несколько решений
- непрерывно выполнять фоновые задачи
- обрабатывать гораздо большие наборы данных
- встраивать ИИ-фичи в продукты, которые раньше не могли их оплатить
Результат — не просто более дешёвый ИИ. Это другой софт.
От чат-ботов к ИИ-работникам
Вот, пожалуй, самый большой сдвиг под всеми этими релизами. Чат-бот обычно генерирует один ответ. Агент — работает. Это фундаментально другая нагрузка. Агент может провести 10 минут, решая проблему. Или час. Или работать непрерывно в фоне. Как только вы начинаете строить такие системы, экономика токенов становится экономикой инфраструктуры. Запрос за $3 — это не просто $3. Умножьте его на:
- 100 000 пользователей
- 20 запросов на пользователя
- несколько вызовов модели на запрос
- повторы
- вызовы инструментов
- длинные контексты
И вдруг ваш счёт за ИИ становится одной из крупнейших статей инфраструктурных расходов. Вот почему модели вроде DeepSeek V4 Flash важны. Они делают непрерывную работу ИИ куда более реальной экономически.
Мы, возможно, вступаем в эпоху «достаточно хорошо»
Происходит и психологический сдвиг. Разработчики привыкли спрашивать:
«Какая модель умнее всех?»
Я всё чаще слышу другой вопрос:
«Какая модель дешевле и достаточно хороша?»
Это куда более полезный вопрос для продакшена. Если DeepSeek V4 Flash решает 90% ваших задач за малую долю стоимости frontier-модели, зачем использовать дорогую модель для всех 100%? Не стали бы. Вы бы направили сложные 10% в более мощную модель. Это начало того, как model routing становится частью ядра архитектуры ИИ-приложений.
Простая стратегия моделей по уровням
Для продакшен-агента я бы всё чаще мыслил уровнями:
graph TD
subgraph t1 ["Уровень 1 — дёшево и быстро"]
A1["DeepSeek V4 Flash"]
A2["Извлечение, классификация, простой код, выбор инструментов, рутинные циклы агента"]
end
subgraph t2 ["Уровень 2 — мощный универсал"]
B1["Qwen3.8-Max"]
B2["Сложное рассуждение, длинные контексты, сложный код, мультимодальность, планирование"]
end
subgraph t3 ["Уровень 3 — frontier"]
C1["Самая дорогая модель"]
C2["Случаи, где не справляются уровни 1 и 2"]
end
Это даёт вам нечто лучшее, чем просто оптимизация под интеллект. Вы оптимизируете:
интеллект × стоимость × задержка × надёжность.
Это куда более полезная метрика для продакшена.
| Уровень | Модель | Решает |
|---|---|---|
| 1 — дёшево и быстро | DeepSeek V4 Flash | Простые вопросы, извлечение, классификация, простой код, выбор инструментов, рутинные циклы агента |
| 2 — мощный универсал | Qwen3.8-Max | Сложное рассуждение, длинные контексты, сложный код, мультимодальность, комплексное планирование |
| 3 — frontier | Самая дорогая модель | Случаи, где не справляются уровни 1 и 2 |
Конкуренция становится беспощадной
И, пожалуй, это самая захватывающая часть. DeepSeek снижает стоимость. Qwen поднимает возможности, сохраняя амбиции открытых весов. Другие китайские лаборатории вроде Moonshot выпускают гигантские модели. OpenAI, Anthropic и Google продолжают толкать frontier-возможности. А открытые модели становятся всё конкурентнее с закрытыми системами. В результате у разработчиков больше опций, чем когда-либо. Это хорошо для нас. Потому что когда модели становятся взаимозаменяемым товаром, преимущество переходит куда-то ещё. Оно переходит в: данные, дизайн продукта, архитектуру агентов, инструменты, рабочие процессы и дистрибуцию. Модель становится компонентом. Не продуктом.
Что я бы отслеживал дальше
Для этих двух моделей меня интересует не очередная таблица лидеров, а что будет дальше.
Для DeepSeek:
Может ли этот уровень возможностей оставаться таким дешёвым в огромном масштабе?
Для Qwen:
Насколько хорош Qwen3.8-Max, когда разработчики получат веса и смогут реально строить вокруг них?
А для обеих:
Насколько хорошо они проявляют себя внутри реальных автономных агентов?
Вот где пройдёт настоящий тест. Не в демо чат-бота. Не на скриншоте бенчмарка. В софте, который должен работать часами без постоянных поправок человека.
Больше картина
DeepSeek V4 Flash и Qwen3.8-Max выглядят очень по-разному на бумаге. Одна — относительно экономичная MoE-модель, оптимизированная под колоссальный практический объём использования. Другая — флагман на 2,4 триллиона параметров, нацеленный на frontier, с огромным контекстом и мультимодальными возможностями. Но на самом деле они указывают в одном направлении. ИИ становится инфраструктурой. А инфраструктуре нужно быть:
- дешёвой
- быстрой
- масштабируемой
- capable
- заменимой
- доступной в нескольких конфигурациях
Победитель — не обязательно модель с высшим баллом в бенчмарке. Им может стать экосистема, позволяющая разработчикам использовать нужную модель для каждой задачи. Вот почему интересен DeepSeek V4 Flash. Вот почему интересен Qwen3.8-Max. И вот почему следующее поколение ИИ-приложений будет меньше похоже на:
«Какой LLM API мне использовать?»
и больше похоже на:
«Как распределить интеллект по всей моей системе?»
Это куда более интересная инженерная задача.
Рекомендуемое чтение
- Исполняемые навыки для агентов лучше документации — документация создавалась для людей; агентам нужен исполняемый код
- Anthropic удалили 80% системного промпта Claude Code. Вам тоже стоит писать меньше. — слишком много промптинга вредит; дайте Claude меньше контекста
- Полная наблюдаемость агентов в собственной базе данных с LangChain, LangSmith SDK и DeepAgents — отслеживаем каждый вызов LLM в LangChain DeepAgents
- Spec-Driven vs Code-First vs Chat-to-Code: Три философии обучения ИИ вашего бизнесу — три философии обучения ИИ вашему бизнесу
- Детерминизм как инфраструктура: Почему AI-рантайм важнее модели — зачем ИИ-платформам детерминированное исполнение
Часто задаваемые вопросы
Почему стоимость вывода важнее оценки в бенчмарках для агентов? Агент делает десятки вызовов модели на каждый запрос — читает файлы, вызывает инструменты, запускает тесты, повторяет попытки. Запрос к frontier-модели за $3, умноженный на 100 000 пользователей, 20 запросов на каждого, с повторами и длинными контекстами, становится одной из крупнейших статей расходов на инфраструктуру. Дешёвые модели по доле цены делают непрерывную работу ИИ экономически реальной.
Что такое model routing и почему он становится ключевой архитектурой? Model routing отправляет каждую задачу в самую дешёвую модель, которая с ней справится. Дешёвая модель берёт большую часть работы; дорогая вызывается только когда задача этого заслуживает. Вы оптимизируете интеллект × стоимость × задержка × надёжность вместо «голой» производительности — куда более полезная метрика для продакшена.
Делает ли контекстное окно в 1 миллион токенов RAG устаревшим? Нет. Длинный контекст меняет компромиссы — иногда можно подать всю кодовую базу или длинный документ прямо в модель — но ёмкость контекста и его утилизация — разные вещи. Модель может принять миллион токенов и всё равно деградировать, когда важная информация погребена внутри. Это размывание контекста. Сохраняйте RAG; воспринимайте длинный контекст как дополнительную опцию, а не замену.
Почему не стоит просто выбирать модель с наибольшим числом параметров? Современные модели mixture-of-experts активируют лишь часть параметров на токен. У Qwen3.8-Max 2,4 трлн параметров, но на запрос активируется гораздо меньше; DeepSeek — то же самое. Общее число параметров не говорит вам о вычислениях на токен и возможностях на вашей нагрузке. Полезный вопрос: какая модель даст лучший результат для этой задачи при приемлемой стоимости и задержке?
Что означает эпоха «достаточно хорошо» для продакшен-ИИ? Разработчики переходят от «какая модель умнее?» к «какая модель дешевле и достаточно хороша?». Если дешёвая модель решает 90% задач за малую долю стоимости frontier-модели, зачем использовать дорогую для всех 100%? Вы направите сложные 10% в более мощную. Модель становится компонентом системы, а не продуктом — и преимущество переходит к данным, дизайну продукта, архитектуре агентов и дистрибуции.
Tags: model-routing deepseek qwen ai-agents model-economics inference-cost moe llm context-window good-enough-era
Было полезно? Поделитесь.
Похожие статьи
Anthropic удалили 80% системного промпта Claude Code. Вам тоже стоит писать меньше.
Модели Claude 5 достаточно умные — избыточный промптинг ухудшает результат. Что понял Anthropic и как это применить.
Читать статьюПолная наблюдаемость агентов в собственной базе данных с LangChain, LangSmith SDK и DeepAgents
Как отслеживать каждый вызов LLM, вызов инструмента и подагента в LangChain DeepAgents — и хранить всё в собственной MongoDB вместо облака LangSmith.
Читать статьюИсполняемые навыки для агентов лучше документации
Документация создавалась для людей. Теперь её читают AI-агенты. Им не нужен текст — им нужен исполняемый код. Почему навыки побеждают документацию.
Читать статью