Вы упускаете торговые возможности:
- Бесплатные приложения для трейдинга
- 8 000+ сигналов для копирования
- Экономические новости для анализа финансовых рынков
Регистрация
Вход
Вы принимаете политику сайта и условия использования
Если у вас нет учетной записи, зарегистрируйтесь
Qwen3.8-Flash-Next: Alibaba анонсировала первый взгляд на архитектуру нового поколения Qwen4
//текст и обложка Gemini 3.6 Flash. https://qwen.ai/blog?id=qwen3.8-flash-next
Команда Qwen (Alibaba) официально представила модель Qwen3.8-Flash-Next — мультимодальную нейросеть с открытыми весами, которая стала не просто очередным обновлением линейки, а официальным технологическим превью архитектуры следующего поколения Qwen4.
Модель сочетает гибридные слои размышления, ультра-разреженную архитектуру MoE (Mixture-of-Experts) и уникальный механизм работы с памятью, позволяющий запускать 125-миллиардную модель на стандартном железе с объединенной памятью.
🛠 Архитектурные особенности: Мост к Qwen4
Несмотря на индекс 3.8 в названии, разработчики Alibaba прямо называют Qwen3.8-Flash-Next тизером архитектуры Qwen4.
Главные инженерные решения модели:
Ультра-разреженный MoE (Ultra-sparse MoE): Из общих ~125 млрд параметров при генерации каждого токена активируется всего около 6 млрд активных параметров. Это снизило стоимость вычислений почти в 9 раз по сравнению с Qwen3.7-Plus.
Таблицы эмбеддингов N-gram (Per-Layer Embeddings / PLE): В модель встроена дополнительная таблица N-gram на 51 млрд параметров. Она берет на себя рутинный контекстный поиск и снижает нагрузку на вычислительные блоки.
Слои GDN и QSA: Использование гибридных слоев Gated Delta Network (GDN) и разреженного внимания Qwen Sparse Attention (QSA) существенно ускоряет работу с длинными последовательностями.
Гибкое контекстное окно: В открытых весах для локального инференса поддерживается до 262 144 токенов, а в облачном API (QwenCloud) контекст нативно расширяется до 1 000 000 токенов без потери качества.
Управление мышлением (Hybrid Thinking): Модель поддерживает точечную настройку глубины рассуждений через параметр reasoning_effort (xhigh, medium, low, none), а также функцию Preserve Thinking, сохраняющую цепочки рассуждений из предыдущих шагов диалога.
📊 Бенчмарки и сравнение с конкурентами
В категории «быстрых» флагманов (Flash-сегмент) сложилась плотная конкуренция. Qwen3.8-Flash-Next соревнуется с актуальными моделями от Zhipu AI и DeepSeek.
Сравнительная таблица производительности:
Основные акценты:
Qwen 3.8 Next доминирует в изолированном алгоритмическом кодинге (91.9%), фундаментальной логике (GPQA 91.7%) и управлении мобильными интерфейсами (AndroidWorld 84.5%).
GLM 5.3 Flash удерживает лидерство в задачах UI-to-Code и фронтенд-агентства, генерируя готовую верстку по картинкам макетов.
DeepSeek V4 Flash Vision выигрывает в понимании структуры крупных репозиториев (NL2Repo) и работе с консольными командами.
💻 Локальный запуск и требования к железу
Одной из главных новостей релиза стала поддержка Day-Zero со стороны опенсорс-сообщества (Unsloth, llama.cpp и vLLM).
Благодаря архитектуре N-gram / PLE, тяжелые слои эмбеддингов можно выгружать в обычную оперативную память (RAM) или даже на быстрый NVMe SSD через mmap, не забивая VRAM видеокарты.
Системные требования:
Квантование Dynamic GGUF (1-bit / 4-bit PLE): Весит всего ~75 ГБ и сохраняет до 80% от оригинальной точности.
Минимальное железо: Рабочая станция или Apple Mac с объединенной памятью от 96 ГБ RAM (или связка из VRAM + системной RAM).
Скорость: Из-за малого числа активных параметров (~6B), скорость генерации в квантованном виде достигает высоких показателей даже при запуске на CPU/Unified Memory.
🎯 Итог
Alibaba в очередной раз поднимает планку открытых нейросетей. Qwen3.8-Flash-Next объединяет локальную доступность, низкие требования к VRAM и передовые результаты в кодинге и логических рассуждениях. Выход этой модели дает отчетливое представление о том, какими возможностями будет обладать полноразмерный флагман Qwen4.