Midjourney и другие нейросети - страница 1237

 

Qwen3.8-Flash-Next: Alibaba анонсировала первый взгляд на архитектуру нового поколения Qwen4


//текст и обложка Gemini 3.6 Flash. https://qwen.ai/blog?id=qwen3.8-flash-next

Команда Qwen (Alibaba) официально представила модель Qwen3.8-Flash-Next — мультимодальную нейросеть с открытыми весами, которая стала не просто очередным обновлением линейки, а официальным технологическим превью архитектуры следующего поколения Qwen4.

Модель сочетает гибридные слои размышления, ультра-разреженную архитектуру MoE (Mixture-of-Experts) и уникальный механизм работы с памятью, позволяющий запускать 125-миллиардную модель на стандартном железе с объединенной памятью.

🛠 Архитектурные особенности: Мост к Qwen4

Несмотря на индекс 3.8 в названии, разработчики Alibaba прямо называют Qwen3.8-Flash-Next тизером архитектуры Qwen4.

Главные инженерные решения модели:

  • Ультра-разреженный MoE (Ultra-sparse MoE): Из общих ~125 млрд параметров при генерации каждого токена активируется всего около 6 млрд активных параметров. Это снизило стоимость вычислений почти в 9 раз по сравнению с Qwen3.7-Plus.

  • Таблицы эмбеддингов N-gram (Per-Layer Embeddings / PLE): В модель встроена дополнительная таблица N-gram на 51 млрд параметров. Она берет на себя рутинный контекстный поиск и снижает нагрузку на вычислительные блоки.

  • Слои GDN и QSA: Использование гибридных слоев Gated Delta Network (GDN) и разреженного внимания Qwen Sparse Attention (QSA) существенно ускоряет работу с длинными последовательностями.

  • Гибкое контекстное окно: В открытых весах для локального инференса поддерживается до 262 144 токенов, а в облачном API (QwenCloud) контекст нативно расширяется до 1 000 000 токенов без потери качества.

  • Управление мышлением (Hybrid Thinking): Модель поддерживает точечную настройку глубины рассуждений через параметр reasoning_effort (xhigh, medium, low, none), а также функцию Preserve Thinking, сохраняющую цепочки рассуждений из предыдущих шагов диалога.

📊 Бенчмарки и сравнение с конкурентами

В категории «быстрых» флагманов (Flash-сегмент) сложилась плотная конкуренция. Qwen3.8-Flash-Next соревнуется с актуальными моделями от Zhipu AI и DeepSeek.

Сравнительная таблица производительности:

Бенчмарк / Сфера Qwen 3.8-Flash-Next GLM 5.3 Flash DeepSeek V4 Flash Vision
LiveCodeBench v6 (алгоритмический кодинг) 91.9% 88.5% 87.8%
NL2Repo (кодинг в масштабе репозитория) 48.1% 54.0% 57.7%
Terminal Bench 2.1 (работа с CLI и ОС) 76.2% 80.5% 83.9%
AndroidWorld (управление мобильным UI) 84.5% 79.1% 81.0%
GPQA Diamond (научная логика и рассуждения) 91.7% 89.2% 88.0%
Chartography (чтение графиков и схем) 59.8% 61.2% 64.3%
UI-to-Code (верстка по скриншотам и макетам) 71.5% 93.8% 78.0%

Основные акценты:

  • Qwen 3.8 Next доминирует в изолированном алгоритмическом кодинге (91.9%), фундаментальной логике (GPQA 91.7%) и управлении мобильными интерфейсами (AndroidWorld 84.5%).

  • GLM 5.3 Flash удерживает лидерство в задачах UI-to-Code и фронтенд-агентства, генерируя готовую верстку по картинкам макетов.

  • DeepSeek V4 Flash Vision выигрывает в понимании структуры крупных репозиториев (NL2Repo) и работе с консольными командами.


💻 Локальный запуск и требования к железу

Одной из главных новостей релиза стала поддержка Day-Zero со стороны опенсорс-сообщества (Unsloth, llama.cpp и vLLM).

Благодаря архитектуре N-gram / PLE, тяжелые слои эмбеддингов можно выгружать в обычную оперативную память (RAM) или даже на быстрый NVMe SSD через mmap, не забивая VRAM видеокарты.

Системные требования:

  • Квантование Dynamic GGUF (1-bit / 4-bit PLE): Весит всего ~75 ГБ и сохраняет до 80% от оригинальной точности.

  • Минимальное железо: Рабочая станция или Apple Mac с объединенной памятью от 96 ГБ RAM (или связка из VRAM + системной RAM).

  • Скорость: Из-за малого числа активных параметров (~6B), скорость генерации в квантованном виде достигает высоких показателей даже при запуске на CPU/Unified Memory.

🎯 Итог

Alibaba в очередной раз поднимает планку открытых нейросетей. Qwen3.8-Flash-Next объединяет локальную доступность, низкие требования к VRAM и передовые результаты в кодинге и логических рассуждениях. Выход этой модели дает отчетливое представление о том, какими возможностями будет обладать полноразмерный флагман Qwen4.