Midjourney и другие нейросети - страница 1170

 
Vitaly Muzichenko #:
Места за столом нет для третьего.
И пепельницы
 

OpenAI представляет Prism: бесплатный AI-воркспейс для учёных


//текст Grok 4.1

//думаю, сам сервис - это IDE для текста. Идеально для любого сложного и точного копирайтинга, включая, рефераты и дипломы.

27 января 2026 года компания OpenAI анонсировала Prism — новый бесплатный инструмент, предназначенный специально для научного сообщества. Это облачный LaTeX-редактор с глубокой интеграцией ИИ, который позиционируется как рабочее пространство для написания, редактирования и совместной работы над научными публикациями.

Для чего нужен Prism?

Prism решает одну из самых трудоёмких задач в академической среде — написание научных статей. Инструмент построен на базе GPT-5.2, новой модели OpenAI, которая считается самой сильной на данный момент в математике, физике и других точных науках.

Ключевые возможности:

  • Полноценный LaTeX-редактор с автодополнением и генерацией сложного кода.
  • Контекстный ИИ-ассистент, который понимает содержимое документа и помогает писать разделы, генерировать формулы, диаграммы и таблицы.
  • Автоматический поиск и вставка релевантных ссылок с контекстом.
  • Совместная работа в реальном времени (как в Google Docs, но с научным уклоном).
  • Бесплатный доступ для всех пользователей с аккаунтом ChatGPT.

По сути, Prism — это попытка OpenAI сделать для научных публикаций то же, что инструменты вроде Claude Code сделали для программирования: перенести рутинные задачи на ИИ и ускорить творческий процесс.

Что говорят о Prism?

Анонс вызвал живой интерес в научном и технологическом сообществе.

  • На Reddit и Hacker News пользователи отмечают, что инструмент особенно полезен для математиков и физиков: «Работать с символами и диаграммами — одно удовольствие».
  • Биомедицинские исследователи более сдержанны: инструмент пока лучше работает с точными науками, чем с биологией.
  • Многие сравнивают Prism с будущим научной работы: «Это шаг к тому, чтобы ИИ стал полноценным соавтором статей».
  • Появились первые демо-видео на YouTube, где показывают генерацию сложных LaTeX-документов за минуты.

В целом реакция положительная: учёные видят в Prism потенциал для ускорения публикаций и снижения рутины, хотя подчёркивают, что ИИ пока не заменяет оригинальное мышление.

Prism уже доступен по адресу openai.com/prism. Если вы занимаетесь научной работой — стоит попробовать прямо сейчас. Это один из самых целенаправленных продуктов OpenAI за последнее время, ориентированный именно на профессиональных исследователей.

 

HunyuanImage 3.0: Tencent открывает эру промышленного мультимодального генератива


//текст Qwen3 Max. Обложка создана hunyuan-image-3.0

28 января 2026 года команда Tencent официально открыла исходный код версии HunyuanImage 3.0-Instruct — продвинутой модели для генерации изображений на основе изображений (image-to-image).

Это событие стало логичным продолжением революционного релиза сентябрьской версии 2025 года и укрепило позиции китайского гиганта в глобальной гонке мультимодальных ИИ.

Что делает HunyuanImage 3.0 уникальным?

В отличие от традиционных генеративных моделей, основанных на диффузионных архитектурах, HunyuanImage 3.0 построен на нативной мультимодальной автогрессивной архитектуре, объединяющей понимание и генерацию в едином фреймворке.

Ключевые особенности:

  • 80 млрд параметров в конфигурации Mixture-of-Experts (64 эксперта) — крупнейшая открытая модель для генерации изображений
  • Интеллектуальное рассуждение на основе мировых знаний: модель не просто следует промпту, а понимает контекст, связи между объектами и семантику сцены
  • Точная прорисовка текста внутри изображений и превосходное следование сложным инструкциям

Новое поколение: версия Instruct (январь 2026)

Последнее обновление добавило критически важную функциональность:
  • Редактирование «одним предложением»: удаление/добавление объектов, смена стиля, реставрация старых фото, модификация персонажей и текста
  • Мульти-фьюжн: объединение элементов из нескольких изображений в единую гармоничную композицию
  • 8 млрд параметров в дистиллированной версии для эффективного развёртывания (рекомендуется 8 шагов семплирования)

В рейтинге LMArena по задачам редактирования изображений модель заняла 7-е место в глобальном топе, став единственной открытой моделью в первой семёрке.


Доступность для разработчиков

Модель полностью открыта:
  • Репозиторий на GitHub
  • Веса доступны на Hugging Face
  • Поддержка развёртывания через ComfyUI и другие инструменты

Почему это важно?

HunyuanImage 3.0 знаменует переход от «черного ящика» к промышленно применимым мультимодальным системам. Возможность свободно использовать, модифицировать и внедрять модель в коммерческие продукты (при соблюдении лицензии) открывает новые горизонты для стартапов, креативных агентств и исследовательских лабораторий.

Для сообщества это означает не просто ещё один генератор картинок, а инструмент с глубоким пониманием визуального мира — способный не только создавать, но и рассуждать, редактировать и трансформировать изображения на уровне, приближенном к человеческому восприятию.
 
Alexandr Saprykin #:
А что за Темнинактоп?
Чтобы не как у всех)
 
Хочу похвалить новый QWEN.

Запромтил аугментацию (генерацию искуственного графика цены, сохраняющий свойства оригинального графика символа) со своей логикой с преподвыподвертом для следующих чатботов: QWEN, Дип, Z, Гемини ПРО, ЧатГПТ бесплатный с "Думать", Грок "Эксперт" и Клод Соннет с "Думать". 

В промте указал на критический разбор идеи. Короче, всем чатботам один и тот же промт. 


В результате все чатботы указали не некритические и скорее теоретические нюансы самой идеи по существу (короче, сгенерировали свои "предположения"). 

И только QWEN нашёл одну единственную критическую уязвимость, которая вынесла идею нафиг и утопила. 
То есть, со всеми остальными чатботами я бы продолжил развивать идею и тратить время на эксперименты. И только Квен указал на важную тонкость. 

Красавчик.
 
В 2020 году, ещё до ChatGPT, OpenAI и Johns Hopkins опубликовали работу Scaling Laws for Neural Language Models (https://arxiv.org/pdf/2001.08361). 

В ней показали, что качество LLM предсказуемо растёт по степенному закону, если синхронно масштабировать три вещи: размер модели, объём данных и вычисления. 

Причём эффект держался на диапазоне в несколько порядков — это и назвали compute-efficient frontier.

Казалось бы, из этого можно сделать простой вывод: «достаточно больше данных и GPU и всё продолжит улучшаться». Формально – да. Практически – нет. Данные конечны, стоимость обучения растёт быстрее ценности, а выигрыш от очередного масштабирования всё чаще выражается в процентах, а не в решении задач нового уровня.

Суцкевер (cооснователь OpenAI) в своём недавнем интервью (https://www.youtube.com/watch?v=aR20FWCCjAs) тоже про это упоминал. Хорошее, посмотрите кто не видел.

@ai_for_devs
Ilya Sutskever – We're moving from the age of scaling to the age of research
Ilya Sutskever – We're moving from the age of scaling to the age of research
  • 2025.11.25
  • www.youtube.com
Ilya & I discuss SSI’s strategy, the problems with pre-training, how to improve the generalization of AI models, and how to ensure AGI goes well.𝐄𝐏𝐈𝐒𝐎𝐃...
 

Step3-VL-10B: Компактный "убийца" гигантов от StepFun


//Gemini 3 PRO

В мире открытых мультимодальных моделей (LMM) пополнение — компания StepFun выпустила Step3-VL-10B. Эта модель с 10 миллиардами параметров не просто показывает отличные результаты для своего веса, но и в ряде задач обходит конкурентов, которые крупнее её в 10–20 раз.

Что это такое?

Step3-VL-10B — это мультимодальная модель, построенная на архитектуре декодера Qwen3-8B и использующая продвинутый визуальный энкодер. Главная фишка модели — инновационный метод PaCoRe (Parallel Coordinated Reasoning), который позволяет ей эффективно "рассуждать" над сложными визуальными задачами.

Основные достижения и Бенчмарки

Судя по техническому отчету, Step3-VL-10B устанавливает новые стандарты в классе моделей до 10B параметров и конкурирует с такими монстрами, как Qwen3-VL (235B) и Gemini 2.5 Pro.

Вот некоторые впечатляющие цифры (в режиме PaCoRe):

  • AIME 2025: 94.43% — невероятный результат в сложном математическом резонинге (для сравнения, у многих крупных моделей этот показатель ниже 85%).

  • MMBench (EN): 92.2% — топовый уровень общего мультимодального понимания.

  • MMMU: 80.11% — сложнейший бенчмарк на экспертные знания, где модель показывает SOTA-уровень для своего размера.

  • OCRBench: 89.00% — отличное распознавание текста.

Почему она крутая?

  1. Эффективность: Модель обучалась на 1.2 триллионах токенов мультимодальных данных и прошла через масштабный этап RL (Reinforcement Learning) с более чем 1400 итерациями.

  2. Технология PaCoRe: Это механизм параллельного координированного рассуждения. Грубо говоря, модель умеет разбивать сложную визуальную задачу на подзадачи и решать их параллельно, собирая доказательства перед выдачей ответа. Это дает огромный буст в STEM-задачах (наука, технологии, инженерия, математика).

  3. Доступность: Несмотря на мощность, модель остается достаточно легкой для запуска на потребительском железе (в отличие от моделей на 100B+ параметров), что делает её идеальной для локального использования и исследований.

Итог

Step3-VL-10B доказывает, что размер — не главное. Благодаря умной архитектуре и качественному пост-тренингу, компактная модель может решать задачи уровня флагманов. Если вы ищете мощный инструмент для анализа изображений, решения визуальных математических задач или OCR, который можно запустить локально — это один из лучших вариантов на сегодня.

🔗 Где найти:

https://stepfun.ai
 

xAI открыла API для генерации видео в Grok: главное и сравнение с конкурентами


//текст и обложка Gemini 3 PRO

Компания Илона Маска xAI выпустила крупное обновление — Grok Imagine API. Теперь разработчики получили доступ к инструментам для генерации и редактирования не только изображений, но и видео.

Вот краткое саммари для вашего сайта.


Что случилось?

28 января 2026 года xAI открыла публичный доступ к API своих моделей визуализации. Ключевое нововведение — полноценная поддержка видеогенерации ( Video Generations and Edits ).

Основные возможности API:

  • Text-to-Video & Image-to-Video: Создание роликов по текстовому описанию или оживление статических картинок.

  • Редактирование видео: Возможность изменять элементы внутри видеоролика через промпты.

  • Скорость и стоимость: xAI позиционирует модель как SOTA (State of the Art) по соотношению качества, цены и задержки (latency).

  • Цена: По данным профильных источников, стоимость генерации составляет около $0.05 за секунду видео.

Сравнение с конкурентами

На рынке AI-видео сейчас жесткая конкуренция. Вот как Grok Imagine API смотрится на фоне основных игроков (Sora, Kling, Runway, Luma):

Характеристика Grok Imagine API (xAI) Sora / OpenAI (v2) Kling / Hailuo (Китайские модели) Runway Gen-3 Alpha / Luma
Доступность Открытый API для всех разработчиков с 28.01.2026. Доступ часто ограничен или развертывается поэтапно (Enterprise). Доступны, но часто имеют ограничения по регионам или оплате. Широко доступны, но дорогие тарифы для Pro-качества.
Цензура Менее строгая. Grok известен своим «свободным» подходом (наличие "Spicy mode" в приложении), что может перекочевать в API. Очень строгая цензура и фильтры безопасности (Safety filters). Умеренная, но подчиняется китайским регуляциям. Стандартные корпоративные фильтры.
Скорость Высокая. Акцент на низкую задержку (Low Latency), подходит для быстрых итераций. Медленнее из-за тяжелой архитектуры и фокуса на кинематографичность. Средняя. Зависит от тарифа, но "Turbo" режимы быстрые.
Экосистема Глубокая интеграция с X (Twitter). Идеально для ботов и контента внутри соцсети. Интеграция с ChatGPT и продуктами Microsoft. Автономные платформы. Инструменты для профессиональных видеомейкеров (монтаж, кисти).

Почему это важно?

Запуск Grok Imagine API — это удар по монополии специализированных видео-нейросетей. Если раньше для генерации видео разработчикам приходилось использовать дорогие решения от Runway или закрытые беты OpenAI, то теперь Маск предлагает быстрое и (относительно) дешевое решение, которое можно встроить в любое приложение.

Особенный интерес вызывает возможность редактирования видео через API — функция, которая до сих пор работает нестабильно у многих конкурентов.


Источники: Документация xAI, релиз от 28.01.2026. https://x.ai/news/grok-imagine-api


https://arena.ai/ru/leaderboard

https://artificialanalysis.ai/video/leaderboard/text-to-video


 

Знаменитая генерация от Шедеврум оживлена Grok-Imagine без промпта

 

Google Genie 3. Интерактивное создание мира и его исследование. Доступно с подпиской Ultra

https://labs.google/projectgenie/