Midjourney и другие нейросети - страница 1170
Вы упускаете торговые возможности:
- Бесплатные приложения для трейдинга
- 8 000+ сигналов для копирования
- Экономические новости для анализа финансовых рынков
Регистрация
Вход
Вы принимаете политику сайта и условия использования
Если у вас нет учетной записи, зарегистрируйтесь
Места за столом нет для третьего.
OpenAI представляет Prism: бесплатный AI-воркспейс для учёных
//текст Grok 4.1
//думаю, сам сервис - это IDE для текста. Идеально для любого сложного и точного копирайтинга, включая, рефераты и дипломы.
27 января 2026 года компания OpenAI анонсировала Prism — новый бесплатный инструмент, предназначенный специально для научного сообщества. Это облачный LaTeX-редактор с глубокой интеграцией ИИ, который позиционируется как рабочее пространство для написания, редактирования и совместной работы над научными публикациями.
Для чего нужен Prism?
Prism решает одну из самых трудоёмких задач в академической среде — написание научных статей. Инструмент построен на базе GPT-5.2, новой модели OpenAI, которая считается самой сильной на данный момент в математике, физике и других точных науках.
Ключевые возможности:
По сути, Prism — это попытка OpenAI сделать для научных публикаций то же, что инструменты вроде Claude Code сделали для программирования: перенести рутинные задачи на ИИ и ускорить творческий процесс.
Что говорят о Prism?
Анонс вызвал живой интерес в научном и технологическом сообществе.
В целом реакция положительная: учёные видят в Prism потенциал для ускорения публикаций и снижения рутины, хотя подчёркивают, что ИИ пока не заменяет оригинальное мышление.
Prism уже доступен по адресу openai.com/prism. Если вы занимаетесь научной работой — стоит попробовать прямо сейчас. Это один из самых целенаправленных продуктов OpenAI за последнее время, ориентированный именно на профессиональных исследователей.
HunyuanImage 3.0: Tencent открывает эру промышленного мультимодального генератива
//текст Qwen3 Max. Обложка создана hunyuan-image-3.0
28 января 2026 года команда Tencent официально открыла исходный код версии HunyuanImage 3.0-Instruct — продвинутой модели для генерации изображений на основе изображений (image-to-image).
Это событие стало логичным продолжением революционного релиза сентябрьской версии 2025 года и укрепило позиции китайского гиганта в глобальной гонке мультимодальных ИИ.
Что делает HunyuanImage 3.0 уникальным?
В отличие от традиционных генеративных моделей, основанных на диффузионных архитектурах, HunyuanImage 3.0 построен на нативной мультимодальной автогрессивной архитектуре, объединяющей понимание и генерацию в едином фреймворке.
Ключевые особенности:
Новое поколение: версия Instruct (январь 2026)
В рейтинге LMArena по задачам редактирования изображений модель заняла 7-е место в глобальном топе, став единственной открытой моделью в первой семёрке.
Доступность для разработчиков
Почему это важно?
HunyuanImage 3.0 знаменует переход от «черного ящика» к промышленно применимым мультимодальным системам. Возможность свободно использовать, модифицировать и внедрять модель в коммерческие продукты (при соблюдении лицензии) открывает новые горизонты для стартапов, креативных агентств и исследовательских лабораторий.
А что за Темнинактоп?
Запромтил аугментацию (генерацию искуственного графика цены, сохраняющий свойства оригинального графика символа) со своей логикой с преподвыподвертом для следующих чатботов: QWEN, Дип, Z, Гемини ПРО, ЧатГПТ бесплатный с "Думать", Грок "Эксперт" и Клод Соннет с "Думать".
В промте указал на критический разбор идеи. Короче, всем чатботам один и тот же промт.
В результате все чатботы указали не некритические и скорее теоретические нюансы самой идеи по существу (короче, сгенерировали свои "предположения").
И только QWEN нашёл одну единственную критическую уязвимость, которая вынесла идею нафиг и утопила.
То есть, со всеми остальными чатботами я бы продолжил развивать идею и тратить время на эксперименты. И только Квен указал на важную тонкость.
Красавчик.
В ней показали, что качество LLM предсказуемо растёт по степенному закону, если синхронно масштабировать три вещи: размер модели, объём данных и вычисления.
Причём эффект держался на диапазоне в несколько порядков — это и назвали compute-efficient frontier.
Казалось бы, из этого можно сделать простой вывод: «достаточно больше данных и GPU и всё продолжит улучшаться». Формально – да. Практически – нет. Данные конечны, стоимость обучения растёт быстрее ценности, а выигрыш от очередного масштабирования всё чаще выражается в процентах, а не в решении задач нового уровня.
Суцкевер (cооснователь OpenAI) в своём недавнем интервью (https://www.youtube.com/watch?v=aR20FWCCjAs) тоже про это упоминал. Хорошее, посмотрите кто не видел.
@ai_for_devs
Step3-VL-10B: Компактный "убийца" гигантов от StepFun
//Gemini 3 PRO
В мире открытых мультимодальных моделей (LMM) пополнение — компания StepFun выпустила Step3-VL-10B. Эта модель с 10 миллиардами параметров не просто показывает отличные результаты для своего веса, но и в ряде задач обходит конкурентов, которые крупнее её в 10–20 раз.
Что это такое?
Step3-VL-10B — это мультимодальная модель, построенная на архитектуре декодера Qwen3-8B и использующая продвинутый визуальный энкодер. Главная фишка модели — инновационный метод PaCoRe (Parallel Coordinated Reasoning), который позволяет ей эффективно "рассуждать" над сложными визуальными задачами.
Основные достижения и Бенчмарки
Судя по техническому отчету, Step3-VL-10B устанавливает новые стандарты в классе моделей до 10B параметров и конкурирует с такими монстрами, как Qwen3-VL (235B) и Gemini 2.5 Pro.
Вот некоторые впечатляющие цифры (в режиме PaCoRe):
AIME 2025: 94.43% — невероятный результат в сложном математическом резонинге (для сравнения, у многих крупных моделей этот показатель ниже 85%).
MMBench (EN): 92.2% — топовый уровень общего мультимодального понимания.
MMMU: 80.11% — сложнейший бенчмарк на экспертные знания, где модель показывает SOTA-уровень для своего размера.
OCRBench: 89.00% — отличное распознавание текста.
Почему она крутая?
Эффективность: Модель обучалась на 1.2 триллионах токенов мультимодальных данных и прошла через масштабный этап RL (Reinforcement Learning) с более чем 1400 итерациями.
Технология PaCoRe: Это механизм параллельного координированного рассуждения. Грубо говоря, модель умеет разбивать сложную визуальную задачу на подзадачи и решать их параллельно, собирая доказательства перед выдачей ответа. Это дает огромный буст в STEM-задачах (наука, технологии, инженерия, математика).
Доступность: Несмотря на мощность, модель остается достаточно легкой для запуска на потребительском железе (в отличие от моделей на 100B+ параметров), что делает её идеальной для локального использования и исследований.
Итог
Step3-VL-10B доказывает, что размер — не главное. Благодаря умной архитектуре и качественному пост-тренингу, компактная модель может решать задачи уровня флагманов. Если вы ищете мощный инструмент для анализа изображений, решения визуальных математических задач или OCR, который можно запустить локально — это один из лучших вариантов на сегодня.
🔗 Где найти:
-
https://stepfun.aiHugging Face: stepfun-ai/step3-vl-10b
xAI открыла API для генерации видео в Grok: главное и сравнение с конкурентами
//текст и обложка Gemini 3 PRO
Компания Илона Маска xAI выпустила крупное обновление — Grok Imagine API. Теперь разработчики получили доступ к инструментам для генерации и редактирования не только изображений, но и видео.
Вот краткое саммари для вашего сайта.
Что случилось?
28 января 2026 года xAI открыла публичный доступ к API своих моделей визуализации. Ключевое нововведение — полноценная поддержка видеогенерации ( Video Generations and Edits ).
Основные возможности API:
Text-to-Video & Image-to-Video: Создание роликов по текстовому описанию или оживление статических картинок.
Редактирование видео: Возможность изменять элементы внутри видеоролика через промпты.
Скорость и стоимость: xAI позиционирует модель как SOTA (State of the Art) по соотношению качества, цены и задержки (latency).
Цена: По данным профильных источников, стоимость генерации составляет около $0.05 за секунду видео.
Сравнение с конкурентами
На рынке AI-видео сейчас жесткая конкуренция. Вот как Grok Imagine API смотрится на фоне основных игроков (Sora, Kling, Runway, Luma):
Почему это важно?
Запуск Grok Imagine API — это удар по монополии специализированных видео-нейросетей. Если раньше для генерации видео разработчикам приходилось использовать дорогие решения от Runway или закрытые беты OpenAI, то теперь Маск предлагает быстрое и (относительно) дешевое решение, которое можно встроить в любое приложение.
Особенный интерес вызывает возможность редактирования видео через API — функция, которая до сих пор работает нестабильно у многих конкурентов.
Источники: Документация xAI, релиз от 28.01.2026. https://x.ai/news/grok-imagine-api
https://arena.ai/ru/leaderboard
https://artificialanalysis.ai/video/leaderboard/text-to-video
Знаменитая генерация от Шедеврум оживлена Grok-Imagine без промпта
Google Genie 3. Интерактивное создание мира и его исследование. Доступно с подпиской Ultra
https://labs.google/projectgenie/