Black Forest Labs представила FLUX 3 — мультимодальную модель для картинок, видео и звука

· Искусственный интеллект
Немецкая Black Forest Labs открыла ранний доступ к FLUX 3 — единой модели, которая учится на изображениях, видео и аудио одновременно, чтобы строить представление о физическом мире.

cover.svg

Компания Black Forest Labs объявила о выходе FLUX 3 в режиме раннего доступа. В отличие от прежних версий, ориентированных на генерацию изображений, новинка позиционируется как мультимодальная базовая модель, которая в рамках единой архитектуры одновременно обучается на изображениях, видео и звуке.

Логика авторов такова: ни одна отдельная модальность не описывает реальность целиком. Картинка фиксирует пространственную структуру в конкретный момент, видео добавляет измерение времени и физику движения, а звук раскрывает причинно-следственные связи, недоступные зрению. Обучаясь на всём сразу, модель использует их взаимные ограничения: звук должен соответствовать удару, движение — подчиняться массе, будущее — следовать из прошлого. Так разрозненные сигналы превращаются в свидетельства об одной и той же реальности.

Что умеет FLUX 3

В основе лежит подход Self-Flow, который, по словам разработчиков, эффективнее классического flow matching и позволяет совмещать генерацию и понимание в одной архитектуре. Модель способна создавать видео с нативным звуком длиной до 20 секунд за одну генерацию — из текста, из стартового кадра, из референсного клипа или по ключевым кадрам. Заявлены многоязычные диалоги, широкий диапазон стилей — от любительской съёмки до анимации и кино — и возможность склеивать отдельные клипы в многосценовые последовательности с сохранением персонажей.

Отдельно упомянута работа с текстом внутри картинок и видео, а также генерация изображений в разных стилях, соотношениях сторон и разрешениях.

Осторожные цифры

Оценки компания честно называет предварительными: модель и обвязка вокруг неё ещё дорабатываются. В ранних сравнениях 10-секундных роликов в 720p FLUX 3 предпочитали Luma Ray 3.2 в 93% случаев, Runway Gen-4.5 — в 77%, Grok Imagine Video — в 69%, а Kling v3 Pro и ряду других конкурентов — в диапазоне 52–60%.

От картинок к роботам

Амбиции авторов выходят за пределы генерации контента. FLUX 3 умеет предсказывать действия: видеобэкбон используется как основа, из которой дообучаются специализированные модели управления. Одним из первых партнёров стала mimic robotics — совместно создан video-action-модель FLUX-mimic для ловких манипуляций, которую тестируют на производственных задачах у Audi. Тезис компании прост: физический ИИ и создание контента работают на общем фундаменте.

В ближайшие недели и месяцы Black Forest Labs обещает поэтапно открывать доступ к видео-, аудио- и графическим возможностям через API и приватные веса, а также выпустить открытую мультимодальную модель FLUX 3 Dev. Конечная цель — объединить восприятие, действие и язык в единой модели. Компания набирает сотрудников в Германии и США.


Источник: Hacker News

Комментарии

Войдите, чтобы комментировать.

  • Пока нет комментариев.