Назад в ленту

Black Forest Labs запускает Flux 3: видео, аудио и робототехника в одной модели

Мультимодальная модель от BFL генерирует 20-секундные ролики со звуком и учит роботов новым задачам за минуты

Black Forest Labs (BFL) снова врывается на сцену — на этот раз с FLUX 3, мультимодальной моделью, которая умеет генерировать изображения, 20-секундные видео со звуком и даже предсказывать действия для роботов. И всё это — на единой архитектуре, без сборки из отдельных кусков. Компания из Фрайбурга явно нацелилась перевернуть представление о визуальном интеллекте: от креативных инструментов до физического ИИ. Но как всегда есть нюансы: цены, веса и бенчмарки пока держат в секрете.

FLUX 3: Новая мультимодальная модель от Black Forest Labs

Немецкая AI-лаборатория Black Forest Labs (BFL) наконец-то выкатила то, чего от неё ждали: анонс Flux 3. И это не просто очередной генератор картинок. Ребята, подарившие миру Stable Diffusion и любимые всеми открытые веса, замахнулись на нечто куда более амбициозное. Теперь их модель не только рисует, но и снимает видео до 20 секунд со звуком, а заодно пытается научиться предсказывать действия для роботов. Всё в одном флаконе.

Главная фишка FLUX 3, которую BFL продавливают с особым цинизмом, — это не сборка из отдельных модулей, а единая архитектура, обученная одновременно на видео, изображениях и аудио. Компания уверяет, что это позволяет модели воспринимать мир как единое целое, а не как набор разрозненных файлов. «Мы ставим зрение в центр подхода, потому что это самый насыщенный сигналом носитель физического мира», — пафосно заявляет CEO Робин Ромбах. И с ним, чёрт возьми, трудно спорить, когда смотришь на результаты. Мир не состоит из стоп-кадров, и BFL решили, что их ИИ должен это осознавать на уровне архитектуры.

Четыре ипостаси одной модели

BFL не стали мелочиться и сразу режут FLUX 3 на четыре продуктовые линейки. Для творческих людей есть FLUX 3 Video и FLUX 3 Image. Для тех, кто хочет управлять железками — FLUX 3 Action. А для гиков и энтерпрайза, которые любят копаться в коде, обещают FLUX 3 Dev с открытыми весами. Правда, не сейчас, а к концу года — но об этом чуть позже.

Самое сочное, конечно, лежит в видеогенерации. FLUX 3 Video умеет создавать клипы сразу с нативным аудио — синхронизированным, осмысленным, а не просто случайным шумом. Модель поддерживает кучу стилей и соотношений сторон: от любительской съёмки на камеру до кинематографичных рапидов. Но главная фишка, от которой у продакшн-студий должны зачесаться руки, — это агентное объединение клипов. Вы можете склеивать отдельные 20-секундные куски в сцены длительностью в несколько минут, и визуальные референсы будут удерживать персонажа единым на протяжении всего ролика. Это именно то, чего не хватало AI-видео, чтобы перестать быть просто красивыми гифками.

Однако не всё так радужно, как хотелось бы. BFL пока хранят молчание по целому ряду критических для бизнеса вопросов. Цены на использование модели не объявлены. Соглашения об уровне обслуживания (SLA) — в тумане. Методология оценки и веса модели? Нет, не слышали. Ранний доступ к FLUX 3 Video и FLUX 3 Action открыт по заявкам, но компания оставляет за собой право отфутболить любого желающего. То есть купить билет на этот поезд пока нельзя — можно только попроситься в пассажиры и надеяться, что тебя посадят. В общем, стандартная история для «революционных» релизов: сначала шумная презентация, потом долгие месяцы ожидания, пока маркетинг не превратится в реальный продукт с понятным ценником.

Сравнение с конкурентами: предварительные результаты и позиционирование

Аналитики BFL не постеснялись выкатить на публику предварительные результаты прямых сравнений — и цифры выглядят внушительно. В тестах на 10-секундных текстовых промптах с аудио (720p) пользователи отдавали предпочтение FLUX 3 перед Luma Ray 3.2 в 93% случаев, перед Runway Gen-4.5 — в 77%, Grok Imagine Video — в 69%, а Kling v3 Pro — в 60%. Звучит как сенсация, да? Но не спешите делать выводы. Вся эта статистика — предварительная оценка раннего чекпоинта модели, а не финальной версии, которая сейчас попадает в руки тестеров. Сами BFL честно маркируют график как «preliminary evaluation of an early FLUX 3 candidate». То есть релизная сборка может оказаться как лучше, так и… ну, вы поняли. Для enterprise-клиентов это означает одно: нельзя списывать бюджет на основе этих цифр. Куда интереснее позиция FLUX 3 в ничейном матче с Seedance 2.0 и Google Gemini Omni Flash — 52% у обоих. По сути, подбрасывание монетки с поправкой на статистическую погрешность. И вот тут начинается самое забавное. Seedance 2.0 от ByteDance практически недоступен на Западе — Netflix, Disney, Warner Bros. и другие гиганты придушили его юридическими угрозами за систематическое нарушение авторских прав, и международный релиз заморожен на неопределённый срок. Так что 52% против «замороженного» продукта — это и не победа, и не поражение. Просто фиксация статус-кво. Настоящий вызов — Google Gemini Omni Flash. Это максимально близкий по задумке аналог: мультимодальный ввод, генерация видео и аудио, диалоговое редактирование. И по качеству 10-секундного текстового видео обе модели, по собственным замерам BFL, неразличимы. Но тут Google играет на опережение: Omni уже общедоступен через Gemini API по цене $0,10 за секунду 720p видео — 10-секундный клип выходит около доллара. Есть и ложка дёгтя: в ЕС, Швейцарии и Великобритании редактирование загруженного видео на Omni Flash недоступно. Для немецкой команды BFL это, пожалуй, локальное преимущество. И всё же ключевой момент — аргументация BFL. Они постоянно твердят, что «мир — это не стоп-кадры», и физическое понимание необходимо для убедительной генерации. «You can't cheat reality» — говорит CEO Робин Ромбах. Звучит красиво, но где бенчмарки, измеряющие это самое «физическое понимание»? Их нет. Ни у BFL, ни у конкурентов. Нет стандартного теста, который проверяет, ведёт ли сгенерированная вода как вода или падает ли предмет с правдоподобным ускорением. Так что пока все разговоры о «world model» остаются на уровне красивых пресс-релизов. Рейтинги человеческого предпочтения косвенно что-то показывают, но это не та метрика, на которую можно полагаться при покупке enterprise-решения.

От FLUX-mimic до открытых весов: робототехника и планы на будущее

Совместно с Mimic Robotics Black Forest Labs разработала FLUX-mimic — модель видео-действия, построенную на базе FLUX 3. Она позволяет роботам учиться новым задачам, используя всего 30 минут данных вместо привычных 30 часов. Элвис Нава, CTO Mimic Robotics, объясняет: «Самая сложная часть робототехники — данные. Каждая новая задача обычно требует часов повторений. FLUX-mimic, опираясь на уже обученные фронтальные видеомодели, сокращает время обучения с дней до минут. Это настоящий скачок в обучении роботов».

Важная новость для разработчиков: BFL обещает выпустить FLUX 3 Dev с открытыми весами позднее в этом году. Предыдущие версии — FLUX.1 Dev и FLUX.2 Dev — стали индустриальным стандартом благодаря локальному развертыванию. Однако FLUX 3 Dev пойдёт дальше: это будет не просто модель для изображений, а полноценный мультимодальный бэкбон, охватывающий видео, аудио и предсказание действий. Такое решение открывает путь для конфиденциальных приложений, включая управление роботами, где безопасность и низкая задержка критичны.

FLUX 3 — мультимодальная модель от Black Forest Labs, которая генерирует изображения, видео до 20 секунд со встроенным аудио, а также предсказывает действия для роботов. В отличие от сборных решений, она обучается на всех модальностях одновременно.

Исправленный текст завершён и закрыт.