取消
搜索历史

    黑森林实验室FLUX3 多模态模型登场:单次生成 20 秒音视频,胜率碾压Grok与Seedance

    来源:电子芯片网 2026-08-13 18:41人工智能

    Black Forest Labs宣布以Early Access方式上线推出FLUX3 多模态基础模型,采用统一架构联合学习图像、视频和音频。该模型基于Self-Flow(自监督流匹配)学习框架扩展,同步训练视频、图像和音频,在FLUX. 1 和FLUX. 2 系列基础上进一步扩展至多模态生成与理解任务。

    性能全面碾压,原生音频同步输出

    FLUX3 可在单次生成中输出最长 20 秒的视频并附带原生音频,支持文生视频、图生视频、视频生视频、输入视频与音频续写、关键帧转视频、多语言对话以及多镜头串联等多种创作模式。在带声音的 10 秒720p视频人工评测中,FLUX3 对比Grok Imagine Video胜率达69%,对比Seedance 2. 0 和Gemini Omni Flash胜率均为52%,展现出全面领先优势。

    图像能力全面,进军机器人行为预测

    在图像能力方面,官方称FLUX3 可完成图像生成与编辑,覆盖多种风格、宽高比和分辨率。更值得关注的是,Black Forest Labs正与Mimic Robotics合作,研究将FLUX3 用作机器人行为预测模型,将多模态AI能力从内容生成延伸到实体机器人领域。这一布局意味着FLUX3 不仅是一个创作工具,更有望成为连接数字世界与物理世界的通用多模态引擎。

    (文章为作者独立观点,不代表半导体新闻网立场,版权疑问请联系客服。)
    关于我们| 隐私条例| 版权申明| 联系我们

    2018-2022 Copyright© SemiNews.com.cn