The Ultimate Guide to FLUX 3
TL;DR · AI 摘要
FLUX 3 是 Black Forest Labs 推出的多模态基础模型,通过整合图像、音频和视频学习提升生成质量,适合工程师关注其跨模态技术细节。
核心要点
- FLUX 3 的整合架构使多模态生成更符合物理规律
- 文本到视频生成支持简洁提示词(如'沙漠越野车冲沙')
- 跨模态学习使音频与运动参数产生强关联
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- FLUX 3 技术解析
- 核心机制
- 整合架构学习多模态数据
- 物理规律嵌入模型
- 应用场景
- 文本到视频生成
- 跨模态内容创作
- 技术优势
- 支持简洁提示词
- 增强现实物理模拟
金句 / Highlights
值得收藏与分享的关键句。
“Learn from all of them at once and their mutual constraints tell you more...”
沙漠越野车示例显示 FLUX 3 可处理复杂物理交互
无需密集提示词即可生成 8K 超清视频
跨模态学习使音频与运动参数产生强关联
FLUX 3终极指南 – Replicate博客
- 博客
FLUX 3终极指南
发布日期
2026年8月4日
作者
- shridharathi
在Replicate上体验FLUX 3
运行FLUX 3
当Black Forest Labs发布FLUX.1图像模型时,他们创造了历史。作为首批独立研究实验室之一,他们率先实现了快速、高质量、开源的图像生成。现在,他们正将研究方向转向视频领域,这一动向令人着迷。
FLUX 3是该实验室最新推出的多模态基础模型。与其它实验室相比,他们采用了全新方法。BFL开发了具有整合架构的模型,通过学习图像、音频和视频生成多模态输出。直接引用他们发布的博客原文:
“图像捕捉特定时间点的空间结构和关系。视频则恢复了时间维度,揭示了时间动态和物理规律。音频揭示了机械现象与声学之间的因果关系,这是视觉无法检测到的。语言将这些感知与目标、抽象概念和指令联系起来。学习单一模态可以获得该投影的良好模型。同时学习所有模态时,它们的相互约束能提供更多信息:声音必须匹配冲击,运动必须遵循质量守恒,未来必须源于过去。模态不再相互分离,而是成为关于同一现实的证据。”
这种训练方法似乎意味着该模型内置了更多物理定律。音频与运动相互影响,视频为已编码空间关系的图像引入时间维度。FLUX 3试图构建一个更贴近现实的权重网络。
本文将通过实际案例,展示FLUX 3最擅长的几个方面。
文字生成视频
FLUX 3对输入要求并不苛刻。无论是简单句子还是内容密集的描述,它都能良好应对。这包括那些需要真正理解事物运作原理(而不仅仅是外观)的场景。
一辆越野赛车在沙漠中全速穿越开阔沙丘,扬起巨大的沙尘尾迹,悬挂系统在越过山脊短暂腾空时吸收跳跃冲击。摄像机以高速贴近地面平行跟踪。超现实主义风格,8K画质,正午强烈沙漠光照,引擎轰鸣与轮胎碾过沙砾的声响。
一部史诗级水下野生动物纪录片,一只大型章鱼缓慢爬行在黑暗的岩石海床上。低角度近距离跟踪拍摄,展现其纹理丰富的外套膜、富有表现力的眼睛以及八条触手在湿润岩石上的独立运动。触手吸盘自然附着和脱离,带动身体前进;细微的皮肤波动和逼真的肌肉运动。深邃的蓝绿色海水,漂浮的微粒,柔和的光束穿透水面,章鱼呈现沉稳的锈红色与棕色,皮肤纹理高度精细,浅景深,自然纪录片风格的摄影。
我喜欢FLUX 3并不强制要求提示词必须密集或堆砌关键词。有时可以将运动细节和美学表现交给模型处理,最终结果往往令人满意。
一位年轻人凝视着瑞士乡村火车窗外飞驰而过的雪山,手持摄像机拍摄的电影画面。
一名潜水员穿过清澈的 turquoise 色水体,进入丛林 cenote 水下洞穴,阳光从上方的洞口穿透而下。水下,一座沉没的玛雅神庙墙壁逐渐显现,石壁上刻着古老的象形文字,倒塌的石柱散落在地面。鱼群在废墟间穿梭,潜水员的探照灯光扫过雕刻。超现实、8K 分辨率、国家地理风格的水下摄影,模糊的气泡声和潜水员平稳的呼吸声。
你会注意到 FLUX 3 默认会生成多个场景片段,除非另有说明。
夜晚,一辆摩托车在雨水浸透的地下停车场高速追逐。骑手在急转弯处用力倾斜车身,车灯在混凝土立柱间闪烁,轮胎在湿滑路面尖叫摩擦。摩托车撞到支撑梁后火花四溅,随即自行恢复平衡。镜头在低角度追逐视角和车把第一视角之间切换。超现实、8K 分辨率、霓虹灯照亮的水洼反射车灯,引擎轰鸣声和回响的轮胎声。
一名徒步者穿行于茂密的哥斯达黎加雨林树冠层,金色光束穿透层层绿叶。一只金刚鹦鹉从头顶飞过,一只树懒静止地挂在上方枝头,森林地面升起薄雾。镜头以稳定的步行速度从后方跟随,随后升至广阔的树冠全景。超现实、8K 分辨率、丰富的生物多样性,远处传来吼猴的叫声,脚下树叶随风沙沙作响。
图像到视频
FLUX 3 可以通过指定起始帧和结束帧来引导转换过程。一个有用的测试是保持相同的车辆和场景,同时将其状态从废弃变为可行驶。
起始帧和结束帧。提供两张图片并描述你希望看到的物理变化。
起始
结束
同一辆生锈的废车在自然状态下逐渐转变为修复后的红色汽车的单镜头连续画面。始终保持完全相同的车辆身份、摄像机角度、轴距、车身形状和背景。锈迹逐渐溶解成干净的红色车漆,凹痕缓慢恢复平整,裂开的挡风玻璃变得清晰,缺失的装饰条重新出现,瘪胎充气膨胀,杂草从轮胎周围退去。金属面板通过连续的物理运动重新成型。汽车随后启动,驶上高速公路。无剪辑、无瞬移、无突然跳跃、无车辆身份变化、真实的机械转换过程,纪录片风格摄像机,自然光线。
视频延续
start_video 输入是一个新参数。你给 FLUX 3 一个现有片段,它会从最后一帧继续播放。它能保持相同的动量、构图逻辑和音频。效果令人惊讶地流畅。
基础片段:
一名滑板者沿阳光照射的街道滑行,接近滑板公园尽头的四分之一管状坡道,加速前进,车轮在路面裂缝上发出咔哒声。
延续片段:
滑板者从坡道起跳,腾空而起,空中抓板,随后干净落地并向远处滑行,车轮重重落在坡道过渡区域。
相同概念,不同运动项目:
一名冲浪者在日出时分划桨穿越翻涌的海浪,海浪飞溅在晨光中,稳定地向地平线划去。
冲浪者转身,用力划桨抓住涌起的海浪,起身站立,顺着浪峰滑行,浪花在身后翻卷。
你可以直接在单个提示中编写带时间戳的镜头。FLUX 3会在一次生成过程中自动切换不同镜头,无需进行拼接。
复制
astro:end
[0-4s]: 广角全景镜头,固定机位,场景描述
[4-9s]: 硬切至特写镜头,动作的下一个节奏
[9-14s]: 硬切至广角镜头,最终节奏[0-4s]: 满座体育场人群的广角镜头,人群欢呼,探照灯在夜空中闪耀。[4-8s]: 切至短跑运动员双脚从起跑器上爆发的特写镜头,扬起尘土。[8-12s]: 跟随短跑运动员冲过终点线的跟踪镜头,身体前倾,人群欢呼。超写实风格,8K画质,奥运会转播电影摄影风格,震耳欲聋的欢呼声和沉重的脚步声。
适用于所有风格
FLUX 3不会像许多视频模型那样默认使用相同的超写实电影风格。如果你要求,它也可以完全采用风格化表现。
定格动画黏土动画风格。一个带有可见指纹纹理和拇指印眼睛的小黏土角色,穿过迷你黏土村庄,经过歪斜的黏土房屋,烟囱冒出棉花般的烟雾,每一步手工制作的移动都略微摇晃。迷人的定格动画美学,可见的接缝和工具痕迹,温暖的微缩场景灯光,柔和的音效脚步声。
细节表现非常到位。你看到角色上的指纹痕迹了吗?
一个角色在混合手绘和3D CGI风格的漫画风格城市景观中奔跑,建筑物上覆盖着半色调点状阴影,角色有粗体墨水轮廓,偶尔出现色差故障帧,将颜色通道短暂分离后迅速恢复,动态的荷兰角度摄像机运镜。《蜘蛛侠:平行宇宙》美学,漫画分镜能量,低音驱动的嘻哈节拍。
有趣的内容
很多人发现FLUX 3可以生成VHS录像效果。要实现这一点,需要描述录像本身:摄像机、糟糕的曝光、自动对焦、摇晃的构图,以及拍摄者似乎完全不知道即将捕捉到什么的感觉。
1997年原始家用摄像机拍摄的郊区街道夜间家庭录像。摄像师在一群青少年后面奔跑,最初对准路面,然后猛然抬头看向天空,当所有人停下并大喊时,一个巨大的圆盘状不明飞行物无声地从地平线一侧滑向另一侧,其灯光洒在停着的汽车和房屋窗户上。摄像机以一个连续不间断的镜头跟随整个飞行过程,直到不明飞行物消失在树后。廉价手持摄像机拍摄,柔和的焦距,自动对焦搜索,过曝的门廊灯光,模糊的高光,模拟跟踪噪点,隔行扫描VHS转录,模糊人声和脚步声,无剪辑,无配乐,无电影化处理。
1995年家庭露营旅行的原始家庭录像,夜晚在湖边拍摄。摄像机从篝火开始,缓慢平移至漆黑的湖面;第二个月亮从湖中升起,悬挂在远处岸边上方,其倒影向摄像机方向延伸。所有人都冲向湖边,摄像机剧烈晃动,手电筒照亮前景后熄灭,月亮重新隐入湖中消失。一个连续镜头拍摄于廉价Hi8摄像机,柔和焦距,自动对焦搜索,隔行扫描VHS转录,模拟噪点,模糊人声,曝光不均,无剪辑,无配乐,无电影化处理。
家庭录像很有趣,但来自fofr的这些示例同样引人入胜。它们真正考验了模型的想象力。
Zero-G版本 > 一段业余手持拍摄的极快速零重力运动画面,穿越零重力空间栖息地,房间接房间,永不停止,无数房间彼此截然不同且充满奇异感,持续移动,永不休止 https://t.co/0tg6r0Sxls pic.twitter.com/EettFRXu8m — fofr (@fofrAI) 2026年8月1日
运行 FLUX 3
以下是使用 FLUX 3 生成视频的方法:
import
Replicate
from
"replicate"
;
const
replicate
=
new
Replicate
();
const
output
=
await
replicate.
run
(
"black-forest-labs/flux-3"
,
{
input: {
prompt:
"一名潜水员穿过清澈的 turquoise 色水体下潜至丛林 cenote(井穴),阳光从上方开口处穿透而下。浸没的神庙墙壁上刻有古老文字,鱼群穿梭在倒塌的石柱间。超现实主义,8k."
,
duration:
"8"
,
resolution:
"720p"
,
aspect_ratio:
"16:9"
,
generate_audio:
true
,
// image: "https://...", // 视频生成的起始帧(图像到视频)
// end_image: "https://...", // 形变目标,需使用整数时长
// keyframe_images: ["https://...", "https://..."], // 最多10张,故事板模式
// start_video: "https://...", // 继续已有片段
}
}
);
console.
log
(output);在 Cloudflare AI Gateway 上运行
如果希望在最快的 AI 网关上运行 FLUX 3,请使用以下调用:
const
response
=
await
env.
AI
.
run
(
'black-forest-labs/flux-3'
,
{
prompt:
"一名潜水员穿过清澈的 cenote(井穴),阳光从上方开口处穿透而下,水面下是古老的神庙遗迹,鱼群穿梭在倒塌的石柱间。"
,
duration:
'8'
,
resolution:
'720p'
,
aspect_ratio:
'16:9'
,
generate_audio:
true
,
},
)
console.
log
(response)通过 AI 网关发送的请求可以使用日志记录、缓存、速率限制以及众多其他网关功能。FLUX 3 是第三方模型,因此 Cloudflare 会处理供应商凭证并通过统一计费系统进行费用结算。您不需要 Black Forest Labs 的 API 密钥。
提示与建议
- 描述音频内容,而不仅仅是画面。FLUX 3 会在生成视频的同时生成音频。告知模型声音特征,例如“撕裂金属的尖啸声”或“霓虹变压器的低频嗡鸣声”,会实际影响输出结果,而不仅仅是视觉效果。
- 对于包含多个节奏点的内容,请使用时间戳。[0-4s]: ... 风格的提示会为模型提供明确的剪辑节点,而不是依赖随机的节奏安排。
- 使时长与形变匹配。如果同时使用 image 和 end_image 参数,时长必须为整数,而非自动计算。
- 以摄像机运动而非主体描述为主导。例如“摄像机在挡泥板高度平行移动”或“硬切至低角度镜头”会为 FLUX 3 提供具体的执行依据。
- 不要过度规划图像到视频的转换。一个起始帧和一句关于后续内容的描述通常就足够。模型会自动补充物理合理性。
尝试 FLUX 3
下一步:
Krea 2 是您的美学生成模型