产品发布 · 小互解读

Lightricks 开源视频模型 LTX-2.5:音画一起生成,10 秒片段 6.8 秒

220 亿参数,权重当天上 Hugging Face,ComfyUI 第一天支持,但「开源」有一条年营收 1000 万美元的线。
一分钟速览
  • Lightricks 发布并开源了视频生成模型 LTX-2.5,生成一段 10 秒视频官方测出 6.8 秒,同榜的 Veo 3.1 是 70 秒。
  • 它和多数视频模型的根本区别:画面和声音在同一个模型里一起生成,不用另配。
  • 但「开源」这两个字有条件,下载前还有一道你可能没注意的门槛。
速度榜和画质榜都是 LTX 官方自评,本文把它们的测试口径一并写出来了。架构部分来自上一代 LTX-2 的论文(arXiv 2601.03233),参数量与组件构成来自 Hugging Face 上的实际权重文件,均非 2.5 的官方技术报告。
发布

Lightricks 开源了 LTX-2.5,权重当天就能下

以色列公司 Lightricks 旗下的 LTX 团队昨天发布了视频生成模型 LTX-2.5,同一天把权重挂上了 Hugging Face,ComfyUI 第一天原生支持,另有 API 可用。模型总参数 220 亿,能接文本、图片、视频三种输入,输出的是画面和声音一体的片子

官方发布片。这条是全站唯一带声音的演示,其余能力演示视频按网页自动播放的惯例都去掉了音轨。视频 / LTX

它能干的八件事

八个能力分区各配了一段演示,这八条基本就是 2.5 的功能清单:

运动
人和物体动起来的物理合理性,这一代的重点改进项之一。
多镜头
一次生成好几个镜头,切换机位后人物和场景还是同一个。
照着提示词做
多个主体、条件复杂的指令,能按写的那样出来。
自动定时长
权重里带一个专管时长的模块,让片子长度跟着内容走。
HDR
16 位线性 EXR 进出,明暗范围全程不丢,能进专业调色。
改真实素材
拿实拍的片子进来编辑和延长,不只是从零生成。
出片更干净
画面瑕疵更少,后期要救的地方跟着变少。
可微调的底座
另放一个预训练检查点,给机器人和物理 AI 方向拿自己的数据接着训。
八段演示均来自 LTX 官方模型页。视频 / LTX

相比上一代升了什么

这一代几乎每个阶段都重做过,而不是在旧核心上加功能。具体是六项:

① 新的渲染方式

叫 Diffusion Fidelity Rendering,先搭结构再补细节,是这次画质提升的主要来源。下面单开一节讲。

② 新的视频解码器

在保持高压缩比的前提下,减少快速运动时的画面瑕疵,人脸这类细节不再被压糊。

③ 原生多镜头

整段序列作为一个输出生成,跨镜头保持人物、场景和声音,而不是分别生成再拼。

④ 换了语言骨干

改用定制的 Gemma 4(权重里是 120 亿参数那档)读提示词,另配一个提示词增强器。

⑤ 蒸馏版(distilled)大幅变好

同样质量下更快更省,采样步数固定 8 步,这是能在自家硬件上跑得动的关键。

⑥ 和英伟达做了本地优化

针对 RTX 显卡和 DGX Spark 削减显存占用,权重直接带 NVFP4 和 int8 两种量化版本。

速度

生成 10 秒视频 6.8 秒,但要看清测试条件

速度榜测的是图生视频,生成一段 10 秒片段要多久:

LTX 2.5 本地2×GB200 · 720p
6.8s
LTX 2.5 API1080p · 含排队
23.7s
Gemini Omni Flash720p
52s
Grok 1.5720p
63s
Veo 3.1720p · 测的是 8 秒
70s
MiniMax H3768p
180s
Seedance 2.0720p
196s
FLUX 3720p
259s
Seedance 2.5720p 封顶
317s
Kling 3.0 Pro约 1080p
398s
数据来自 LTX 官方,本站按原图数值重绘,并把各家的分辨率口径标进了标签。

有三件事得跟数字一起读:

第一,6.8 秒那条跑在他们自己的两块 GB200 上。GB200 是英伟达最新的数据中心显卡,一块的价格够买一辆车。这个成绩说明模型本身效率高,但它和「你自己那块显卡能多快」是两个问题,官方没给后者的数字。

第二,两条 LTX 的分辨率不一样。本地那条是 720p,走 API 那条是 1080p,而 API 的 23.7 秒是在第三方平台 fal.run 上端到端测的,把排队时间也算了进去。

第三,对手的条件也各不相同。多数是 720p,MiniMax H3 是 768p,Kling 3.0 Pro 约 1080p,而 Veo 3.1 那条测的是 8 秒片段而不是 10 秒。

LTX 官方发布的速度榜与画质榜
官方原图:左边速度榜,右边画质榜。每一行下面的小字就是各家的测试条件。图 / LTX
架构

画面和声音是一起生成出来的

多数视频模型只管画面,声音要么没有,要么另找一个模型配。LTX 这条线从上一代起走的就是另一条路:音和画在同一个模型里同时长出来。它给自己的定位是「视频、音频与世界模拟」。

这套架构分三层:

01
两条流,宽度不一样
一条 140 亿参数的视频流,一条 50 亿参数的音频流,并排跑。视频那条明显更宽,因为画面比声音更吃容量。
02
两条流之间一直在互相看
中间用双向的交叉注意力层把两条流连起来,还配了时间位置信息,让「这一声」和「这一帧」对得上。
03
共用同一个时间步
两条流在同一个节奏上一起去噪,而不是各生成各的再想办法对齐。

所以它出来的不只是台词配音,还有跟着角色、环境、风格和情绪走的完整音轨,包括环境底噪和拟音。别的模型是先拍默片再找人配音,它是拍的时候话筒就开着。

2.5 的权重能对上这套设计:除了视频的 VAE,还挂着一个独立的音频 VAE,能力标签里也列着「文本转音频」「视频转音频」「音频转视频」这些组合。权重文件名带 22b,说明这一代总参数到了 220 亿;上一代是 140 亿加 50 亿,多出来的部分加在哪一侧未见披露。

为什么这件事重要:视频里的声音不是装饰。脚步声的节奏对不上落脚、说话的嘴型对不上音节,观众一眼就出戏。把音画放进同一个模型、同一个节奏里生成,就是冲着这个对齐问题去的。
新机制

新渲染法:先搭结构,再补细节

这一代画质提升的主要来源叫 Diffusion Fidelity Rendering。它要治的是视频生成的一个老毛病:为了跑得快,模型不在原始像素上干活,而是先把视频压小很多倍再生成,压得越狠算得越快,但解压回来细节就糊了,最常糊的就是人脸。

LTX-2.5 的解法是把「结构」和「细节」拆成两个阶段:

第一段:在压缩 8 倍的空间里,快速把运动和结构搭出来 粗结构 · 运动走向 高保真关键帧钉住细节 画面难的地方多分算力,简单的地方少分 第二段:专门的渲染阶段把细节铺满整条片子 成片
本站按公开的机制描述画的示意图。
01
在压缩 8 倍的空间里搭结构
先把这条片子的运动和结构定下来。时间上压缩 8 倍,意味着要算的东西少很多,所以快。
02
同时生成高保真关键帧
在搭结构的同时另外生成一批清晰的关键帧,用来把画面细节钉住,防止后面糊掉。
03
按画面复杂度分配算力
难的地方多花算力、多放几个关键帧,简单的地方少花。关键帧的数量随场景复杂度和算力预算变。
04
最后由渲染阶段补细节
结构定下来之后,一个专门的扩散渲染阶段把细节铺到最终视频上,而不是全程按最高精度渲染每一帧。
Diffusion Fidelity Rendering 的演示片。视频 / LTX
画质

画质榜第一,比的是谁的画面毛病少

另一张榜测的是文生视频里每段片子的可见瑕疵数,越低越好:LTX 2.5 Pro 0.28、LTX 2.5 Fast 0.39、Flux 3 0.45、MiniMax 0.46、Wan 2.6 0.65、Seedance 2.5 0.69、LTX 2.3 Pro 0.74、Kling 3 Pro 0.76、Veo 3.1 1.20。

十个模型里 LTX 2.5 Pro 排第一。这个「第一」的含义要看清楚它到底量了什么:

这个分数了什么

斑块、破碎的纹理、糊成一团或者被涂抹掉的区域。也就是画面上「一眼能看出是 AI 出错了」的地方。

没数什么

好不好看、动作合不合物理、有没有照着提示词做、声音对不对得上,这些都不在这个分里。

另外三条口径也得说清:98 个相同的提示词跑 10 个模型;打分的是机器不是人;榜单标注为初步结果、会随着评测扩展变化,而且 Seedance 2.0 的 0.60 没画进图里。

许可

「开源」的三道门:营收线、微调转让、下载要交邮箱

它的定位是开放权重(open weights),发布推文里那句更直接:「这不是一个你租来的工具。这是一个你可以在上面建东西的地基,开放的,属于你的。」

实际条款分三层:

第一道:年营收 1000 万美元这条线

用的是 LTX-2.x 社区许可。年营收低于 1000 万美元的组织,商用和生产使用免费;超过这个数,要签一份付费商用协议,那份协议里才包含完整权重、工程支持、LoRA 和灵活的部署选项。

第二道:把微调后的模型转让出去,可能要另外付费

转让自己微调出来的模型,可能需要另外的付费许可。自己用是一回事,把成果交给别人是另一回事。

第三道:下载要用联系方式换

Hugging Face 上的权重是受限的:要先登录,并同意分享自己的联系方式,才能访问。点下同意按钮等于接受隐私政策,并同意接收包括定向广告在内的推送(可以随时退订)。拿权重不是匿名下载。

这三条都不算苛刻,很多开源模型都这么做。「开源」两个字在中文语境里常被读成「随便用」,而这三道门里任何一道都可能影响你要不要用它。

存疑

机器人这条线,官方的定性是「还在发展中」

这次发布把机器人和物理 AI 放在了很显眼的位置:电影、机器人、实时工作流被并列为 LTX 模型已经投入生产使用的三个领域;机器人公司 Markov Robotics 的 CEO 出面背书,说「没找到另一个开源模型能像它这样满足我们」;权重里还单独放了一个为物理 AI 调过的预训练检查点。

而给开发者看的那份说明里,同一件事的定性保守得多:

它的既有用途是从文本、图片、视频输入生成同步的高保真音视频;在机器人、物理 AI 这些新兴领域的适用性还在发展中。

LTX-2.5 模型卡 · Hugging Face

两句出自同一家公司。想拿它做机器人的团队,按后面这句的口径评估更稳妥。

LTX 与制片公司 Asteria 的合作
影视这条线上官方点名的是 Asteria,一家艺术家主导的制片公司,混合工作流建在 LTX 上。联合创始人 Paul Trillo 的说法是,他们看重的正是 ACES 这类真能嵌进现有生产流程的功能。图 / LTX
上手

怎么上手:三条路、拆开的组件、16GB 起

想自己跑,有三条路:ltx-pipelines(LTX 自己的 PyTorch 管线)、ComfyUI(发布第一天就有官方工作流模板)、以及 Diffusers

权重是拆成一个个组件分发的,不是单独一个大文件:扩散主干、Gemma 4 文本编码器、视频 VAE、音频 VAE、控制时长的模块、空间和时间的上采样器,还有 LoRA。装的时候每个组件要各自指定路径。

硬件方面:最低 16GB 显存、任意 GPU 可跑、支持本地/边缘/API 三种部署。显存不够时的办法是把主干动态降精度,再加 CPU 卸载。这个 16GB 对应哪个量化版本、什么分辨率、多长的片子,均未说明。

量化版本有三种:ComfyUI 专用的 int8、给 Blackwell 架构的 NVFP4,以及运行时的 fp8 降精度。ComfyUI 那两个专用文件不能给 PyTorch 管线用,这一条在模型卡里被单独标了出来。

发布一天,Hugging Face 上已经有社区做的 2 个适配器、4 个微调和 7 个量化版本。LTX 系列累计下载量超过 3300 万次(官方数字,指整个系列不是 2.5)。

✅ 想自己跑 LTX-2.5,先确认这几件
目前能下载回自己机器、而且音画一起生成的视频模型里最快的一个,10 秒片段官方测出 6.8 秒;代价是那条 1000 万美元的营收线,和下载时要交出的邮箱。
来源
2.5: The Foundation Film Is Made OnLTX Team·官方博客·2026-08-11
本站说明
全部演示视频与跑分图均来自 LTX 官方站点。速度榜与画质榜为官方自评,测试口径已按原图脚注写进正文。双流架构(140 亿视频 + 50 亿音频、交叉注意力、共享时间步)出自上一代 LTX-2 的论文,不是 2.5 的技术报告;220 亿参数、Gemma 4 文本编码器、独立音频 VAE 等来自 Hugging Face 上的实际权重文件名与模型卡。许可条款与下载门槛引自 LTX-2.x 社区许可说明和 Hugging Face 的访问提示。「先搭结构再补细节」为本站按公开的机制描述所画示意图。