Lightricks 开源视频模型 LTX-2.5:音画一起生成,10 秒片段 6.8 秒
- Lightricks 发布并开源了视频生成模型 LTX-2.5,生成一段 10 秒视频官方测出 6.8 秒,同榜的 Veo 3.1 是 70 秒。
- 它和多数视频模型的根本区别:画面和声音在同一个模型里一起生成,不用另配。
- 但「开源」这两个字有条件,下载前还有一道你可能没注意的门槛。
Lightricks 开源了 LTX-2.5,权重当天就能下
以色列公司 Lightricks 旗下的 LTX 团队昨天发布了视频生成模型 LTX-2.5,同一天把权重挂上了 Hugging Face,ComfyUI 第一天原生支持,另有 API 可用。模型总参数 220 亿,能接文本、图片、视频三种输入,输出的是画面和声音一体的片子。
它能干的八件事
八个能力分区各配了一段演示,这八条基本就是 2.5 的功能清单:
相比上一代升了什么
这一代几乎每个阶段都重做过,而不是在旧核心上加功能。具体是六项:
叫 Diffusion Fidelity Rendering,先搭结构再补细节,是这次画质提升的主要来源。下面单开一节讲。
在保持高压缩比的前提下,减少快速运动时的画面瑕疵,人脸这类细节不再被压糊。
整段序列作为一个输出生成,跨镜头保持人物、场景和声音,而不是分别生成再拼。
改用定制的 Gemma 4(权重里是 120 亿参数那档)读提示词,另配一个提示词增强器。
同样质量下更快更省,采样步数固定 8 步,这是能在自家硬件上跑得动的关键。
针对 RTX 显卡和 DGX Spark 削减显存占用,权重直接带 NVFP4 和 int8 两种量化版本。
生成 10 秒视频 6.8 秒,但要看清测试条件
速度榜测的是图生视频,生成一段 10 秒片段要多久:
有三件事得跟数字一起读:
第一,6.8 秒那条跑在他们自己的两块 GB200 上。GB200 是英伟达最新的数据中心显卡,一块的价格够买一辆车。这个成绩说明模型本身效率高,但它和「你自己那块显卡能多快」是两个问题,官方没给后者的数字。
第二,两条 LTX 的分辨率不一样。本地那条是 720p,走 API 那条是 1080p,而 API 的 23.7 秒是在第三方平台 fal.run 上端到端测的,把排队时间也算了进去。
第三,对手的条件也各不相同。多数是 720p,MiniMax H3 是 768p,Kling 3.0 Pro 约 1080p,而 Veo 3.1 那条测的是 8 秒片段而不是 10 秒。
画面和声音是一起生成出来的
多数视频模型只管画面,声音要么没有,要么另找一个模型配。LTX 这条线从上一代起走的就是另一条路:音和画在同一个模型里同时长出来。它给自己的定位是「视频、音频与世界模拟」。
这套架构分三层:
所以它出来的不只是台词配音,还有跟着角色、环境、风格和情绪走的完整音轨,包括环境底噪和拟音。别的模型是先拍默片再找人配音,它是拍的时候话筒就开着。
2.5 的权重能对上这套设计:除了视频的 VAE,还挂着一个独立的音频 VAE,能力标签里也列着「文本转音频」「视频转音频」「音频转视频」这些组合。权重文件名带 22b,说明这一代总参数到了 220 亿;上一代是 140 亿加 50 亿,多出来的部分加在哪一侧未见披露。
新渲染法:先搭结构,再补细节
这一代画质提升的主要来源叫 Diffusion Fidelity Rendering。它要治的是视频生成的一个老毛病:为了跑得快,模型不在原始像素上干活,而是先把视频压小很多倍再生成,压得越狠算得越快,但解压回来细节就糊了,最常糊的就是人脸。
LTX-2.5 的解法是把「结构」和「细节」拆成两个阶段:
画质榜第一,比的是谁的画面毛病少
另一张榜测的是文生视频里每段片子的可见瑕疵数,越低越好:LTX 2.5 Pro 0.28、LTX 2.5 Fast 0.39、Flux 3 0.45、MiniMax 0.46、Wan 2.6 0.65、Seedance 2.5 0.69、LTX 2.3 Pro 0.74、Kling 3 Pro 0.76、Veo 3.1 1.20。
十个模型里 LTX 2.5 Pro 排第一。这个「第一」的含义要看清楚它到底量了什么:
斑块、破碎的纹理、糊成一团或者被涂抹掉的区域。也就是画面上「一眼能看出是 AI 出错了」的地方。
好不好看、动作合不合物理、有没有照着提示词做、声音对不对得上,这些都不在这个分里。
另外三条口径也得说清:98 个相同的提示词跑 10 个模型;打分的是机器不是人;榜单标注为初步结果、会随着评测扩展变化,而且 Seedance 2.0 的 0.60 没画进图里。
「开源」的三道门:营收线、微调转让、下载要交邮箱
它的定位是开放权重(open weights),发布推文里那句更直接:「这不是一个你租来的工具。这是一个你可以在上面建东西的地基,开放的,属于你的。」
实际条款分三层:
用的是 LTX-2.x 社区许可。年营收低于 1000 万美元的组织,商用和生产使用免费;超过这个数,要签一份付费商用协议,那份协议里才包含完整权重、工程支持、LoRA 和灵活的部署选项。
转让自己微调出来的模型,可能需要另外的付费许可。自己用是一回事,把成果交给别人是另一回事。
Hugging Face 上的权重是受限的:要先登录,并同意分享自己的联系方式,才能访问。点下同意按钮等于接受隐私政策,并同意接收包括定向广告在内的推送(可以随时退订)。拿权重不是匿名下载。
这三条都不算苛刻,很多开源模型都这么做。「开源」两个字在中文语境里常被读成「随便用」,而这三道门里任何一道都可能影响你要不要用它。
机器人这条线,官方的定性是「还在发展中」
这次发布把机器人和物理 AI 放在了很显眼的位置:电影、机器人、实时工作流被并列为 LTX 模型已经投入生产使用的三个领域;机器人公司 Markov Robotics 的 CEO 出面背书,说「没找到另一个开源模型能像它这样满足我们」;权重里还单独放了一个为物理 AI 调过的预训练检查点。
而给开发者看的那份说明里,同一件事的定性保守得多:
它的既有用途是从文本、图片、视频输入生成同步的高保真音视频;在机器人、物理 AI 这些新兴领域的适用性还在发展中。
LTX-2.5 模型卡 · Hugging Face
两句出自同一家公司。想拿它做机器人的团队,按后面这句的口径评估更稳妥。
怎么上手:三条路、拆开的组件、16GB 起
想自己跑,有三条路:ltx-pipelines(LTX 自己的 PyTorch 管线)、ComfyUI(发布第一天就有官方工作流模板)、以及 Diffusers。
权重是拆成一个个组件分发的,不是单独一个大文件:扩散主干、Gemma 4 文本编码器、视频 VAE、音频 VAE、控制时长的模块、空间和时间的上采样器,还有 LoRA。装的时候每个组件要各自指定路径。
硬件方面:最低 16GB 显存、任意 GPU 可跑、支持本地/边缘/API 三种部署。显存不够时的办法是把主干动态降精度,再加 CPU 卸载。这个 16GB 对应哪个量化版本、什么分辨率、多长的片子,均未说明。
量化版本有三种:ComfyUI 专用的 int8、给 Blackwell 架构的 NVFP4,以及运行时的 fp8 降精度。ComfyUI 那两个专用文件不能给 PyTorch 管线用,这一条在模型卡里被单独标了出来。
发布一天,Hugging Face 上已经有社区做的 2 个适配器、4 个微调和 7 个量化版本。LTX 系列累计下载量超过 3300 万次(官方数字,指整个系列不是 2.5)。
Lightricks 开源 LTX-2.5:画面和声音在同一个模型里一起生成
Lightricks 把视频生成做到 10 秒片段 6.8 秒,还让声音和画面一起长出来,一页带图讲完它怎么做到,以及「开源」的真实条件。
↓ 一页读完 · 有一张会动的图
Lightricks 旗下 LTX 团队发布视频生成模型 LTX-2.5,权重当天上线 Hugging Face,ComfyUI 第一天原生支持。多数视频模型只管画面,声音另外配;LTX-2.5 这代把两件事放进同一个模型同时生成。
- 新渲染法把细节做实了,人脸这类容易糊的地方更清楚
- 一次生成整段多镜头,切换机位人物和场景还是同一个
- 和英伟达一起做了本地优化,权重自带两种量化版本
速度榜测的是生成一段 10 秒片段要多久。根据 LTX 官方自评,LTX-2.5 本地跑在自家两块 GB200(英伟达最新数据中心显卡)上用了 6.8 秒;同一张榜上 Veo 3.1 是 70 秒,Kling 3.0 Pro 是 398 秒。
2×GB200 · 720p
1080p · 含排队
720p · 测的是 8 秒片段
约 1080p
这条线从上一代起走的是另一条路:一条视频流、一条音频流并排跑,中间不断用交叉注意力(模型让两条流互相参考对方在做什么)对话,两条流按同一个时间节奏一起生成。出来的不只是台词,还有跟着画面走的脚步声、环境底噪和情绪对得上的背景音。
Lightricks 说这是「你可以在上面建东西的地基」。权重确实当天就能下,但商用条件写在许可里,分三层。
新闻稿把机器人放在很显眼的位置,电影、机器人、实时工作流并列为已经投产的三个场景,机器人公司 Markov Robotics 的 CEO 还出面背书。
自己电脑跑
一起生成!
生成要多久
Kling 398秒
是这么测的
数据中心顶级卡
声音哪来的
口型的?
再找人配音
话筒就开着!
低于1000万美元
免费商用
交出联系方式
这么讲
已经在用了!
适用性还在发展中
代价是1000万营收线,
和一个邮箱
