产品发布 · 小互解读

Unsloth 发布桌面版应用:不仅可以跑本地模型,还能在你的电脑上直接训练和微调模型

免费开源,Mac / Windows / Linux 都有;把文件拖进去就能微调,不用写一行代码
一分钟速览
  • Unsloth 把自己那套「训练快 2 倍、省 70% 显存」的老本行,做成了一个桌面 App。
  • 别的本地软件只让你把模型跑起来,它还让你练,拖进一个 PDF 或表格就开训,不用写代码。
  • 官方给的两个数字都少了半句话,正文里我把前提补上了;而它自己写下的那条短板,比数字更值得看。
⚑ 素材来自 Unsloth 官方文档,所有性能数字都是厂商自评,没有第三方复测。文中标注的硬件前提与缺失口径由本站核对补出。产品自标 Beta。
开篇

本地跑模型的软件不缺,缺的是能练的

Unsloth 在 8 月 11 日放出了桌面 App,叫 Unsloth Desktop,Beta 版,免费开源,Mac、Windows、Linux 三个平台都有。它给自己的定位是第一个既能在本地跑模型、又能在本地训练模型的桌面应用:把一个 PDF、CSV 或者 JSON 拖进去就能微调,不用写一行代码。

在自己电脑上跑模型的软件早就不缺了,装完点几下就能聊。难的一直是另一半,想拿自己的资料把模型调教一遍,得先装 Python 环境、配显卡驱动、跟显存较劲,多数人卡在这一步就放弃了。

官方发布片,47 秒,把这一版能干的事快速过了一遍:带引用的深度研究报告、成批生成的图片和视频、把 Claude Code 接到本地模型的配置页、模型库,最后落在一张字卡上,本地、安全、开源。(来自 Unsloth 官方账号,本站转码后自托管)
来历

而 Unsloth 的老本行,正好就是把训练变快变省

做模型微调的人基本都听过这个名字。它原本是一个专门给微调提速的开源框架,招牌数字挂了很久:快 2 倍、省 70% 显存、精度不掉。GitHub 上 7 万星(本站查证)。

微调(fine-tune)是什么

拿一个现成的大模型,用你自己的一小批资料再教它一遍,让它更懂你这一摊事。

像招了个能力不错的新人,再拿你们公司的老档案带他一个月,他就上手了。

所以桌面版里的训练功能,是把原来那套东西搬进了图形界面。同一个代码仓库现在的自我介绍已经改成了「用来跑和训练模型的本地界面」。

核心

所以拖进一个文件就能微调,不用写代码

丢进一个 PDF、CSV 或 JSON 就能开练。三种练法都支持:只挂一小块补丁去学的 LoRA、把整个模型都动一遍的全量微调、以及从头预训练。多张显卡能用,文本、图像、扩散、音频模型都能训。

LoRA 是什么

训练时不动原模型,只在旁边挂一小块「补丁」去学新东西,所以又快又省显存。练完那块补丁才几十 MB,随时可以摘下来换一块。

像给相机换滤镜,机身不动,换的是前面那片玻璃。

你的资料 PDF / CSV / JSON 选一种练法 LoRA(挂补丁) 全量微调 从头预训练 一块补丁 原模型一个字节没动 补丁本身只有几十 MB 随时摘下来换一块
本站示意图:走 LoRA 这条路时,练出来的是一小块能随时插拔的补丁,原模型一个字节没动。
训练页的样子:左边选模型和练法,中间挂数据集(演示里用的是 Hugging Face 上的现成数据集),右边一栏是这次要跑的参数预览,步数、上下文长度、批量、学习率,往下还标着这台机器的显卡型号和显存,最底下是一个绿色的「开始训练」。演示过程中这些值一直在变,图里看到的只是某一帧。(官方演示动图,本站转码)

训图像模型讲得更具体:给 SDXL、FLUX.2、Qwen-Image、Z-Image 这些画图模型训自己的 LoRA,素材就是你自己那批图。在内置的 Studio 里给图打上文字标注,选一个补丁大小,点开始。

训练 LoRA 的界面:左边选基础模型和训练图片,右边是训练参数和历史记录
训一块画图 LoRA 的完整界面。左边选基础模型(演示里是 FLUX.1-dev)、标着这套配置吃 16GB 显存,下面是拖进来的 16 张训练图;右边是这次的参数(500 步、补丁大小 16、分辨率 512)和之前几次的运行记录,每条后面跟着损失值和「适配器已保存」。

练完的东西不会锁在这个软件里:可以导出成 GGUF 或者 NVFP4 这类通用格式,拿去别的地方接着用。

数字

但视频生成的 13 秒,是数据中心卡跑出来的

官方在生成这块给了一个数字:用 MiniMax-H3 生成一段 960×544、124 帧、8 步的视频,耗时从 70 多秒降到了 13 秒

改进前

70 多秒

改进后

13 秒

这个数字的前提

这一测是在 NVIDIA B200 上跑的。那是给数据中心用的加速卡,一张的价钱够买好几台顶配台式机,跟你桌上那块游戏显卡不是一个量级。同一段视频在家用硬件上要多久,官方没有给。

能生成的东西不止视频:FLUX、Z-Image、LTX、Wan 这些模型都能跑,也能挂上你自己训的 LoRA。除了从头生成,还能改图、局部重绘、按边扩展、放大,以及照着一张参考图去编辑。

生成视频的界面:既可以只给一句话,也可以指定首帧和尾帧让它补中间。演示里输入的是一头狮子在金色光线里慢动作甩掉雨水。(官方演示动图,本站转码)

音频也在同一个窗口里:语音转文字、文字转语音都能本地跑,Whisper、Qwen3-ASR 这些都支持,而且同样能训。

音频生成界面:左边输入文本,右边是生成好的音频播放器
语音合成的界面。左边填要念的文字,右边就出音频条,演示里念的是一句西班牙语,时长 2 秒。上方「生成 / 转写」两个标签切换方向,右上角还有个「训练」按钮,意味着这个声音模型你也能自己练。
另一个数字缺了口径

官方还称工具调用的准确率提升了 50%。但跟谁比、用什么题目测、测了多少次,文档里一个字都没有。这个数字缺了对照,看看就好。

机制

而本地模型最容易翻车的地方是调工具

在自己电脑上跑的模型,个头普遍比云端那些小。小模型干别的还行,一到调工具就容易出事:参数格式写错、卡在一个动作上反复重来停不下来、或者把一堆本该藏在后台的标记直接吐进对话框里。

Unsloth 针对这三种翻车各给了一个应对:

自愈是什么意思

模型调工具失败时,系统自己看出哪里错了,把它改对,再重试一次,不用回头找你。

像点菜时服务员写错了菜名,后厨发现对不上,自己回头核一遍改过来,而不是把错菜端上桌。

模型要调工具 格式写错了 或者卡住不停 自动改对,重试一次 这次走通了 结果给你
本站示意图:出错的那一步不再直接抛给你,而是先在里面绕一圈修好。

代码执行放在一个隔离的沙箱里跑 Bash 和 Python,跑错了也伤不到你的系统。

代码执行的实况:模型自己敲命令、拿到输出、接着往下走,每一段命令和结果旁边都带「复制」和「下载」。(官方演示动图,本站转码)
权限

权限这块,Unsloth 直接对标了 Claude Code

这一套明确参照了 Claude Code(Anthropic 那个跑在命令行里的编码 Agent)的做法。凡是会调工具的模型都归权限管:没有你的批准,模型和 Unsloth 都不能访问、修改你的文件,也不能上网。松到什么程度你自己定,一共四档。

每次都问我
凡是要改文件或者要联网,动手前一律先问一句。
替我把关
一般的调用直接放行,只在高风险动作前停下来问,比如碰凭据、提权、执行破坏性命令。
全自动
不再弹确认框,但所有动作关在沙箱里跑。
完全放开
不再有任何确认,而且沙箱本身也关掉了
工具调用权限设置:四档从每次询问到完全放开
这四档在界面里的原样,演示中默认停在第二档「替我把关」。第四档的说明是:不受限制、没有确认提示、代码沙箱被禁用。
同一个问题的另一种答法,站内解读过
xAI 发布 Grok Bot:一批有自己电脑的 AI 同事,用你的账号替你干活
那边把权限规则做成一段自然语言,交给另一个 Agent 逐条审;这边是四个档位由你直接拨。
接入

而且能把 Claude Code 接到你本地的模型上

一条命令的事:开 Unsloth、装载一个模型、打开你的项目文件夹,然后跑

unsloth start claude

官方列出能这么接的有 Claude Code、Codex、Hermes Agent、OpenClaw、OpenCode,以及 Unsloth 自己的接口。也就是说你平时用的那套编码 Agent 不用换,只是把背后干活的模型从云端换成了自己机器上的那个。

还有一种更细的接法,发布片里演示了:不整个换掉,只把一部分活派给本地模型。Claude Code 照旧用它自己的模型,你在命令后面加一个参数,它就多出一个跑在你机器上的帮手;之后在 Claude Code 里说一句「派个本地 Agent 去实现这个函数」,那一小块就落到本地跑。界面里选好编码工具、模型和量化档,命令会直接给你生成好,复制就能用。

跑起来之后不必守着电脑:用官方免费的 Cloudflare 隧道开一个 HTTPS 地址,手机上就能看进度;不想走公网就把它绑到局域网上。

手机上的样子:装载的模型和量化档写在顶部,直接对话,演示里让它跑一段 Python 画曼德博集合。跑的还是家里那台机器。(官方演示动图,本站转码)

搜索也分两档。普通搜索是模型一边想一边顺手查;深度研究会先规划一遍,再去找它认为最好的来源,最后交一份带完整引用的报告。这些搜索不限次数,都从你这台机器发起。

输入框下面那排开关,是普通聊天软件里没有的:替我把关、深度研究、搜索、代码、思考,各自独立开合。右侧展开的就是深度研究的过程,它会先把要查的几步列出来再动手。(官方演示动图,本站转码)

另外两样常用的也在:给它挂自己的资料库来问答(RAG),以及接 MCP 服务去用外部工具。同一个界面还能接云端模型,OpenAI、Anthropic、Ollama、llama.cpp、vLLM 都行,本地和云端来回切不用换软件。

局限

结果 Unsloth 自己写了什么时候会更慢

常见问答里有一条问的是「为什么有时候推理反而更慢」。答案是官方自己写的:

网页搜索、代码执行、工具调用自愈都要花时间。把它们关掉,速度应该和其他任何 llama.cpp 应用一样。还是慢就来开个 issue。

Unsloth 官方文档 · 常见问答

厂商主动写下自己在什么条件下更慢、并且把关掉的方法一并给出,这在发布页上不常见。

同一段问答里还有两条实在的:不收遥测,只探测显卡型号和设备好知道什么跑得动,整个 App 可以完全离线运行;不是只支持 GPU,CPU 和 Mac 也行,NVIDIA、Intel、AMD、Mac 的芯片都在支持范围内,但太老的硬件可能撑不住。你之前下过的模型会被自动认出来,不用重下一遍。

上手

那么怎么装、什么设备能跑

三步:下载安装;在顶部的模型下拉或者「模型库」标签里挑一个跟你设备匹配的模型和量化档下载;下完直接打字开聊。

量化档是什么

把模型里的数字精度压低,用一点点效果换体积和速度。压得越狠越省显存,小机器才跑得动。挑的时候就是在「跑得动」和「答得好」之间选一个平衡点。

像把无损音乐压成 MP3,文件小很多,细节掉一点但照样能听。

选择模型的下拉面板,带推荐、已在本机、全部、热度筛选
选模型的面板:可以按「推荐」「已在本机」「全部」「热度」筛。每个模型后面跟着体积,从二十几 B 到两千多 B 都有,直接告诉你这台机器能不能装得下。
模型库页面,列出可下载的模型及其下载量和点赞数
模型库里每个条目带着点赞数和下载量,右边是选中模型的详情,体积、开源许可、更新时间。演示里那个占 137 GB,用的是 MIT 许可。
免费开源
当前为 Beta,官方未给版本号与发布日期
三平台
macOS、Windows、Linux(含 WSL)
不挑品牌
NVIDIA、Intel、AMD、Mac 的 GPU 与 CPU 都支持
🧰 上手卡 · Unsloth Desktop
价格免费、开源(Beta)
门槛macOS / Windows / Linux(含 WSL);NVIDIA、Intel、AMD、Mac 的 GPU 与 CPU 均支持,老硬件可能支持不佳

发布致谢里提到 NVIDIA 和 Hugging Face 参与了这次发布,也感谢了 Jan 给的灵感,以及 llama.cpp、PyTorch、stablediffusion.cpp 这些提供底座的项目。最后这句等于把自己这个界面的来处也交代了。

来源
Introducing Unsloth DesktopUnsloth 官方文档·原文
本站说明
文中截图与演示动图全部来自官方文档;另有一段 47 秒的官方发布片取自该推文;五段动图原为 GIF,最大一段 33 MB,本站转码成视频后自托管,画面未作改动。训练流水线与自愈回环两张示意图为本站所画。GitHub 星标数取自 GitHub API,2026-08-12 查,非文档内容。发布日期取自 Unsloth 官方账号 8 月 11 日那条发布推文,文档本身未给版本号与发布日期。「13 秒」的硬件前提与「准确率提升 50%」缺少对照口径两处,均为本站核对后补注。