Unsloth 发布桌面版应用:不仅可以跑本地模型,还能在你的电脑上直接训练和微调模型
- Unsloth 把自己那套「训练快 2 倍、省 70% 显存」的老本行,做成了一个桌面 App。
- 别的本地软件只让你把模型跑起来,它还让你练,拖进一个 PDF 或表格就开训,不用写代码。
- 官方给的两个数字都少了半句话,正文里我把前提补上了;而它自己写下的那条短板,比数字更值得看。
本地跑模型的软件不缺,缺的是能练的
Unsloth 在 8 月 11 日放出了桌面 App,叫 Unsloth Desktop,Beta 版,免费开源,Mac、Windows、Linux 三个平台都有。它给自己的定位是第一个既能在本地跑模型、又能在本地训练模型的桌面应用:把一个 PDF、CSV 或者 JSON 拖进去就能微调,不用写一行代码。
在自己电脑上跑模型的软件早就不缺了,装完点几下就能聊。难的一直是另一半,想拿自己的资料把模型调教一遍,得先装 Python 环境、配显卡驱动、跟显存较劲,多数人卡在这一步就放弃了。
而 Unsloth 的老本行,正好就是把训练变快变省
做模型微调的人基本都听过这个名字。它原本是一个专门给微调提速的开源框架,招牌数字挂了很久:快 2 倍、省 70% 显存、精度不掉。GitHub 上 7 万星(本站查证)。
拿一个现成的大模型,用你自己的一小批资料再教它一遍,让它更懂你这一摊事。
像招了个能力不错的新人,再拿你们公司的老档案带他一个月,他就上手了。
所以桌面版里的训练功能,是把原来那套东西搬进了图形界面。同一个代码仓库现在的自我介绍已经改成了「用来跑和训练模型的本地界面」。
所以拖进一个文件就能微调,不用写代码
丢进一个 PDF、CSV 或 JSON 就能开练。三种练法都支持:只挂一小块补丁去学的 LoRA、把整个模型都动一遍的全量微调、以及从头预训练。多张显卡能用,文本、图像、扩散、音频模型都能训。
训练时不动原模型,只在旁边挂一小块「补丁」去学新东西,所以又快又省显存。练完那块补丁才几十 MB,随时可以摘下来换一块。
像给相机换滤镜,机身不动,换的是前面那片玻璃。
训图像模型讲得更具体:给 SDXL、FLUX.2、Qwen-Image、Z-Image 这些画图模型训自己的 LoRA,素材就是你自己那批图。在内置的 Studio 里给图打上文字标注,选一个补丁大小,点开始。
练完的东西不会锁在这个软件里:可以导出成 GGUF 或者 NVFP4 这类通用格式,拿去别的地方接着用。
但视频生成的 13 秒,是数据中心卡跑出来的
官方在生成这块给了一个数字:用 MiniMax-H3 生成一段 960×544、124 帧、8 步的视频,耗时从 70 多秒降到了 13 秒。
70 多秒
13 秒
这一测是在 NVIDIA B200 上跑的。那是给数据中心用的加速卡,一张的价钱够买好几台顶配台式机,跟你桌上那块游戏显卡不是一个量级。同一段视频在家用硬件上要多久,官方没有给。
能生成的东西不止视频:FLUX、Z-Image、LTX、Wan 这些模型都能跑,也能挂上你自己训的 LoRA。除了从头生成,还能改图、局部重绘、按边扩展、放大,以及照着一张参考图去编辑。
音频也在同一个窗口里:语音转文字、文字转语音都能本地跑,Whisper、Qwen3-ASR 这些都支持,而且同样能训。
官方还称工具调用的准确率提升了 50%。但跟谁比、用什么题目测、测了多少次,文档里一个字都没有。这个数字缺了对照,看看就好。
而本地模型最容易翻车的地方是调工具
在自己电脑上跑的模型,个头普遍比云端那些小。小模型干别的还行,一到调工具就容易出事:参数格式写错、卡在一个动作上反复重来停不下来、或者把一堆本该藏在后台的标记直接吐进对话框里。
Unsloth 针对这三种翻车各给了一个应对:
模型调工具失败时,系统自己看出哪里错了,把它改对,再重试一次,不用回头找你。
像点菜时服务员写错了菜名,后厨发现对不上,自己回头核一遍改过来,而不是把错菜端上桌。
代码执行放在一个隔离的沙箱里跑 Bash 和 Python,跑错了也伤不到你的系统。
权限这块,Unsloth 直接对标了 Claude Code
这一套明确参照了 Claude Code(Anthropic 那个跑在命令行里的编码 Agent)的做法。凡是会调工具的模型都归权限管:没有你的批准,模型和 Unsloth 都不能访问、修改你的文件,也不能上网。松到什么程度你自己定,一共四档。
而且能把 Claude Code 接到你本地的模型上
一条命令的事:开 Unsloth、装载一个模型、打开你的项目文件夹,然后跑
unsloth start claude
官方列出能这么接的有 Claude Code、Codex、Hermes Agent、OpenClaw、OpenCode,以及 Unsloth 自己的接口。也就是说你平时用的那套编码 Agent 不用换,只是把背后干活的模型从云端换成了自己机器上的那个。
还有一种更细的接法,发布片里演示了:不整个换掉,只把一部分活派给本地模型。Claude Code 照旧用它自己的模型,你在命令后面加一个参数,它就多出一个跑在你机器上的帮手;之后在 Claude Code 里说一句「派个本地 Agent 去实现这个函数」,那一小块就落到本地跑。界面里选好编码工具、模型和量化档,命令会直接给你生成好,复制就能用。
跑起来之后不必守着电脑:用官方免费的 Cloudflare 隧道开一个 HTTPS 地址,手机上就能看进度;不想走公网就把它绑到局域网上。
搜索也分两档。普通搜索是模型一边想一边顺手查;深度研究会先规划一遍,再去找它认为最好的来源,最后交一份带完整引用的报告。这些搜索不限次数,都从你这台机器发起。
另外两样常用的也在:给它挂自己的资料库来问答(RAG),以及接 MCP 服务去用外部工具。同一个界面还能接云端模型,OpenAI、Anthropic、Ollama、llama.cpp、vLLM 都行,本地和云端来回切不用换软件。
结果 Unsloth 自己写了什么时候会更慢
常见问答里有一条问的是「为什么有时候推理反而更慢」。答案是官方自己写的:
网页搜索、代码执行、工具调用自愈都要花时间。把它们关掉,速度应该和其他任何 llama.cpp 应用一样。还是慢就来开个 issue。
Unsloth 官方文档 · 常见问答
厂商主动写下自己在什么条件下更慢、并且把关掉的方法一并给出,这在发布页上不常见。
同一段问答里还有两条实在的:不收遥测,只探测显卡型号和设备好知道什么跑得动,整个 App 可以完全离线运行;不是只支持 GPU,CPU 和 Mac 也行,NVIDIA、Intel、AMD、Mac 的芯片都在支持范围内,但太老的硬件可能撑不住。你之前下过的模型会被自动认出来,不用重下一遍。
那么怎么装、什么设备能跑
三步:下载安装;在顶部的模型下拉或者「模型库」标签里挑一个跟你设备匹配的模型和量化档下载;下完直接打字开聊。
把模型里的数字精度压低,用一点点效果换体积和速度。压得越狠越省显存,小机器才跑得动。挑的时候就是在「跑得动」和「答得好」之间选一个平衡点。
像把无损音乐压成 MP3,文件小很多,细节掉一点但照样能听。
发布致谢里提到 NVIDIA 和 Hugging Face 参与了这次发布,也感谢了 Jan 给的灵感,以及 llama.cpp、PyTorch、stablediffusion.cpp 这些提供底座的项目。最后这句等于把自己这个界面的来处也交代了。
Unsloth 发桌面 App:本地模型不只能跑,还能拖个文件直接练
免费开源,Mac / Windows / Linux 都有;两个提速数字,一个是数据中心卡跑出来的,一个还没给对照
↓ 一页读完 · 有一张会动的图
本地跑模型的软件不少,装完点几下就能聊天。但想拿自己的资料调教模型,得装环境、配驱动、跟显存较劲,多数人卡在这一步。Unsloth Desktop 把这关跳过去了:免费开源,三大平台都有,同一个窗口里能跑也能练。
本地模型软件只让你跑,装好就能聊天,练一个自己的模型是另一套活。
同一个窗口能练,拖一个 PDF、CSV 或 JSON 进去,不用写代码就能微调。
丢进一个 PDF、CSV 或 JSON,选一种练法:LoRA 只挂一小块补丁、原模型不动;或者全量微调、从头预训练。多卡可用,文本、图像、音频模型都能训。
小互拖进一份产品手册,选 LoRA:原模型没动,练出来的是一块能随时插拔的补丁,几十 MB。
视频生成这项,Unsloth 自测给了个数字:MiniMax-H3 生成一段视频,从 70 多秒降到 13 秒。
本地模型个头小,调工具最容易翻车:参数写错、卡死循环、或吐一堆内部标记进对话框。Unsloth 配了自动修复重试和隔离沙箱;碰文件、联网默认要你先点头,四档松紧自选,对标 Claude Code。
常见问答里,Unsloth 自己写了什么时候更慢:搜索、代码执行、工具自愈都要花时间,关掉这些速度和其他 llama.cpp 应用一样,还慢就去提 issue。
工具调用准确率提升 50% 这个数字,跟谁比、怎么测的没交代,当参考看。
免费开源,当前 Beta。三大平台都有,NVIDIA、Intel、AMD、Mac 的 GPU 和 CPU 都支持,老硬件可能吃不消。已经在用 Claude Code、Codex 这类 Agent 的,一条命令就能把后端换成自己机器上的模型。
新事,咋整
- × 装 Python 环境
- × 配显卡驱动
- × 跟显存较劲
三个平台都有
挂块补丁
写代码?
NVIDIA B200
一张顶好几台电脑
写错了
通了
重试一次
速度和别人一样
但数字得看门槛
