本地模型
本地模型窗格直接在你的 Mac 上运行编码模型,因此工作区的代理可以完全在设备端作答,而无需调用云端提供商——或仅在云端不可达时才回退到本地模型。权重是 Apple MLX 构建版本;推理引擎已随应用捆绑,因此除下载模型之外无需安装任何东西。
本页的每个主题都有配套的深入讲解:设备端引擎、工具调用修复层、混合回退策略,以及 bromure-cli model 和 bromure-cli vm routing 命令都在 本地模型 中。本页介绍的是设置窗格。
默认情况下,该窗格只显示一个开关——启用本地模型——其余内容全部隐藏。将其打开会显示下文所述的路由模式和模型目录。
启用本地模型
这个主开关标注为在此 Mac 上运行编码模型而非使用云端。,是工作区设备端推理的开/关:
- 关闭(默认)——工作区将代理流量路由到云端,就如同此窗格不存在一样。
- 开启——路由切换为设备端推理,并显示模式选择器和模型列表。打开它时,模式默认为本地。
由于此项开启时工作区的代理会将其 LLM 流量通过本地引擎运行,因此启用它会将每个已启用代理的认证模式固定为本地模型,而重新关闭它会恢复每个代理之前的模式。你无需手动操作 代理 窗格。
路由模式
启用本地模型后,单选按钮决定工作区如何使用它们。两行各自带有窗格自身的脚注说明:
| 模式 | 行为 |
|---|---|
| 本地——始终设备端 | 每个请求都留在此 Mac 上——没有任何内容离开本机。回复是私密的,但速度较慢,并受限于你能在内存中容纳的模型。 |
| 混合——云端,回退到本地 | 请求照常发往云端,仅在云端不可达时才回退到设备端模型——兼具云端的速度与质量以及本地的安全网。 |
混合模式的更精细选项——滚动的云端令牌预算、首个令牌到达时间的截止期限,以及主动的本地/云端拆分——是通过命令行(bromure-cli vm hybrid …)调整的,而非此窗格。它们记录在 本地模型 中。
模型目录
在模式选择器下方,列表的标题为模型 · N GB 统一内存,其中 N 是你 Mac 的统一内存。每一行描述一个精选的 MLX 模型:
- 活动模型单选按钮——实心圆点标记此工作区所服务的唯一模型。在此处选择它也会将已启用的代理切换为本地模型认证。
- 等级徽章——一个小的
S/M/L/XL大小类别。 - 适配徽章——模型相对于你 Mac 内存的情况:适配(绿色——余量充裕)、紧张(橙色——加载后所剩无几),或无法容纳(灰显;该行被禁用,无法选择)。窗格的脚注重申了这一点:灰显的模型所需内存超过此 Mac 所拥有的内存。
- 下载大小——磁盘上的权重大小,以 GB 计。
- tools 印章——已验证其工具调用可用于代理的模型上的一个对勾徽章。
每行末尾的控件反映其下载状态:
| 状态 | 控件 |
|---|---|
| 未下载 | 下载按钮(当模型无法容纳时禁用)。 |
| 下载中 | 带有字节标签的进度条和一个停止(✕)按钮。 |
| 已中断(应用在拉取过程中被终止) | 已中断,带有一个继续按钮和一个丢弃(垃圾桶)按钮。 |
| 失败 | 一个重试按钮(悬停可查看错误消息)。 |
| 已安装 | 已安装,带有一个提供移除的菜单。 |
注意: 下载是即时且全局的——你在此拉取的模型会存入共享存储,并对每个工作区可用,而不仅仅是这一个。相比之下,路由模式和活动模型的选择是按工作区的,仅在你点击存储时生效。
合并内存警告
此工作区所选的本地模型——活动模型,加上任何设置为本地模型认证的代理,以及任何 Fusion 本地端或评判器——在一个引擎中并行加载,因此它们的内存需求会累加。当它们接近你 Mac 的 RAM 时,列表上方会显示一条警告:接近宿主机内存时为橙色,超过时为红色。它会说明它们合计需要多少内存,并建议你去掉一个或选择更小的模型。
设置参考
| 设置 | 说明 |
|---|---|
| 启用本地模型 | 设备端推理的主开关。开启会将路由设为本地;关闭会恢复为云端。默认:关闭(云端)。 |
| 模式 | 单选按钮:本地——始终设备端 / 混合——云端,回退到本地。默认:启用时为本地。 |
| 活动模型 | 每行一个单选圆点;工作区所服务的唯一模型。默认:无——你下载的第一个模型会被自动选中。 |
| 下载 / 已安装 / 移除 | 按模型的操作。即时且全局(跨工作区共享);不属于存储事务的一部分。 |