本地模型
本地模型窗格直接在你的 Mac 上运行编码模型——或在你自己的推理服务器上运行——因此工作区的代理可以完全不依赖云端作答,或仅在云端不可达时才回退到本地模型。使用内置引擎时,权重是 Apple MLX 构建版本,除下载模型之外无需安装任何东西;使用自定义引擎时,你可以把工作区指向任意 OpenAI 兼容服务器。
本页的每个主题都有配套的深入讲解:设备端引擎、工具调用修复层、混合回退策略,以及 bromure-cli model 和 bromure-cli vm routing 命令都在 本地模型 中。本页介绍的是设置窗格。
默认情况下,该窗格只显示一个开关——启用本地模型——其余内容全部隐藏。将其打开会显示下文所述的路由模式和模型目录。
启用本地模型
这个主开关标注为在此 Mac 上运行编码模型而非使用云端。,是工作区设备端推理的开/关:
- 关闭(默认)——工作区将代理流量路由到云端,就如同此窗格不存在一样。
- 开启——路由切换为设备端推理,并显示模式选择器和模型列表。打开它时,模式默认为本地。
由于此项开启时工作区的代理会将其 LLM 流量通过本地引擎运行,因此启用它会将每个已启用代理的认证模式固定为本地模型,而重新关闭它会恢复每个代理之前的模式。你无需手动操作 代理 窗格。
引擎
启用本地模型后,一个引擎单选按钮决定推理在哪里运行:
- 内置——模型在这台 Mac 上运行。 随附的进程内 MLX 引擎,也是默认值。下方的模型目录适用于此。
- 自定义服务器——你自己的 vLLM、Ollama…… 任意 OpenAI 兼容服务器,可位于这台 Mac 或另一台机器上。界面会出现服务器 URL 字段(例如
http://127.0.0.1:11434)和可选的 API 密钥,以及一个测试连接按钮,用于探测服务器并报告已连接——有 N 个可用模型,或服务器真实的错误信息。正如该窗格页脚所述:代理仍然讲自己的原生 API;由 Bromure 在中间翻译。
使用自定义引擎时,目录会被模型区块取代:一个自由输入的模型 id 字段(例如 qwen3-coder:30b),加上服务器在 /v1/models 上报告的 id 列表——测试连接即可列出它们,在 Ollama 上则需先拉取模型。深入说明见使用你自己的引擎。
路由模式
启用本地模型后,单选按钮决定工作区如何使用它们。两行各自带有窗格自身的脚注说明:
| 模式 | 行为 |
|---|---|
| 本地——始终设备端 | 每个请求都留在此 Mac 上——没有任何内容离开本机。回复是私密的,但速度较慢,并受限于你能在内存中容纳的模型。 |
| 混合——云端,回退到本地 | 请求照常发往云端,仅在云端不可达时才回退到设备端模型——兼具云端的速度与质量以及本地的安全网。 |
混合模式的更精细选项——滚动的云端令牌预算、首个令牌到达时间的截止期限,以及主动的本地/云端拆分——是通过命令行(bromure-cli vm hybrid …)调整的,而非此窗格。它们记录在 本地模型 中。
模型目录
在模式选择器下方,列表的标题为模型 · N GB 统一内存,其中 N 是你 Mac 的统一内存。每一行描述一个精选的 MLX 模型:
- 活动模型单选按钮——实心圆点标记此工作区所服务的唯一模型。在此处选择它也会将已启用的代理切换为本地模型认证。
- 等级徽章——一个小的
S/M/L/XL大小类别。 - 适配徽章——模型相对于你 Mac 内存的情况:适配(绿色——余量充裕)、紧张(橙色——加载后所剩无几),或无法容纳(灰显;该行被禁用,无法选择)。窗格的脚注重申了这一点:灰显的模型所需内存超过此 Mac 所拥有的内存。
- 下载大小——磁盘上的权重大小,以 GB 计。
- tools 印章——已验证其工具调用可用于代理的模型上的一个对勾徽章。
每行末尾的控件反映其下载状态:
| 状态 | 控件 |
|---|---|
| 未下载 | 下载按钮(当模型无法容纳时禁用)。 |
| 下载中 | 带有字节标签的进度条和一个停止(✕)按钮。 |
| 已中断(应用在拉取过程中被终止) | 已中断,带有一个继续按钮和一个丢弃(垃圾桶)按钮。 |
| 失败 | 一个重试按钮(悬停可查看错误消息)。 |
| 已安装 | 已安装,带有一个提供移除的菜单。 |
注意: 下载是即时且全局的——你在此拉取的模型会存入共享存储,并对每个工作区可用,而不仅仅是这一个。相比之下,路由模式和活动模型的选择是按工作区的,仅在你点击存储时生效。
合并内存警告
此工作区所选的本地模型——活动模型,加上任何设置为本地模型认证的代理,以及任何 Fusion 本地端或评判器——在一个引擎中并行加载,因此它们的内存需求会累加。当它们接近你 Mac 的 RAM 时,列表上方会显示一条警告:接近宿主机内存时为橙色,超过时为红色。它会说明它们合计需要多少内存,并建议你去掉一个或选择更小的模型。
设置参考
| 设置 | 说明 |
|---|---|
| 启用本地模型 | 本地推理的主开关。开启会将路由设为本地;关闭会恢复为云端。默认:关闭(云端)。 |
| 引擎 | 单选:内置(进程内 MLX)/自定义服务器(OpenAI 兼容 URL + 可选 API 密钥,附测试连接)。默认:内置。 |
| 模型 id(自定义引擎) | 服务器自身的模型 id,可自行输入或从其 /v1/models 列表中选取。 |
| 模式 | 单选按钮:本地——始终设备端 / 混合——云端,回退到本地。默认:启用时为本地。 |
| 活动模型 | 每行一个单选圆点;工作区所服务的唯一模型。默认:无——你下载的第一个模型会被自动选中。 |
| 下载 / 已安装 / 移除 | 按模型的操作。即时且全局(跨工作区共享);不属于存储事务的一部分。 |