本地模型

本地模型窗格直接在你的 Mac 上运行编码模型——或在你自己的推理服务器上运行——因此工作区的代理可以完全不依赖云端作答,或仅在云端不可达时才回退到本地模型。使用内置引擎时,权重是 Apple MLX 构建版本,除下载模型之外无需安装任何东西;使用自定义引擎时,你可以把工作区指向任意 OpenAI 兼容服务器。

本页的每个主题都有配套的深入讲解:设备端引擎、工具调用修复层、混合回退策略,以及 bromure-cli modelbromure-cli vm routing 命令都在 本地模型 中。本页介绍的是设置窗格。

编辑工作区窗口的本地模型窗格,显示启用本地模型开关处于关闭状态,标注为在此 Mac 上运行编码模型而非使用云端

默认情况下,该窗格只显示一个开关——启用本地模型——其余内容全部隐藏。将其打开会显示下文所述的路由模式和模型目录。

启用本地模型

这个主开关标注为在此 Mac 上运行编码模型而非使用云端。,是工作区设备端推理的开/关:

  • 关闭(默认)——工作区将代理流量路由到云端,就如同此窗格不存在一样。
  • 开启——路由切换为设备端推理,并显示模式选择器和模型列表。打开它时,模式默认为本地

由于此项开启时工作区的代理会将其 LLM 流量通过本地引擎运行,因此启用它会将每个已启用代理的认证模式固定为本地模型,而重新关闭它会恢复每个代理之前的模式。你无需手动操作 代理 窗格。

引擎

启用本地模型后,一个引擎单选按钮决定推理在哪里运行:

  • 内置——模型在这台 Mac 上运行。 随附的进程内 MLX 引擎,也是默认值。下方的模型目录适用于此。
  • 自定义服务器——你自己的 vLLM、Ollama…… 任意 OpenAI 兼容服务器,可位于这台 Mac 或另一台机器上。界面会出现服务器 URL 字段(例如 http://127.0.0.1:11434)和可选的 API 密钥,以及一个测试连接按钮,用于探测服务器并报告已连接——有 N 个可用模型,或服务器真实的错误信息。正如该窗格页脚所述:代理仍然讲自己的原生 API;由 Bromure 在中间翻译。

使用自定义引擎时,目录会被模型区块取代:一个自由输入的模型 id 字段(例如 qwen3-coder:30b),加上服务器在 /v1/models 上报告的 id 列表——测试连接即可列出它们,在 Ollama 上则需先拉取模型。深入说明见使用你自己的引擎

路由模式

启用本地模型后,单选按钮决定工作区如何使用它们。两行各自带有窗格自身的脚注说明:

模式行为
本地——始终设备端每个请求都留在此 Mac 上——没有任何内容离开本机。回复是私密的,但速度较慢,并受限于你能在内存中容纳的模型。
混合——云端,回退到本地请求照常发往云端,仅在云端不可达时才回退到设备端模型——兼具云端的速度与质量以及本地的安全网。

混合模式的更精细选项——滚动的云端令牌预算、首个令牌到达时间的截止期限,以及主动的本地/云端拆分——是通过命令行(bromure-cli vm hybrid …)调整的,而非此窗格。它们记录在 本地模型 中。

模型目录

在模式选择器下方,列表的标题为模型 · N GB 统一内存,其中 N 是你 Mac 的统一内存。每一行描述一个精选的 MLX 模型:

  • 活动模型单选按钮——实心圆点标记此工作区所服务的唯一模型。在此处选择它也会将已启用的代理切换为本地模型认证。
  • 等级徽章——一个小的 S / M / L / XL 大小类别。
  • 适配徽章——模型相对于你 Mac 内存的情况:适配(绿色——余量充裕)、紧张(橙色——加载后所剩无几),或无法容纳(灰显;该行被禁用,无法选择)。窗格的脚注重申了这一点:灰显的模型所需内存超过此 Mac 所拥有的内存。
  • 下载大小——磁盘上的权重大小,以 GB 计。
  • tools 印章——已验证其工具调用可用于代理的模型上的一个对勾徽章。

每行末尾的控件反映其下载状态:

状态控件
未下载下载按钮(当模型无法容纳时禁用)。
下载中带有字节标签的进度条和一个停止(✕)按钮。
已中断(应用在拉取过程中被终止)已中断,带有一个继续按钮和一个丢弃(垃圾桶)按钮。
失败一个重试按钮(悬停可查看错误消息)。
已安装已安装,带有一个提供移除的菜单。

注意: 下载是即时且全局的——你在此拉取的模型会存入共享存储,并对每个工作区可用,而不仅仅是这一个。相比之下,路由模式和活动模型的选择是按工作区的,仅在你点击存储时生效。

合并内存警告

此工作区所选的本地模型——活动模型,加上任何设置为本地模型认证的代理,以及任何 Fusion 本地端或评判器——在一个引擎中并行加载,因此它们的内存需求会累加。当它们接近你 Mac 的 RAM 时,列表上方会显示一条警告:接近宿主机内存时为橙色,超过时为红色。它会说明它们合计需要多少内存,并建议你去掉一个或选择更小的模型。

设置参考

设置说明
启用本地模型本地推理的主开关。开启会将路由设为本地;关闭会恢复为云端。默认:关闭(云端)。
引擎单选:内置(进程内 MLX)/自定义服务器(OpenAI 兼容 URL + 可选 API 密钥,附测试连接)。默认:内置。
模型 id(自定义引擎)服务器自身的模型 id,可自行输入或从其 /v1/models 列表中选取。
模式单选按钮:本地——始终设备端 / 混合——云端,回退到本地。默认:启用时为本地
活动模型每行一个单选圆点;工作区所服务的唯一模型。默认:无——你下载的第一个模型会被自动选中。
下载 / 已安装 / 移除按模型的操作。即时且全局(跨工作区共享);不属于存储事务的一部分。

相关章节

  • 本地模型 —— 完整介绍设备端引擎、模型目录与 CLI,以及混合回退策略。
  • 代理 —— 此窗格保持同步的按代理的本地模型认证模式。
  • Fusion —— 将本地模型用作熔断端或评判器。