本地模型

本地模型窗格直接在你的 Mac 上运行编码模型,因此工作区的代理可以完全在设备端作答,而无需调用云端提供商——或仅在云端不可达时才回退到本地模型。权重是 Apple MLX 构建版本;推理引擎已随应用捆绑,因此除下载模型之外无需安装任何东西。

本页的每个主题都有配套的深入讲解:设备端引擎、工具调用修复层、混合回退策略,以及 bromure-cli modelbromure-cli vm routing 命令都在 本地模型 中。本页介绍的是设置窗格。

编辑工作区窗口的本地模型窗格,显示启用本地模型开关处于关闭状态,标注为在此 Mac 上运行编码模型而非使用云端

默认情况下,该窗格只显示一个开关——启用本地模型——其余内容全部隐藏。将其打开会显示下文所述的路由模式和模型目录。

启用本地模型

这个主开关标注为在此 Mac 上运行编码模型而非使用云端。,是工作区设备端推理的开/关:

  • 关闭(默认)——工作区将代理流量路由到云端,就如同此窗格不存在一样。
  • 开启——路由切换为设备端推理,并显示模式选择器和模型列表。打开它时,模式默认为本地

由于此项开启时工作区的代理会将其 LLM 流量通过本地引擎运行,因此启用它会将每个已启用代理的认证模式固定为本地模型,而重新关闭它会恢复每个代理之前的模式。你无需手动操作 代理 窗格。

路由模式

启用本地模型后,单选按钮决定工作区如何使用它们。两行各自带有窗格自身的脚注说明:

模式行为
本地——始终设备端每个请求都留在此 Mac 上——没有任何内容离开本机。回复是私密的,但速度较慢,并受限于你能在内存中容纳的模型。
混合——云端,回退到本地请求照常发往云端,仅在云端不可达时才回退到设备端模型——兼具云端的速度与质量以及本地的安全网。

混合模式的更精细选项——滚动的云端令牌预算、首个令牌到达时间的截止期限,以及主动的本地/云端拆分——是通过命令行(bromure-cli vm hybrid …)调整的,而非此窗格。它们记录在 本地模型 中。

模型目录

在模式选择器下方,列表的标题为模型 · N GB 统一内存,其中 N 是你 Mac 的统一内存。每一行描述一个精选的 MLX 模型:

  • 活动模型单选按钮——实心圆点标记此工作区所服务的唯一模型。在此处选择它也会将已启用的代理切换为本地模型认证。
  • 等级徽章——一个小的 S / M / L / XL 大小类别。
  • 适配徽章——模型相对于你 Mac 内存的情况:适配(绿色——余量充裕)、紧张(橙色——加载后所剩无几),或无法容纳(灰显;该行被禁用,无法选择)。窗格的脚注重申了这一点:灰显的模型所需内存超过此 Mac 所拥有的内存。
  • 下载大小——磁盘上的权重大小,以 GB 计。
  • tools 印章——已验证其工具调用可用于代理的模型上的一个对勾徽章。

每行末尾的控件反映其下载状态:

状态控件
未下载下载按钮(当模型无法容纳时禁用)。
下载中带有字节标签的进度条和一个停止(✕)按钮。
已中断(应用在拉取过程中被终止)已中断,带有一个继续按钮和一个丢弃(垃圾桶)按钮。
失败一个重试按钮(悬停可查看错误消息)。
已安装已安装,带有一个提供移除的菜单。

注意: 下载是即时且全局的——你在此拉取的模型会存入共享存储,并对每个工作区可用,而不仅仅是这一个。相比之下,路由模式和活动模型的选择是按工作区的,仅在你点击存储时生效。

合并内存警告

此工作区所选的本地模型——活动模型,加上任何设置为本地模型认证的代理,以及任何 Fusion 本地端或评判器——在一个引擎中并行加载,因此它们的内存需求会累加。当它们接近你 Mac 的 RAM 时,列表上方会显示一条警告:接近宿主机内存时为橙色,超过时为红色。它会说明它们合计需要多少内存,并建议你去掉一个或选择更小的模型。

设置参考

设置说明
启用本地模型设备端推理的主开关。开启会将路由设为本地;关闭会恢复为云端。默认:关闭(云端)。
模式单选按钮:本地——始终设备端 / 混合——云端,回退到本地。默认:启用时为本地
活动模型每行一个单选圆点;工作区所服务的唯一模型。默认:无——你下载的第一个模型会被自动选中。
下载 / 已安装 / 移除按模型的操作。即时且全局(跨工作区共享);不属于存储事务的一部分。

相关章节

  • 本地模型 —— 完整介绍设备端引擎、模型目录与 CLI,以及混合回退策略。
  • 代理 —— 此窗格保持同步的按代理的本地模型认证模式。
  • Fusion —— 将本地模型用作熔断端或评判器。