Modelos locais
O painel Modelos locais executa um modelo de programação no próprio Mac — ou num servidor de inferência seu — para que os agentes de um espaço de trabalho possam responder inteiramente fora da nuvem, ou recorrer a um modelo local apenas quando a nuvem estiver inacessível. Com o motor incorporado, os pesos são compilações Apple MLX e não há nada a instalar além de descarregar um modelo; com um motor personalizado, aponta o espaço de trabalho para qualquer servidor compatível com OpenAI.
Tudo o que consta nesta página tem um aprofundamento complementar: o motor no dispositivo, a camada de reparação de chamadas de ferramentas, a política de recurso híbrido e os comandos bromure-cli model e bromure-cli vm routing estão todos em Modelos locais. Esta página documenta o painel de definições.
Por predefinição, o painel mostra um único interruptor — Ativar modelos locais — com tudo o resto oculto. Ao ligá-lo, revela o modo de encaminhamento e o catálogo de modelos descritos abaixo.
Ativar modelos locais
O interruptor principal, com a legenda Execute um modelo de programação neste Mac em vez da nuvem., é o ligar/desligar do espaço de trabalho para a inferência no dispositivo:
- Desligado (predefinição) — o espaço de trabalho encaminha o tráfego dos agentes para a nuvem, exatamente como se este painel não existisse.
- Ligado — o encaminhamento passa para a inferência no dispositivo e surgem o seletor de modo e a lista de modelos. Ao ligá-lo, o modo assume por predefinição Local.
Como os agentes do espaço de trabalho encaminham o seu tráfego de LLM através do motor local enquanto isto está ligado, ativá-lo fixa o modo de autenticação de todos os agentes ativados em Modelo local, e voltar a desligá-lo restaura o modo anterior de cada agente. Não tem de mexer no painel Agentes manualmente.
Motor
Com os modelos locais ativados, um botão de opção Motor decide onde é executada a inferência:
- Incorporado — os modelos são executados neste Mac. O motor MLX incorporado no processo, e a predefinição. Aplica-se o catálogo de modelos abaixo.
- Servidor personalizado — o seu próprio vLLM, Ollama, …. Qualquer servidor compatível com OpenAI, neste Mac ou noutra máquina. Aparecem um campo URL do servidor (por exemplo
http://127.0.0.1:11434) e uma chave de API opcional, além de um botão Testar ligação que sonda o servidor e reporta Ligado — N modelo(s) disponível(eis) ou o erro real do servidor. Como diz o rodapé do painel: os agentes continuam a falar as suas APIs nativas; o Bromure traduz pelo meio.
Com um motor personalizado, o catálogo é substituído por uma secção Modelo: um campo livre ID do modelo (por exemplo qwen3-coder:30b) mais a lista de IDs que o servidor comunica em /v1/models — teste a ligação para os listar e, no Ollama, descarregue primeiro o modelo. O aprofundamento está em Usar o seu próprio motor.
Modo de encaminhamento
Com os modelos locais ativados, um botão de opção escolhe como o espaço de trabalho os utiliza. As duas linhas contêm as próprias descrições do rodapé do painel:
| Modo | Comportamento |
|---|---|
| Local — sempre no dispositivo | Todos os pedidos permanecem neste Mac — nada sai da máquina. As respostas são privadas mas mais lentas, e limitadas pelo modelo que conseguir alojar em memória. |
| Híbrido — nuvem, com recurso ao local | Os pedidos vão para a nuvem como habitualmente, recorrendo ao modelo no dispositivo apenas quando a nuvem estiver inacessível — a velocidade e a qualidade da nuvem com uma rede de segurança local. |
Os ajustes mais finos do modo Híbrido — um orçamento contínuo de tokens de nuvem, um prazo de tempo até ao primeiro token e uma divisão proativa local/nuvem — são afinados a partir da linha de comandos (bromure-cli vm hybrid …) e não neste painel. Estão documentados em Modelos locais.
O catálogo de modelos
Abaixo do seletor de modo, a lista tem o título Models · N GB unified memory, onde N é a memória unificada do seu Mac. Cada linha descreve um modelo MLX selecionado:
- Botão de opção do modelo ativo — o ponto preenchido marca o único modelo que este espaço de trabalho serve. Selecioná-lo aqui é também o que muda os agentes ativados para a autenticação Modelo local.
- Distintivo de nível — uma pequena classe de tamanho
S/M/L/XL. - Distintivo de compatibilidade — como o modelo se ajusta à memória do seu Mac: Fits (verde — margem confortável), Tight (laranja — carrega com pouca folga) ou Won't fit (a cinzento; a linha está desativada e não pode ser selecionada). O rodapé do painel reitera-o: Os modelos a cinzento precisam de mais memória do que este Mac tem.
- Tamanho de descarga — o tamanho dos pesos em disco, em GB.
- Selo de ferramentas — um distintivo de visto nos modelos cuja chamada de ferramentas foi verificada para uso por agentes.
O controlo no final de cada linha reflete o seu estado de descarga:
| Estado | Controlo |
|---|---|
| Não descarregado | Botão Descarregar (desativado quando o modelo não couber). |
| A descarregar | Uma barra de progresso com uma etiqueta de bytes e um botão de paragem (✕). |
| Interrompido (a aplicação foi encerrada a meio da transferência) | Interrompido, com um botão Retomar e um botão de descarte (lixo). |
| Falhou | Um botão Repetir (passe o rato para ver a mensagem de erro). |
| Instalado | Instalado, com um menu que oferece Remover. |
Nota: As descargas são imediatas e globais — um modelo que descarregue aqui fica no armazenamento partilhado e passa a estar disponível para todos os espaços de trabalho, não apenas este. O modo de encaminhamento e a escolha do modelo ativo, em contrapartida, são por espaço de trabalho e só têm efeito quando clica em Guardar.
Aviso de memória combinada
Os modelos locais que este espaço de trabalho selecionou — o modelo ativo, mais qualquer agente definido para a autenticação Modelo local e qualquer perna local ou juiz de Fusion — carregam em paralelo num único motor, pelo que os seus requisitos de memória se somam. Quando se aproximam da RAM do seu Mac, surge um aviso acima da lista: laranja quando estão próximos da memória do anfitrião, vermelho quando a excedem. Indica quanta memória precisam em conjunto e sugere que remova um ou escolha modelos mais pequenos.
Referência de definições
| Definição | Descrição |
|---|---|
| Ativar modelos locais | Interruptor principal para a inferência local. Ligado define o encaminhamento como Local; desligado restaura Cloud. Predefinição: desligado (Cloud). |
| Motor | Botão de opção: Incorporado (MLX no processo) / Servidor personalizado (URL compatível com OpenAI + chave de API opcional, com Testar ligação). Predefinição: Incorporado. |
| ID do modelo (motor personalizado) | O ID de modelo do próprio servidor, escrito ou escolhido a partir da sua lista /v1/models. |
| Modo | Botão de opção: Local — sempre no dispositivo / Híbrido — nuvem, com recurso ao local. Predefinição: Local quando ativado. |
| Modelo ativo | Ponto de opção por linha; o único modelo que o espaço de trabalho serve. Predefinição: nenhum — o primeiro modelo que descarregar é selecionado automaticamente. |
| Descarregar / Instalado / Remover | Ação por modelo. Imediata e global (partilhada entre espaços de trabalho); não faz parte da transação Guardar. |
Capítulos relacionados
- Modelos locais — o motor no dispositivo, o catálogo de modelos e a CLI, e a política de recurso híbrido na íntegra.
- Agentes — o modo de autenticação Modelo local por agente que este painel mantém sincronizado.
- Fusion — usar um modelo local como perna de fusão ou como juiz.