Modelos locais

O painel Modelos locais executa um modelo de programação no próprio Mac — ou num servidor de inferência seu — para que os agentes de um espaço de trabalho possam responder inteiramente fora da nuvem, ou recorrer a um modelo local apenas quando a nuvem estiver inacessível. Com o motor incorporado, os pesos são compilações Apple MLX e não há nada a instalar além de descarregar um modelo; com um motor personalizado, aponta o espaço de trabalho para qualquer servidor compatível com OpenAI.

Tudo o que consta nesta página tem um aprofundamento complementar: o motor no dispositivo, a camada de reparação de chamadas de ferramentas, a política de recurso híbrido e os comandos bromure-cli model e bromure-cli vm routing estão todos em Modelos locais. Esta página documenta o painel de definições.

O painel Modelos locais da janela Editar espaço de trabalho, a mostrar o interruptor Ativar modelos locais desligado com a legenda Execute um modelo de programação neste Mac em vez da nuvem

Por predefinição, o painel mostra um único interruptor — Ativar modelos locais — com tudo o resto oculto. Ao ligá-lo, revela o modo de encaminhamento e o catálogo de modelos descritos abaixo.

Ativar modelos locais

O interruptor principal, com a legenda Execute um modelo de programação neste Mac em vez da nuvem., é o ligar/desligar do espaço de trabalho para a inferência no dispositivo:

  • Desligado (predefinição) — o espaço de trabalho encaminha o tráfego dos agentes para a nuvem, exatamente como se este painel não existisse.
  • Ligado — o encaminhamento passa para a inferência no dispositivo e surgem o seletor de modo e a lista de modelos. Ao ligá-lo, o modo assume por predefinição Local.

Como os agentes do espaço de trabalho encaminham o seu tráfego de LLM através do motor local enquanto isto está ligado, ativá-lo fixa o modo de autenticação de todos os agentes ativados em Modelo local, e voltar a desligá-lo restaura o modo anterior de cada agente. Não tem de mexer no painel Agentes manualmente.

Motor

Com os modelos locais ativados, um botão de opção Motor decide onde é executada a inferência:

  • Incorporado — os modelos são executados neste Mac. O motor MLX incorporado no processo, e a predefinição. Aplica-se o catálogo de modelos abaixo.
  • Servidor personalizado — o seu próprio vLLM, Ollama, …. Qualquer servidor compatível com OpenAI, neste Mac ou noutra máquina. Aparecem um campo URL do servidor (por exemplo http://127.0.0.1:11434) e uma chave de API opcional, além de um botão Testar ligação que sonda o servidor e reporta Ligado — N modelo(s) disponível(eis) ou o erro real do servidor. Como diz o rodapé do painel: os agentes continuam a falar as suas APIs nativas; o Bromure traduz pelo meio.

Com um motor personalizado, o catálogo é substituído por uma secção Modelo: um campo livre ID do modelo (por exemplo qwen3-coder:30b) mais a lista de IDs que o servidor comunica em /v1/models — teste a ligação para os listar e, no Ollama, descarregue primeiro o modelo. O aprofundamento está em Usar o seu próprio motor.

Modo de encaminhamento

Com os modelos locais ativados, um botão de opção escolhe como o espaço de trabalho os utiliza. As duas linhas contêm as próprias descrições do rodapé do painel:

ModoComportamento
Local — sempre no dispositivoTodos os pedidos permanecem neste Mac — nada sai da máquina. As respostas são privadas mas mais lentas, e limitadas pelo modelo que conseguir alojar em memória.
Híbrido — nuvem, com recurso ao localOs pedidos vão para a nuvem como habitualmente, recorrendo ao modelo no dispositivo apenas quando a nuvem estiver inacessível — a velocidade e a qualidade da nuvem com uma rede de segurança local.

Os ajustes mais finos do modo Híbrido — um orçamento contínuo de tokens de nuvem, um prazo de tempo até ao primeiro token e uma divisão proativa local/nuvem — são afinados a partir da linha de comandos (bromure-cli vm hybrid …) e não neste painel. Estão documentados em Modelos locais.

O catálogo de modelos

Abaixo do seletor de modo, a lista tem o título Models · N GB unified memory, onde N é a memória unificada do seu Mac. Cada linha descreve um modelo MLX selecionado:

  • Botão de opção do modelo ativo — o ponto preenchido marca o único modelo que este espaço de trabalho serve. Selecioná-lo aqui é também o que muda os agentes ativados para a autenticação Modelo local.
  • Distintivo de nível — uma pequena classe de tamanho S / M / L / XL.
  • Distintivo de compatibilidade — como o modelo se ajusta à memória do seu Mac: Fits (verde — margem confortável), Tight (laranja — carrega com pouca folga) ou Won't fit (a cinzento; a linha está desativada e não pode ser selecionada). O rodapé do painel reitera-o: Os modelos a cinzento precisam de mais memória do que este Mac tem.
  • Tamanho de descarga — o tamanho dos pesos em disco, em GB.
  • Selo de ferramentas — um distintivo de visto nos modelos cuja chamada de ferramentas foi verificada para uso por agentes.

O controlo no final de cada linha reflete o seu estado de descarga:

EstadoControlo
Não descarregadoBotão Descarregar (desativado quando o modelo não couber).
A descarregarUma barra de progresso com uma etiqueta de bytes e um botão de paragem (✕).
Interrompido (a aplicação foi encerrada a meio da transferência)Interrompido, com um botão Retomar e um botão de descarte (lixo).
FalhouUm botão Repetir (passe o rato para ver a mensagem de erro).
InstaladoInstalado, com um menu que oferece Remover.

Nota: As descargas são imediatas e globais — um modelo que descarregue aqui fica no armazenamento partilhado e passa a estar disponível para todos os espaços de trabalho, não apenas este. O modo de encaminhamento e a escolha do modelo ativo, em contrapartida, são por espaço de trabalho e só têm efeito quando clica em Guardar.

Aviso de memória combinada

Os modelos locais que este espaço de trabalho selecionou — o modelo ativo, mais qualquer agente definido para a autenticação Modelo local e qualquer perna local ou juiz de Fusion — carregam em paralelo num único motor, pelo que os seus requisitos de memória se somam. Quando se aproximam da RAM do seu Mac, surge um aviso acima da lista: laranja quando estão próximos da memória do anfitrião, vermelho quando a excedem. Indica quanta memória precisam em conjunto e sugere que remova um ou escolha modelos mais pequenos.

Referência de definições

DefiniçãoDescrição
Ativar modelos locaisInterruptor principal para a inferência local. Ligado define o encaminhamento como Local; desligado restaura Cloud. Predefinição: desligado (Cloud).
MotorBotão de opção: Incorporado (MLX no processo) / Servidor personalizado (URL compatível com OpenAI + chave de API opcional, com Testar ligação). Predefinição: Incorporado.
ID do modelo (motor personalizado)O ID de modelo do próprio servidor, escrito ou escolhido a partir da sua lista /v1/models.
ModoBotão de opção: Local — sempre no dispositivo / Híbrido — nuvem, com recurso ao local. Predefinição: Local quando ativado.
Modelo ativoPonto de opção por linha; o único modelo que o espaço de trabalho serve. Predefinição: nenhum — o primeiro modelo que descarregar é selecionado automaticamente.
Descarregar / Instalado / RemoverAção por modelo. Imediata e global (partilhada entre espaços de trabalho); não faz parte da transação Guardar.

Capítulos relacionados

  • Modelos locais — o motor no dispositivo, o catálogo de modelos e a CLI, e a política de recurso híbrido na íntegra.
  • Agentes — o modo de autenticação Modelo local por agente que este painel mantém sincronizado.
  • Fusion — usar um modelo local como perna de fusão ou como juiz.