Modèles locaux
Le volet Modèles locaux exécute un modèle de codage sur votre Mac lui-même — ou sur un serveur d'inférence qui vous appartient — afin que les agents d'un espace de travail puissent répondre entièrement hors du cloud, ou basculer vers un modèle local uniquement lorsque le cloud est inaccessible. Avec le moteur intégré, les poids sont des versions Apple MLX et il n'y a rien à installer hormis le téléchargement d'un modèle ; avec un moteur personnalisé, vous pointez l'espace de travail vers n'importe quel serveur compatible OpenAI.
Chaque élément de cette page dispose d'un approfondissement dédié : le moteur sur l'appareil, la couche de réparation des appels d'outils, la politique de repli hybride, ainsi que les commandes bromure-cli model et bromure-cli vm routing sont tous présentés dans Modèles locaux. Cette page documente le volet de réglages.
Par défaut, le volet affiche un seul commutateur — Activer les modèles locaux — et masque tout le reste. Son activation révèle le mode de routage et le catalogue de modèles décrits ci-dessous.
Activer les modèles locaux
Le commutateur principal, légendé Exécuter un modèle de codage sur ce Mac plutôt que dans le cloud., correspond à la bascule marche/arrêt de l'inférence sur l'appareil pour l'espace de travail :
- Désactivé (par défaut) — l'espace de travail achemine le trafic des agents vers le cloud, exactement comme si ce volet n'existait pas.
- Activé — le routage bascule vers l'inférence sur l'appareil et le sélecteur de mode ainsi que la liste des modèles apparaissent. Son activation règle le mode par défaut sur Local.
Comme les agents de l'espace de travail font transiter leur trafic LLM par le moteur local lorsque ceci est activé, l'activation épingle le mode d'authentification de chaque agent activé sur Modèle local, et sa désactivation restaure le mode précédent de chaque agent. Vous n'avez pas à toucher au volet Agents manuellement.
Moteur
Une fois les modèles locaux activés, un bouton radio Moteur décide de l'endroit où s'exécute l'inférence :
- Intégré — les modèles s'exécutent sur ce Mac. Le moteur MLX intégré au processus, et le choix par défaut. Le catalogue de modèles ci-dessous s'applique.
- Serveur personnalisé — votre propre vLLM, Ollama, …. N'importe quel serveur compatible OpenAI, sur ce Mac ou sur une autre machine. Un champ URL du serveur (par exemple
http://127.0.0.1:11434) et une clé d'API facultative apparaissent, ainsi qu'un bouton Tester la connexion qui sonde le serveur et signale Connecté — N modèle(s) disponible(s) ou l'erreur réelle du serveur. Comme le dit le pied du volet : les agents continuent de parler leurs API natives ; Bromure traduit entre les deux.
Avec un moteur personnalisé, le catalogue est remplacé par une section Modèle : un champ libre Id de modèle (par exemple qwen3-coder:30b) plus la liste des ids que le serveur annonce sur /v1/models — testez la connexion pour les lister, et sur Ollama, récupérez d'abord le modèle. L'exposé détaillé se trouve dans Utiliser votre propre moteur.
Mode de routage
Une fois les modèles locaux activés, un bouton radio détermine la façon dont l'espace de travail les utilise. Les deux lignes reprennent les descriptions du pied de page du volet :
| Mode | Comportement |
|---|---|
| Local — toujours sur l'appareil | Chaque requête reste sur ce Mac — rien ne quitte la machine. Les réponses sont privées mais plus lentes, et limitées par le modèle que vous pouvez faire tenir en mémoire. |
| Hybride — cloud, avec repli vers le local | Les requêtes vont au cloud comme d'habitude, avec un repli vers le modèle sur l'appareil uniquement lorsque le cloud est inaccessible — vitesse et qualité du cloud, avec un filet de sécurité local. |
Les réglages plus fins du mode hybride — un budget glissant de jetons cloud, un délai limite pour le premier jeton, et une répartition proactive local/cloud — se règlent en ligne de commande (bromure-cli vm hybrid …) plutôt que depuis ce volet. Ils sont documentés dans Modèles locaux.
Le catalogue de modèles
Sous le sélecteur de mode, la liste est intitulée Models · N GB unified memory, où N correspond à la mémoire unifiée de votre Mac. Chaque ligne décrit un modèle MLX sélectionné :
- Bouton radio du modèle actif — le point plein marque l'unique modèle que cet espace de travail sert. Le sélectionner ici bascule également les agents activés vers l'authentification Modèle local.
- Badge de catégorie — une petite classe de taille
S/M/L/XL. - Badge de compatibilité — indique comment le modèle se situe par rapport à la mémoire de votre Mac : Compatible (vert — marge confortable), Juste (orange — se charge avec peu de marge) ou Ne tient pas (grisé ; la ligne est désactivée et ne peut pas être sélectionnée). Le pied de page du volet le rappelle : Les modèles grisés nécessitent plus de mémoire que ce Mac n'en possède.
- Taille de téléchargement — la taille des poids sur le disque en GB.
- sceau tools — un badge en forme de coche sur les modèles dont l'appel d'outils a été vérifié pour un usage par les agents.
Le contrôle à l'extrémité de chaque ligne reflète son état de téléchargement :
| État | Contrôle |
|---|---|
| Non téléchargé | Bouton Télécharger (désactivé lorsque le modèle ne tient pas). |
| En cours de téléchargement | Une barre de progression avec une étiquette d'octets et un bouton d'arrêt (✕). |
| Interrompu (l'application a été arrêtée en cours de téléchargement) | Interrompu, avec un bouton Reprendre et un bouton de suppression (corbeille). |
| Échoué | Un bouton Réessayer (survolez pour afficher le message d'erreur). |
| Installé | Installé, avec un menu proposant Supprimer. |
Remarque : Les téléchargements sont immédiats et globaux — un modèle que vous récupérez ici arrive dans le stockage partagé et devient disponible pour tous les espaces de travail, pas uniquement celui-ci. Le mode de routage et le choix du modèle actif, en revanche, sont propres à chaque espace de travail et ne prennent effet que lorsque vous cliquez sur Enregistrer.
Avertissement de mémoire combinée
Les modèles locaux sélectionnés par cet espace de travail — le modèle actif, plus tout agent réglé sur l'authentification Modèle local et toute branche locale ou juge Fusion — se chargent en parallèle dans un seul moteur, de sorte que leurs besoins en mémoire s'additionnent. Lorsqu'ils approchent de la RAM de votre Mac, un avertissement apparaît au-dessus de la liste : orange lorsqu'ils sont proches de la mémoire de l'hôte, rouge lorsqu'ils la dépassent. Il indique la quantité dont ils ont besoin ensemble et suggère d'en retirer un ou de choisir des modèles plus petits.
Référence des réglages
| Réglage | Description |
|---|---|
| Activer les modèles locaux | Commutateur principal de l'inférence locale. Activé règle le routage sur Local ; désactivé restaure Cloud. Par défaut : désactivé (Cloud). |
| Moteur | Radio : Intégré (MLX intégré au processus) / Serveur personnalisé (URL compatible OpenAI + clé d'API facultative, avec Tester la connexion). Par défaut : Intégré. |
| Id de modèle (moteur personnalisé) | L'id de modèle propre au serveur, saisi ou choisi dans sa liste /v1/models. |
| Mode | Radio : Local — toujours sur l'appareil / Hybride — cloud, avec repli vers le local. Par défaut : Local une fois activé. |
| Modèle actif | Point radio par ligne ; l'unique modèle que l'espace de travail sert. Par défaut : aucun — le premier modèle que vous téléchargez est sélectionné automatiquement. |
| Télécharger / Installé / Supprimer | Action par modèle. Immédiate et globale (partagée entre les espaces de travail) ; ne fait pas partie de la transaction Enregistrer. |
Chapitres associés
- Modèles locaux — le moteur sur l'appareil, le catalogue de modèles et la CLI, ainsi que la politique de repli hybride dans leur intégralité.
- Agents — le mode d'authentification Modèle local par agent que ce volet maintient synchronisé.
- Fusion — utiliser un modèle local comme branche de fusion ou comme juge.