Lokale Modelle

Der Bereich Lokale Modelle betreibt ein Coding-Modell auf Ihrem Mac selbst — oder auf einem eigenen Inferenzserver —, sodass die Agenten eines Arbeitsbereichs vollständig ohne Cloud antworten können oder nur dann auf ein lokales Modell zurückgreifen, wenn die Cloud nicht erreichbar ist. Mit der eingebauten Engine sind die Gewichte Apple-MLX-Builds, und außer dem Herunterladen eines Modells ist nichts zu installieren; mit einer benutzerdefinierten Engine richten Sie den Arbeitsbereich auf einen beliebigen OpenAI-kompatiblen Server.

Alles auf dieser Seite hat eine begleitende Vertiefung: die On-Device-Engine, die Reparaturschicht für Tool-Calls, die hybride Fallback-Richtlinie sowie die Befehle bromure-cli model und bromure-cli vm routing finden Sie vollständig unter Lokale Modelle. Diese Seite dokumentiert den Einstellungsbereich.

Der Bereich Lokale Modelle im Fenster Arbeitsbereich bearbeiten, mit dem ausgeschalteten Schalter Lokale Modelle aktivieren und der Bildunterschrift Ein Coding-Modell auf diesem Mac statt in der Cloud betreiben

Standardmäßig zeigt der Bereich einen einzigen Schalter — Lokale Modelle aktivieren — wobei alles andere ausgeblendet ist. Beim Einschalten werden der Routing-Modus und der unten beschriebene Modellkatalog eingeblendet.

Lokale Modelle aktivieren

Der Hauptschalter mit der Bildunterschrift Ein Coding-Modell auf diesem Mac statt in der Cloud betreiben. ist der Ein/Aus-Schalter des Arbeitsbereichs für On-Device-Inferenz:

  • Aus (Standard) — der Arbeitsbereich leitet den Agenten-Verkehr in die Cloud, genau so, als gäbe es diesen Bereich nicht.
  • Ein — das Routing wechselt zur On-Device-Inferenz und die Modusauswahl sowie die Modellliste erscheinen. Beim Einschalten ist der Modus standardmäßig auf Lokal gesetzt.

Da die Agenten des Arbeitsbereichs ihren LLM-Verkehr über die lokale Engine leiten, solange dies aktiviert ist, fixiert die Aktivierung den Auth-Modus jedes aktivierten Agenten auf Lokales Modell, und das Ausschalten stellt den vorherigen Modus jedes Agenten wieder her. Sie müssen den Bereich Agenten nicht von Hand anfassen.

Engine

Bei aktivierten lokalen Modellen legt eine Engine-Auswahl fest, wo die Inferenz läuft:

  • Eingebaut — Modelle laufen auf diesem Mac. Die mitgelieferte, prozessinterne MLX-Engine und der Standard. Der Modellkatalog weiter unten gilt.
  • Benutzerdefinierter Server — Ihr eigener vLLM, Ollama, …. Jeder OpenAI-kompatible Server, auf diesem Mac oder auf einer anderen Maschine. Ein Feld Server-URL (z. B. http://127.0.0.1:11434) und ein optionaler API-Schlüssel erscheinen, dazu eine Schaltfläche Verbindung testen, die den Server prüft und Verbunden — N Modell(e) verfügbar oder den echten Fehler des Servers meldet. Wie die Fußzeile des Bereichs es formuliert: Die Agenten sprechen weiterhin ihre nativen APIs; Bromure übersetzt dazwischen.

Mit einer benutzerdefinierten Engine wird der Katalog durch einen Abschnitt Modell ersetzt: ein freies Feld Modell-ID (z. B. qwen3-coder:30b) sowie die Liste der IDs, die der Server unter /v1/models meldet — testen Sie die Verbindung, um sie aufzulisten, und holen Sie das Modell bei Ollama zuerst. Die Vertiefung ist Ihre eigene Engine verwenden.

Routing-Modus

Bei aktivierten lokalen Modellen legt eine Auswahl fest, wie der Arbeitsbereich sie nutzt. Die beiden Zeilen tragen die eigenen Fußzeilenbeschreibungen des Bereichs:

ModusVerhalten
Lokal — immer On-DeviceJede Anfrage bleibt auf diesem Mac — nichts verlässt die Maschine. Antworten sind privat, aber langsamer und durch das Modell begrenzt, das in den Speicher passt.
Hybrid — Cloud, Fallback auf lokalAnfragen gehen wie üblich in die Cloud und greifen nur dann auf das On-Device-Modell zurück, wenn die Cloud nicht erreichbar ist — Cloud-Geschwindigkeit und -Qualität mit lokalem Sicherheitsnetz.

Die feineren Stellschrauben des Hybrid-Modus — ein rollierendes Cloud-Token-Budget, eine Time-to-First-Token-Frist und eine proaktive Aufteilung zwischen lokal und Cloud — werden über die Kommandozeile (bromure-cli vm hybrid …) statt in diesem Bereich eingestellt. Sie sind unter Lokale Modelle dokumentiert.

Der Modellkatalog

Unterhalb der Modusauswahl ist die Liste mit Modelle · N GB gemeinsamer Speicher überschrieben, wobei N der gemeinsame Speicher Ihres Macs ist. Jede Zeile beschreibt ein kuratiertes MLX-Modell:

  • Radio für aktives Modell — der gefüllte Punkt markiert das einzige Modell, das dieser Arbeitsbereich bereitstellt. Die Auswahl hier ist auch das, was aktivierte Agenten auf die Auth Lokales Modell umstellt.
  • Tier-Badge — eine kleine Größenklasse S / M / L / XL.
  • Fit-Badge — wie das Modell zum Speicher Ihres Macs passt: Passt (grün — komfortabler Spielraum), Knapp (orange — lädt mit wenig Reserve) oder Passt nicht (ausgegraut; die Zeile ist deaktiviert und kann nicht ausgewählt werden). Die Fußzeile des Bereichs wiederholt es: Ausgegraute Modelle benötigen mehr Speicher, als dieser Mac hat.
  • Downloadgröße — die Gewichtsgröße auf der Festplatte in GB.
  • tools-Siegel — ein Häkchen-Badge bei Modellen, deren Tool-Calling für den Agenten-Einsatz verifiziert wurde.

Das Steuerelement am Ende jeder Zeile spiegelt ihren Download-Status wider:

StatusSteuerelement
Nicht heruntergeladenSchaltfläche Herunterladen (deaktiviert, wenn das Modell nicht passt).
Wird heruntergeladenEin Fortschrittsbalken mit Byte-Bezeichnung und einer Stopp-Schaltfläche (✕).
Unterbrochen (die App wurde mitten im Abruf beendet)Unterbrochen, mit einer Schaltfläche Fortsetzen und einer Verwerfen-Schaltfläche (Papierkorb).
FehlgeschlagenEine Schaltfläche Wiederholen (Fehlermeldung beim Überfahren mit der Maus).
InstalliertInstalliert, mit einem Menü, das Entfernen anbietet.

Hinweis: Downloads sind sofort wirksam und global — ein Modell, das Sie hier abrufen, landet im gemeinsamen Speicher und wird für jeden Arbeitsbereich verfügbar, nicht nur für diesen. Der Routing-Modus und die Wahl des aktiven Modells sind hingegen pro Arbeitsbereich und werden erst wirksam, wenn Sie auf Sichern klicken.

Warnung bei kombiniertem Speicher

Die von diesem Arbeitsbereich ausgewählten lokalen Modelle — das aktive Modell sowie jeder auf die Auth Lokales Modell gesetzte Agent und jeder lokale Fusion-Zweig oder Judge — werden parallel in einer Engine geladen, sodass sich ihre Speicheranforderungen summieren. Wenn sie sich dem RAM Ihres Macs nähern, erscheint eine Warnung über der Liste: orange, wenn sie dem Speicher des Hosts nahekommen, rot, wenn sie ihn überschreiten. Sie gibt an, wie viel sie zusammen benötigen, und schlägt vor, eines zu entfernen oder kleinere Modelle zu wählen.

Einstellungsreferenz

EinstellungBeschreibung
Lokale Modelle aktivierenHauptschalter für lokale Inferenz. Ein setzt das Routing auf Lokal; Aus stellt Cloud wieder her. Standard: aus (Cloud).
EngineRadio: Eingebaut (prozessinternes MLX) / Benutzerdefinierter Server (OpenAI-kompatible URL + optionaler API-Schlüssel, mit Verbindung testen). Standard: Eingebaut.
Modell-ID (benutzerdefinierte Engine)Die eigene Modell-ID des Servers, eingetippt oder aus seiner /v1/models-Liste gewählt.
ModusRadio: Lokal — immer On-Device / Hybrid — Cloud, Fallback auf lokal. Standard: Lokal, wenn aktiviert.
Aktives ModellRadio-Punkt pro Zeile; das eine Modell, das der Arbeitsbereich bereitstellt. Standard: keines — das erste heruntergeladene Modell wird automatisch ausgewählt.
Herunterladen / Installiert / EntfernenAktion pro Modell. Sofort wirksam und global (über Arbeitsbereiche hinweg geteilt); nicht Teil der Sichern-Transaktion.

Verwandte Kapitel

  • Lokale Modelle — die On-Device-Engine, der Modellkatalog und die CLI sowie die hybride Fallback-Richtlinie in voller Ausführlichkeit.
  • Agenten — der Auth-Modus Lokales Modell pro Agent, den dieser Bereich synchron hält.
  • Fusion — die Verwendung eines lokalen Modells als Fuse-Zweig oder als Judge.