Zurück zu allen Beiträgen
Veröffentlicht am · von Renaud Deraison

Bromure Agentic Coding hat jetzt einen Fusion-Modus

OpenRouter hat ein bemerkenswertes Ergebnis veröffentlicht: Ein Panel aus Modellen, beurteilt und synthetisiert, schlägt jedes einzelne Spitzenmodell. Wir haben diese Technik von Grund auf in Bromure Agentic Coding nachgebaut — nichts läuft über OpenRouter. Da das Produkt ohnehin auf der Leitung zwischen Ihrem Coding-Agenten und den Modell-APIs sitzt, setzt Version 3.0 unser eigenes Fusion genau dorthin. Legen Sie das ⚡ in der Titelleiste um, und jeder Prompt wird von bis zu drei Modellen gleichzeitig beantwortet. Ein Judge gleicht sie ab, ein Synthesizer schreibt das Ergebnis, und Claude Code bekommt eine Antwort zurück, als hätte ein einzelnes Modell sie verfasst. Sie bringen Ihre eigenen Keys oder Abos mit, und der Trace hält jeden Leg fest.

Letzten Monat hat OpenRouter uns etwas gezeigt, das wir sofort haben wollten: ein Panel aus Modellen, bei dem eines das Panel beurteilt und ein anderes das Verdikt ausformuliert, schlägt das einzelne beste Modell auf dem Brett. Es befragt mehrere Modelle zugleich und synthetisiert ihre Antworten zu einer. Ihre Fusion-Schlagzeile landete bei 69,0 % auf einem Deep-Research-Benchmark, auf dem Fable 5 allein 65,3 % erreichte. Wir haben nicht ihren Dienst angezapft, sondern die Technik selbst nachgebaut — eine Ebene tiefer, in dem Proxy, durch den Ihr Coding-Agent ohnehin schon spricht. Bromure Agentic Coding 3.0 liefert es als einen einzigen Blitz aus.

Der Mechanismus ist schlicht. Sie schicken den Prompt parallel an mehrere Modelle. Ein Judge liest jede Antwort und markiert die Übereinstimmungen, die Konflikte, was jedes Modell für sich erfasst hat und was alle übersehen haben. Ein Synthesizer schreibt dann die finale Antwort aus dieser Analyse, statt die Entwürfe nach Augenmaß zu beurteilen. OpenRouters Fusion-Bericht legt den Mechanismus offen, den wir nachgebaut haben, und die Größe des Zugewinns hat uns überrascht: in einem Fall hob das Paaren eines Modells mit sich selbst den Score immer noch an. Der größte Teil des Zugewinns kommt aus diesem Syntheseschritt.

Wir wussten, wo wir es haben wollten. Bromure Agentic Coding führt Ihren Agenten in einer wegwerfbaren Linux-VM aus, während ein Man-in-the-Middle-Proxy auf dem Host jedes Byte beobachtet, das er an api.anthropic.com sendet. Wir halten die Leitung ohnehin schon, also läuft das Panel genau dort, wo Ihr Code, Ihre Prompts und Ihre Credentials niemals einen Umweg über den Router eines anderen machen. Fusion ist ein Verhalten dieses Proxys. Es verwandelt eine ausgehende Claude-Anfrage in ein kurzes Komiteetreffen und gibt eine einzige Antwort in der Wire-Form zurück, die der Agent erwartet hat. Claude Code erfährt nie, dass GPT-5.5 und Grok im Raum waren.

Ein einziger Blitz.

Fusion hat ein Bedienelement, in der Titelleiste des Agenten-Sitzungsfensters.

Titelleiste der Agentensitzung mit dem Fusion-Blitz in Dunkelgrau, deaktiviert
deaktiviert · grauer Blitz
Titelleiste der Agentensitzung mit dem gelb leuchtenden Fusion-Blitz, aktiviert
aktiviert · gelber Blitz
Die ganze UI für Fusion: das ⚡ in der Titelleiste der Sitzung. Links ist es deaktiviert, ein ausgefüllter Blitz in Dunkelgrau, in dieser Sitzung verfügbar, aber aus. Rechts leuchtet es gelb, aktiviert. Mit weniger als zwei konfigurierten Modellen wird der Blitz hohl und deaktiviert, denn ein Panel aus einem ist einfach nur ein Modell. Die 192.168.64.2 in der Adressleiste ist die profilspezifische VM, in der der Agent läuft, und das ist die Leitung, auf der Fusion sitzt.

Fusion läuft auf der Claude Code-Sitzung, denn es fängt Claudes /v1/messages-API ab, die Anfrage, die es aufzufächern und wieder zusammenzusetzen weiß. Sie konfigurieren zwei oder drei Agenten mit Credentials im Agents-Tab des Profils, wählen, welche Anbieter dem Panel beitreten und welches Modell als Judge fungiert, und von da an berühren Sie nur noch den Blitz. Grau heißt aus, schlichtes Claude. Gelb heißt an, das Komitee tritt zusammen. Der Blitz ist ein Laufzeit-Flag, also können Sie ihn mitten in der Sitzung umschalten, ohne Neustart.

Was auf der Leitung passiert.

Bei gelbem Blitz tut der Proxy mehr, als die Anfrage des Agenten an Anthropic weiterzuleiten. Er führt die folgende Abfolge aus.

AUF DER LEITUNG · im MITM-Proxy der profilspezifischen VMCLAUDE CODE (in VM)POST /v1/messages model: claude-opus-4-8 stream: true tools: [bash, edit, …] glaubt: ein ModellLEG A · Claude · ZUERST gefragt, Tools intaktapi.anthropic.com · non-streaming · die echte AnfrageTEXT-Turn → fusionieren · TOOL-Turn → durchreichenDAS PANEL · dieselbe Frage, parallelLeg A · ClaudeEntwurf (schon vorhanden)Leg B · GPT-5.5api.openai.comLeg C · Grokapi.x.aiJUDGE · Opus 4.8analysiert die Entwürfe, stimmt nicht abKonsens · KonflikteEinzigartiges · blinde Fleckengibt JSON-Analyse aus, keine ProsaSYNTHESIZER · Opus 4.8schreibt EINE Antwort, verankertin der Analyse darüberNEU VERPACKEN · Claudes eigene id / model / usage-Hülle, Inhalt durch den fusionierten Text ersetztzurückgestreamt als Anthropic-SSE oder einzelner JSON-Body, in der Form, die der Agent angefragt hatSITZUNGS-TRACE · jeder Leg ist ein benannter SubCall: anthropic · openai · x.ai · judge · synth (der Agent setzte einen Aufruf ab)eine Antwort zurück an den Agenten
Fusions Pfad für einen Turn, der mit Ihnen spricht. Der Proxy fragt zuerst Claude und trägt die echte Anfrage des Agenten samt ihren Tools. Bei einer reinen Textantwort stellt er dem Rest des Panels dieselbe Frage, übergibt jeden Entwurf einem Judge, der eine strukturierte Analyse zurückgibt, und lässt einen Synthesizer die einzige finale Antwort aus dieser Analyse schreiben. Der Proxy verpackt das Ergebnis dann wieder in Claudes eigene Nachrichten-Hülle und streamt es in genau der Form zurück, die der Agent angefragt hat. Drei Modelle antworten, und der Agent liest eines.

Ein Detail hebt das von einer Demo ab: Der Proxy fragt zuerst Claude, und er fragt es vollständig. Leg A trägt die echte Anfrage des Agenten, Tools und vollständiges Transkript intakt, an Anthropic gesendet mit dem echten Credential. Der Proxy erzwingt sie non-streaming, damit er die ganze Antwort lesen kann, bevor er entscheidet, was zu tun ist. Die Routing-Entscheidung hängt an dieser ersten Antwort.

Ein Coding-Agent verändert das Problem.

Fusion in einem Coding-Agenten stellt ein anderes Problem als Fusion in einer Chatbox, und das ist der Teil, auf den ich am stolzesten bin.

In einem Chat-Produkt ist fast jeder Turn Prosa, die ein Mensch lesen soll, genau das, wofür Beurteilen-und-Synthetisieren gebaut ist. In einer agentischen Schleife sind die meisten Turns Aktionen: bash mit npm test aufrufen, diese Datei bearbeiten. Jede ist ein tool_use-Block mit strukturiertem Input, auf dessen Ausführung das SDK wartet. Fusionieren Sie dort die Meinungen dreier Modelle zu einem Absatz, und Sie haben den Tool-Aufruf gelöscht, und die Schleife stockt. Fusion schaut, bevor es handelt. Es fragt Claude zuerst, damit es den Turn inspizieren kann, und routet dann anhand der Form der Antwort:

Claude antwortet zuerstnon-streaming · Tools intaktden Turn inspizierenwelche Form?TOOL-TURN → durchreichenstop_reason: tool_use (oder ein tool_use-Block)Claudes echte Antwort wortgetreu abspielenkein GPT · kein Judge · kein Synth · Schleife intaktTEXT-TURN → fusionierenstop_reason: end_turn, reine TextantwortPanel ausführen · beurteilen · synthetisierender Turn, der mit Ihnen spricht
Der Turn-Router liest Claudes erste Antwort. Ein Tool-Turn, alles mit einem tool_use-Block oder einem tool_use-Stop-Reason, ist eine Aktion, also spielt Fusion Claudes echte Antwort wortgetreu ab und überspringt das Panel: kein GPT-Aufruf, kein Judge, keine Synthese, kein Risiko, den Befehl abzuschneiden. Ein reiner Text-Turn, die Art, die mit Ihnen spricht, bekommt das volle Komitee. Der Router hält die agentische Schleife intakt.

Über den größten Teil einer Sitzung bleibt Fusion still. Die lange Strecke aus Tests-laufen-lassen, Fehler-lesen, Datei-patchen besteht nur aus Tool-Turns, die mit voller Geschwindigkeit direkt durchgereicht werden. Das Komitee tritt zusammen, wenn Claude erklärt statt handelt: die Architekturfrage, die finale Zusammenfassung dessen, was es gefunden hat. Auf solchen Turns zahlen sich eine zweite und dritte Meinung aus.

Der Judge analysiert, statt abzustimmen.

Die naive Version von „nutze drei Modelle“ ist eine Mehrheitsabstimmung, oder ein Modell zu fragen „welches ist am besten?“ und den Gewinner weiterzuleiten. Beides wirft das meiste Signal weg. Ein Panel schlägt ein Modell, weil die Modelle an unterschiedlichen Stellen falsch liegen, und eine Abstimmung zählt sie nur.

Der Judge produziert keine Antwort. Bekommt er die Frage und jeden beschrifteten Entwurf, gibt er eine strukturierte Analyse zurück und nichts sonst:

{
  "consensus":   [ "Punkte, in denen die Antworten übereinstimmen" ],
  "conflicts":   [ { "topic": "...", "positions": "wer sagt was" } ],
  "unique":      [ { "source": "Anbietername", "insight": "..." } ],
  "blind_spots": [ "was die Antworten übersehen oder falsch gemacht haben" ],
  "verdict":     "ein Satz dazu, welche Antwort die stärkste ist und warum"
}

Dieses JSON ist das eigentliche Produkt des Panels. Der Synthesizer nimmt die Frage und dieses JSON und schreibt die finale Antwort: Er löst die Konflikte in Richtung Korrektheit auf, lässt die einzigartigen Erkenntnisse einfließen, deckt die blinden Flecken ab und sagt nichts über das Panel. Er schreibt an Sie, als hätte er die Antwort von Anfang an gewusst.

Fusion legt sowohl den Judge als auch den Synthesizer standardmäßig auf Opus fest. Die Analyse und das Ausformulieren sind die qualitätskritischen Schritte, also führt Fusion sie auf dem starken Modell aus statt auf dem, was der Agent angefragt hat. Sie können den Judge im Fusion-Bereich ändern. Wir setzen ihn mit Absicht standardmäßig auf das starke Modell.

Fable, ganz ohne Fable.

Für einen Coding-Agenten ist die ehrliche Demo ein Build. Wir haben denselben Prompt einem einzelnen starken Modell und dem Panel übergeben, Blitz grau und dann Blitz gelb, und ausgeliefert, was jedes von beiden produziert hat:

Schreibe eine Website in node, die den User Agent in einer wunderschön gestalteten WebGL-Seite im Stil von Tron zurückspiegelt, schnell und dynamisch, die den Besucher umhauen soll.

⚡ grau · einzelnes Modell (Opus 4.8)
⚡ gelb · Fusion-Panel
Derselbe Prompt, derselbe Agent, ein Umschalter. Links der Blitz grau: ein einzelnes Modell, Opus 4.8. Rechts der Blitz gelb: ein Panel aus Claude + GPT-5.5 + Grok, von Opus beurteilt und synthetisiert. Fusion lässt die Dateibearbeitungen unangetastet, denn das sind Tool-Turns, die direkt durchgereicht werden, und bearbeitet nur die Turns, in denen der Agent laut nachdenkt. Die Seite des Panels ist die, die den Besucher umhaut.

Ein Prompt beweist für sich allein nichts. OpenRouter hat das eigentliche Messen gemacht: hundert Deep-Research-Aufgaben, Dutzende gewichteter Kriterien, ein Panel, das mehrere Punkte über dem besten einzelnen Modell landet, Fable 5 darunter. Der Mechanismus ist derselbe, auf Ihre eigenen Modelle gerichtet. Ein Panel aus Claude + GPT-5.5 + Grok, von Opus beurteilt und synthetisiert, schlägt jedes einzelne von ihnen, das allein antwortet, auf den Prosa-Turns einer Coding-Sitzung, Fable inklusive. Sie bekommen Output von Fable-Klasse, ohne dass Fable im Raum ist.

Modelle sind dafür berüchtigt, an einfachen Rätseln zu scheitern. Das Panel fängt die offensichtlichen Fehler ab, bevor sie Sie erreichen.

Eine Claude-Code-Sitzung mit aktiviertem Fusion: es zählt korrekt drei r in „strawberry“ und gibt eine maßvolle Antwort darauf, ob man zu einer 50 Meter entfernten Autowäsche laufen oder fahren soll
Fusion bei den zwei Fragen, die tausend Threads vom Typ „LLMs können gar nicht wirklich denken“ ausgelöst haben. Der Buchstabenzähl-Klassiker kommt korrekt zurück, drei r an den Positionen 3, 8, 9, und die Soll-ich-laufen-oder-fahren-Frage bekommt eine maßvolle Antwort statt einer selbstbewusst falschen. Drei Modelle checken einander gegen, also überleben die schwachen Antworten nicht.

Alles steht im Trace.

Hier ist der Teil, den nur Bromure für sich beanspruchen kann, und er ergibt sich daraus, wo Fusion lebt. Der Agent sitzt in einer VM, und jeder ausgehende Aufruf geht durch den Host-Proxy, also bleiben Fusions Nebenaufrufe sichtbar, auch wenn der Agent sie nicht sehen kann. Der Host hält jeden Leg fest, den Claude-Entwurf, den GPT-Entwurf, den Grok-Entwurf, den Judge-Durchlauf, den Synthese-Durchlauf, im selben Sitzungs-Trace wie alles andere, was der Agent getan hat.

EIN FUSIONIERTER TURN · wie aufgezeichnetleghostRollewireA · Claudeapi.anthropic.comEntwurf200 · 2.1 KBB · GPT-5.5api.openai.comEntwurf200 · 1.8 KBC · Grokapi.x.aiEntwurf200 · 1.6 KBjudgeapi.anthropic.comJSON-Analyse200 · 0.9 KBsynthapi.anthropic.comfinale Antwort200 · 2.4 KBSicht des Agenten: 1 Anfrage an Anthropic · Sicht des Trace: 5 Upstream-Aufrufe, alle zugeordnet
Was ein Admin für einen einzigen fusionierten Turn sieht. Der Agent glaubt, er habe einen Aufruf an Anthropic gemacht. Der Trace hält fünf fest: einen Claude-Entwurf, einen GPT-Entwurf bei api.openai.com, einen Grok-Entwurf bei api.x.ai, dann einen Judge- und einen Synthese-Durchlauf. Fusion bleibt für den Agenten transparent und für jeden, der die Sitzung prüft, lesbar, der Hausstil, auf den unsere Enterprise-Beiträge immer wieder zurückkommen.

Ein modellfusionierender Router, der seine Nebenaufrufe verstecken würde, würde einem Unternehmen eine ungeprüfte Kopie seiner Prompts und seines Codes übergeben, aufgefächert an zwei weitere Anbieter, ohne jede Aufzeichnung. Fusion fächert auf und schreibt jeden Aufruf mit. Ihr Security-Team kann fragen, warum api.openai.com einen Prompt bekommen hat, und die Antwort an einer Zeile im Trace ablesen: Der Blitz war gelb.

Der Preis von Fusion.

Fusion kostet Sie Zeit. Ein fusionierter Text-Turn führt das Panel aus und macht dann zwei zusätzliche Aufrufe an Opus, einen für die Analyse des Judge und einen für die Synthese. Sie laufen nacheinander, nach Claudes eigener Antwort, denn der Proxy muss diese Antwort lesen, bevor er entscheidet zu fusionieren. Ein fusionierter Turn ist langsamer als ein schlichter. Der Handel ist eng: Auf den Turns, die Ihnen Dinge erklären, warten Sie ein wenig länger auf eine bessere Antwort. Deshalb ist Fusion ein Blitz, den Sie umlegen, statt einer Voreinstellung, und deshalb berührt es die Prosa-Turns und lässt die Tool-Schleife in Ruhe.

Legen Sie den Blitz um.

Bromure Agentic Coding 3.0 setzt Fusion in die Titelleiste jeder Agentensitzung. Konfigurieren Sie zwei oder drei Agenten, wählen Sie einen Judge, und das ⚡ geht von hohl zu grau, dann zu gelb, wenn Sie das Komitee wollen. Ihr Coding-Agent verhält sich weiter so, als spräche er mit einem Modell, denn soweit er es beurteilen kann, tut er das. Der Trace zeigt die fünf Aufrufe hinter jeder Antwort.