Es gibt eine Frage, die uns jeder Kunde bei der ersten Demo stellt: «Aber ein Modell, das hier drin läuft — wie viel dümmer ist es als ChatGPT?» Es ist die richtige Frage, und sie verdient Zahlen mit der Quelle daneben, keine Meinungen.
Der meistverwendete Massstab der Branche ist der Artificial Analysis Intelligence Index, der mehrere Benchmarks in einer einzigen Punktzahl kombiniert. Im August 2026 (Erhebung BenchLM) sagt die Rangliste Folgendes:
- Das Beste aus der Cloud: Claude Opus 5 mit 63.0, GPT-5.6 mit 58.9, Gemini 3.7 mit 56.0. Alle kostenpflichtig, pro Benutzer, mit Ihren Daten auf ihren Servern.
- Das Beste, das sich im Büro installieren lässt: DeepSeek V4 Pro mit 53.2, GLM-5.2 mit 52.6, DeepSeek V4 Flash mit 51.8. Alle Open Weight, mit Lizenzen, die die kommerzielle Nutzung erlauben, ausführbar auf einer Schreibtischmaschine.
Elf Punkte trennen das Beste aus der Cloud vom Besten, das im Büro läuft. 2024 war dieser Abstand ein Abgrund; heute ist er eine Differenz, die man beim Lesen von Verträgen, Vorbereiten von Entwürfen und Antworten aus einem Archiv nicht spürt.
Wie intelligent sie sind: die Cloud gegen Ihr Haus
Intelligenzindex — höher ist besser
Elf Punkte trennen das Beste aus der Cloud vom Besten, das sich in Ihrem Büro installieren lässt. Beim Lesen von Verträgen, Vorbereiten von Entwürfen und Antworten aus einem Archiv ist das ein Unterschied, den man nicht spürt — was man spürt, ist, wo Ihre Daten liegen. Quelle: Artificial Analysis Intelligence Index, Erhebung BenchLM, August 2026. Lokale Inferenz mit ds4, Open-Source-Motor (MIT).
Warum es möglich geworden ist
Zwei Dinge sind gemeinsam gereift. Das erste ist die Architektur der Modelle: DeepSeek V4 Flash hat 284 Milliarden Parameter insgesamt, aktiviert aber nur 13 pro Antwort (Mixture of Experts) — die Qualität eines Riesen, der Verbrauch eines mittleren Modells. Das zweite ist der Motor: ds4, die Open-Source-Inferenz-Engine (MIT-Lizenz) von Salvatore Sanfilippo, dem Schöpfer von Redis, eigens geschrieben, um diese Modelle auf Maschinen mit unifiziertem Speicher auszuführen — mit einem raffinierten Kniff: Wenn der Speicher nicht reicht, nutzt sie die NVMe-Disk als Erweiterung und trägt Kontexte bis zu einer Million Token.
Auf unserer AG Core Max (128 GB unifizierter Speicher) führt dieses Duo DeepSeek V4 Flash und GLM-5.2 lokal aus und stellt APIs bereit, die mit den Branchenstandards kompatibel sind: Die Fachsoftware verbindet sich, als spräche sie mit der Cloud. Nur dass die Cloud diesmal auf Ihrem Schreibtisch steht.
Was die Zahlen nicht sagen
Eine Punktzahl erfasst die Variable nicht, die für eine Kanzlei am meisten zählt: wo das Denken stattfindet. Die 63 Punkte eines Cloud-Modells schliessen Ihre Dokumente auf Reisen zu fremden Servern ein; die 52 eines lokalen Modells nicht. Deshalb lautet der richtige Vergleich nicht «63 gegen 52», sondern «63 mit den Daten ausser Haus gegen 52 mit den Daten im Tresor». Jeder wählt seinen Massstab — wir haben unseren gewählt.
