we are. · AI on-premise aus der SchweizIT DE CH FR ENWhatsApp +41 79 863 37 88Tel. +41 91 814 86 00
Demo buchen
AGgroup / Blog / Elf Punkte
Modelle · 30. August 2026

Elf Punkte: Wie weit die offenen Modelle wirklich von der Cloud entfernt sind.

Es gibt eine Frage, die uns jeder Kunde bei der ersten Demo stellt: «Aber ein Modell, das hier drin läuft — wie viel dümmer ist es als ChatGPT?» Es ist die richtige Frage, und sie verdient Zahlen mit der Quelle daneben, keine Meinungen.

Der meistverwendete Massstab der Branche ist der Artificial Analysis Intelligence Index, der mehrere Benchmarks in einer einzigen Punktzahl kombiniert. Im August 2026 (Erhebung BenchLM) sagt die Rangliste Folgendes:

  • Das Beste aus der Cloud: Claude Opus 5 mit 63.0, GPT-5.6 mit 58.9, Gemini 3.7 mit 56.0. Alle kostenpflichtig, pro Benutzer, mit Ihren Daten auf ihren Servern.
  • Das Beste, das sich im Büro installieren lässt: DeepSeek V4 Pro mit 53.2, GLM-5.2 mit 52.6, DeepSeek V4 Flash mit 51.8. Alle Open Weight, mit Lizenzen, die die kommerzielle Nutzung erlauben, ausführbar auf einer Schreibtischmaschine.

Elf Punkte trennen das Beste aus der Cloud vom Besten, das im Büro läuft. 2024 war dieser Abstand ein Abgrund; heute ist er eine Differenz, die man beim Lesen von Verträgen, Vorbereiten von Entwürfen und Antworten aus einem Archiv nicht spürt.

Wie intelligent sie sind: die Cloud gegen Ihr Haus

Intelligenzindex — höher ist besser

Cloudunsere, auf AG Core0204060Claude Opus 5CloudClaude Opus 5: 63.063.0GPT-5.6CloudGPT-5.6: 58.958.9Gemini 3.7CloudGemini 3.7: 56.056.0DeepSeek V4 Proauf AG Core EnterpriseDeepSeek V4 Pro: 53.253.2GLM-5.2auf AG Core MaxGLM-5.2: 52.652.6DeepSeek V4 Flashauf AG Core MaxDeepSeek V4 Flash: 51.851.8

Elf Punkte trennen das Beste aus der Cloud vom Besten, das sich in Ihrem Büro installieren lässt. Beim Lesen von Verträgen, Vorbereiten von Entwürfen und Antworten aus einem Archiv ist das ein Unterschied, den man nicht spürt — was man spürt, ist, wo Ihre Daten liegen. Quelle: Artificial Analysis Intelligence Index, Erhebung BenchLM, August 2026. Lokale Inferenz mit ds4, Open-Source-Motor (MIT).

Warum es möglich geworden ist

Zwei Dinge sind gemeinsam gereift. Das erste ist die Architektur der Modelle: DeepSeek V4 Flash hat 284 Milliarden Parameter insgesamt, aktiviert aber nur 13 pro Antwort (Mixture of Experts) — die Qualität eines Riesen, der Verbrauch eines mittleren Modells. Das zweite ist der Motor: ds4, die Open-Source-Inferenz-Engine (MIT-Lizenz) von Salvatore Sanfilippo, dem Schöpfer von Redis, eigens geschrieben, um diese Modelle auf Maschinen mit unifiziertem Speicher auszuführen — mit einem raffinierten Kniff: Wenn der Speicher nicht reicht, nutzt sie die NVMe-Disk als Erweiterung und trägt Kontexte bis zu einer Million Token.

Auf unserer AG Core Max (128 GB unifizierter Speicher) führt dieses Duo DeepSeek V4 Flash und GLM-5.2 lokal aus und stellt APIs bereit, die mit den Branchenstandards kompatibel sind: Die Fachsoftware verbindet sich, als spräche sie mit der Cloud. Nur dass die Cloud diesmal auf Ihrem Schreibtisch steht.

Was die Zahlen nicht sagen

Eine Punktzahl erfasst die Variable nicht, die für eine Kanzlei am meisten zählt: wo das Denken stattfindet. Die 63 Punkte eines Cloud-Modells schliessen Ihre Dokumente auf Reisen zu fremden Servern ein; die 52 eines lokalen Modells nicht. Deshalb lautet der richtige Vergleich nicht «63 gegen 52», sondern «63 mit den Daten ausser Haus gegen 52 mit den Daten im Tresor». Jeder wählt seinen Massstab — wir haben unseren gewählt.

Die Grafiken auf der Technologieseite ansehen