Im Netz stoße ich immer wieder auf Diskussionen rund um die Frage, ob lokale KI-Modelle wirklich konkurrenzfähig zu den großen Cloud-Anbietern sind. Die Antwort wird gerade deutlicher: Kleine Mixture-of-Experts-Modelle laufen auf einem Mac mini M6 schneller als erwartet – und OpenAI selbst veröffentlicht zunehmend Open-Weight-Modelle wie GPT-oss 20B. Gleichzeitig treiben Google mit seinem neuen Gemini-Agenten und OpenAI mit GPT-6 Astra die agentische KI voran. Was das für Unternehmen bedeutet, die auf lokale oder hybride Architekturen setzen, zeige ich im heutigen Digest.
Harald Bertram, Inhaber und Gründer von BusinessBeyond.de
Kleine MoE-Modelle erobern die Mac-Leaderboards
Der erste Community-Benchmark des neuen Mac mini M6 (32 GB) hat die Erwartungen übertroffen: Qwen 3.6-35B-A3B erreicht 64 tok/s statt der vorhergesagten 14 tok/s – ein Faktor von fast fünf. Nach Korrektur des LLMCheck-Index führen KAT-Coder-V2.5 (Score 82) und Qwen 3.6-35B-A3B (81) die Mac-Leaderboards an, während das dichte Modell Qwen3.8-27B auf Platz 8 liegt. Für Unternehmen bedeutet das: Ein $1.399-Mac mini kann jetzt ein 35B-MoE-Modell schneller generieren als die meisten Menschen lesen. Die Schwellen für lokale KI sinkt damit weiter – besonders attraktiv für Datenschutz-sensitive Anwendungen und Edge-Szenarien ohne Cloud-Anbindung.
Inferenz-Tools: GLM-5.3-Flash in llama.cpp, Ollama mit MLX als Default
Die lokale Inferenz-Landschaft entwickelt sich rasant weiter. Seit dem 30. September läuft GLM-5.3-Flash in der Standardversion von llama.cpp – ein wichtiger Schritt für die Verbreitung des Modells außerhalb Chinas. Noch relevanter: Ollama 0.40 (veröffentlicht am 4. Oktober) nutzt auf Apple Silicon standardmäßig den MLX-Inferenz-Engine, was die Performance auf Macs deutlich verbessert. Einzig DeepSeek V4.1 Flash wartet weiterhin auf offiziellen Upstream-Runtime-Support – ein Engpass für alle, die das Modell produktiv einsetzen wollen.
Google bringt agentische KI zu Gemini – zuerst für Unternehmen
Auf einem Cloud-Event hat Google einen einheitlichen Gemini-Agenten vorgestellt, der nicht nur Fragen beantwortet, sondern auch Aufgaben übernimmt. Der Agent kann Ziele (nicht nur Anweisungen) erhalten, selbstständig planen, benutzerdefinierte Skills nutzen und sich mit internen Systemen wie Google Workspace, Microsoft 365, Slack oder Jira verbinden. Besonders interessant: Nutzer können zwischen verschiedenen Modellen wählen – einschließlich Anthropic Claude-Modellen. Google plant, den Model-Picker später um Open-Source-Modelle zu erweitern. Die Strategie ist klar: Zuerst die komplexen Enterprise-Anforderungen (Sicherheit, Skalierung) lösen, dann auf Consumer ausrollen.
OpenAI: GPT-6 Astra und der AGI-Anspruch – mit Vorbehalt
OpenAI-Chef Greg Brockman bezeichnet GPT-6 Astra als den Beginn des AGI-Zeitalters. Die Benchmark-Ergebnisse sind beeindruckend, aber auch umstritten: Auf ARC-AGI-3 erreicht Astra 99,9% – allerdings nur mit einem proprietären Provider Adapter. Ohne diesen fällt der Score auf 62,7%. Unabhängige Tests von Artificial Analysis zeigen ein gemischtes Bild: Astra bleibt auf dem Intelligence Index bei 61 (gleich wie GPT-5.6 Sol) und liegt hinter Claude Fable 5.1 und Meta Muse Spark 1.3. Trotz ~70% besserer Token-Effizienz bei Software-Aufgaben ist Astra pro Aufgabe ~75% teurer als sein Vorgänger – die API-Preise sind von $4/$20 auf $10/$50 pro Million Tokens gestiegen. Zusätzlich hat OpenAI am 6. Oktober 372 Familien mathematischer Ergebnisse veröffentlicht, darunter einen behaupteten Beweis der Unique Games Conjecture. Bis zum 7. Oktober hatten ~42% Lean-Formalisierungen – Scott Aaronson schrieb: Kein Mensch scheint noch fast keinen dieser Beweise verstanden zu haben.
GPT-6 Astra steuert echtes Auto durch Drive-Thru
Drei AI-Ingenieure von Axiom haben GPT-6 Astra (ein Text-/Code-Modell) dazu gebracht, einen Toyota Corolla durch ein In-N-Out-Burger-Fahrrestaurant zu steuern – ohne vorherige Anweisung. Das Modell korrigierte seine Fehler in Echtzeit und lernte kontextuell. Das neue Benchmark DrivingBench zeigt jedoch die Grenzen: Nur Astra schaffte eine einfache Parkhausstrecke; Claude Fable 5.1 erreichte 45%, Grok nur 11%. Die Fähigkeit zur räumlichen Wahrnehmung scheint ein emergentes Merkmal der neuesten Multimodal-Modelle zu sein – noch weit von sicherem autonomen Fahren entfernt, aber ein faszinierender Schritt.
OpenAI GPT-oss 20B: Der Open-Weight-Einstieg von OpenAI
OpenAI hat mit GPT-oss 20B (MoE, 3.6B aktive Parameter) ein neues Open-Weight-Modell veröffentlicht und auf dem Mac mini M6 gemessen: 45 tok/s. Das Modell wurde im LLMCheck-Index aufgenommen und signalisiert einen strategischen Schwenk von OpenAI in den Open-Weight-Bereich – bisher das Territorium von Meta, Alibaba und DeepSeek. Gleichzeitig hat Alibaba Qwen 4 inklusive eines Open-Weight-Modells mit 27B Parametern angekündigt – die Gewichte sind jedoch noch nicht verfügbar. Muse Spark 1.2 bleibt ebenfalls eine Zusage ohne Release.
Yale-Studie: Wie KI-Chatbots wie Menschen denken
Eine Yale-Studie unter Leitung von Tom McCoy zeigt, dass neuronale Netze implizit symbolische Strukturen in ihren Vektordarstellungen realisieren. Die Forscher konnten LLM-Verhalten durch gezielte Eingriffe in interne Vektorrepräsentationen modifizieren – zum Beispiel die Position eines Adjektivs im Satz verschieben und das Modell verhielt sich so, als wäre der Input anders gewesen. Das ist ein wichtiger Schritt zum besseren Verständnis und Vertrauen in KI-Systeme – besonders relevant für Unternehmen, die KI in kritischen Prozessen einsetzen wollen.
Fazit & Ausblick
Die Kluft zwischen Cloud- und lokalen LLMs schließt sich weiter: Kleine MoE-Modelle laufen auf erschwinglicher Hardware schneller als erwartet, und selbst OpenAI steigt in den Open-Weight-Bereich ein. Gleichzeitig treiben die großen Anbieter die agentische KI voran – Google mit seinem Gemini-Agenten für Unternehmen, OpenAI mit GPT-6 Astra und dessen Intelligent UI. Für Unternehmen bedeutet das: Die Entscheidung zwischen Cloud und Lokal ist keine Entweder-Oder-Frage mehr. Hybride Architekturen, bei denen sensible Daten lokal verarbeitet werden und komplexe Aufgaben an Cloud-Modelle delegiert werden, gewinnen an Bedeutung. Wer jetzt in lokale KI-Infrastruktur investiert – sei es ein Mac mini M6 oder eine GPU-Workstation – positioniert sich für die nächste Welle der agentischen KI.
Alle Quellen (10)
-
State of Open-Source Local LLMs – October 2026: Small MoEs Take the Top
-
Best Local LLMs (October 2026): Benchmarks, Memory & Workload
-
Google brings agentic AI to Gemini, starting with businesses
-
OpenAI claims we've entered the AGI era – has GPT-6 Astra really demonstrated general intelligence?
-
OpenAI's 372 AI Math Results Leave Mathematicians Racing to Read the Proofs
-
AI Text Model Drives Real Car Through Drive-Thru With No Prior Training
-
How do AI chatbots reason like humans? A Yale-led study offers clues
-
GPT-6 and Intelligent UI for everyone
-
Ollama Release Notes & Changelog · October 2026
-
Open-Source LLMs 2026: Which Are Actually Open-Licensed