Im Netz stoße ich in dieser Woche immer wieder auf dieselbe Diskussion: ob ein offenes Modell mit Billionen Parametern überhaupt noch „lokal" sein kann. Die Antwort der Woche lautet überraschend konkret — Xiaomi hat MiMo-V2.6-Pro unter MIT-Lizenz veröffentlicht, und es führt jetzt alle Open-Weight-Rankings an. Gleichzeitig halbiert OpenAI die GPT-6-Preise, Anthropic bringt Opus-Niveau zu Opus-Preisen, und NVIDIA verteilt Inferenzlasten über ganze Heimnetze mit PAIR. Was mich in der Praxis interessiert: Die Infrastruktur für lokale Agenten wird gerade so reif, dass man sie nicht mehr erklären muss — man kann sie einfach betreiben.
Harald Bertram, Inhaber und Gründer von BusinessBeyond.de
Offene Frontier-Klasse: Xiaomi MiMo-V2.6-Pro setzt den neuen Maßstab
Die wichtigste Modellmeldung der Woche kommt nicht von einem klassischen KI-Labor, sondern von einem Hardware-Hersteller: **Xiaomi** hat am 21./22. September die **MiMo-V2.6-Serie mit offenen Gewichten** veröffentlicht — unter MIT-Lizenz, dem permissivsten Standard im Feld. Das Flaggschiff **MiMo-V2.6-Pro** ist ein MoE-Modell mit **1,02 Billionen Gesamtparametern und 42 Milliarden aktiven Parametern**, 1M-Token-Kontext und omnimodaler Eingabe (Text, Bild, Video, Audio). Auf dem Artificial Analysis Intelligence Index erreicht es **46 Punkte — der höchste Wert, den je ein Open-Weights-Modell erreichte**, vor Kimi K3 und Qwen3.8 Max. Die API-Stufe Pro kostet $0,435/$0,87 pro Million Tokens; Flash startet bei $0,14/$0,28. Zwei Details machen das Release für die Praxis besonders relevant: Erstens hat Xiaomi den **Reinforcement-Learning-Trainingsslauf live gestreamt** und dokumentiert — mit rund 2,62 Millionen Dollar Trainingskosten für Pro eine Kostentransparenz, die in der Frontier-Klasse sonst unüblich ist. Zweitens zeigt das Ergebnis zusammen mit dem BenchLM-Leaderboard (Qwen3.8 Max 71,8 vor GLM-5.3 65,6 und DeepSeek V4 Pro 0813 63,5), dass die offene Frontier-Klasse nicht mehr „Fast-Food" ist: Die chinesischen Labore besetzen jetzt konsequent die Spitze der Open-Weight-Rankings — und zwar mit Lizenzen, die kommerzielle Nutzung ohne Einschränkungen erlauben. Für Unternehmen heißt das: Der Abstand zwischen „bestes offenes Modell" und „bestes geschlossenes Modell" schrumpft messbar weiter, während die Lizenzkosten null bleiben.
Cloud vs. Lokal: Preishalvierung bei GPT-6 — und Opus-Niveau unterhalb der alten Sätze
Am 22. September hat sich das Cloud-Preisgefüge in 90 Minuten doppelt verschoben. **OpenAI** hat **GPT-6 Sol ($2/$10)** und **GPT-6 Luna ($0,10/$0,50)** pro Million Tokens veröffentlicht — jeweils etwa die Hälfte der Preise der ersetzten GPT-5.6-Stufen, mit 1,05M-Token-Kontext. Luna unterbietet damit DeepSeek V4.1-Flash im Off-Peak ($0,15/$0,60) und ist damit das neue Preis-Floor im Frontier-Bereich; auf dem AA Index erreicht Sol 48, Luna 37 — bei DeepSWE v1.1 liegt Luna nur 2,2 Punkte hinter Sol und kostet einen Bruchteil davon, bricht aber bei agentischen Benchmarks ein. **Anthropic** hat quasi zeitgleich **Claude Opus 5.5** geschickt: $4/$20 statt $5/$25, Cache-Reads von $0,50 auf $0,20 gesenkt — und mit 58 Punkten (max effort) den bisher höchsten Wert auf dem AA Intelligence Index gemessen, in zentralen agentischen Benchmarks vor Fable 5.1 (AA-Briefcase Elo 1822). Für die Cloud/Lokal-Abwägung ist das ein doppelter Effekt: Die geschlossenen Modelle werden günstiger — was den Druck auf lokale Deployments erhöht — aber gleichzeitig zeigt MiMo-V2.6-Pro, dass offene Gewichte bei der reinen Intelligenz längst konkurrenzfähig sind. Der Local AI Zone Monats-Dispatch (abgeschlossen 26. September) fasst das strukturell zusammen: Fünf Frontier-Launches in den ersten zehn Tagen des Septembers, über 20 weitere Releases zwischen dem 12. und 25., ein Preis-Spread von 119x im Top-15-Feld (Fable 5.1 $11,90 vs. Muse Spark 1.3 ~$0,10/MTok) — und vier von fünf Frontier-Launches mit gated Cyber-Fähigkeitsstufen. Die Entscheidung „Cloud oder lokal" ist damit endgültig eine Routing-Entscheidung pro Workload: Preis, Lizenz, Datenhoheit und Kontextlänge wiegen je nach Anwendungsfall anders.
Inferenz-Schicht reift: Ollama v0.34.4, NVIDIA PAIR und KV-Cache-Kompression
Die lokale Betriebs-Schicht hat in dieser Woche drei substanzielle Fortschritte gemacht. **Ollama v0.34.4** (stabil am 23. September) bringt auf Apple Silicon messbare Prefill-Gewinne: Qwen 3.8 prompt processing läuft auf dem MLX-Pfad **+18,7 % bei 2k und +19,1 % bei 8k Prompt-Tokens schneller** (M5 Max, gemessen im PR ollama/ollama#18550) — Decode-Geschwindigkeit bleibt unverändert. Gemma 4 wählt pro Bild eines von fünf Image-Token-Budgets statt eines Fixwerts, was Vision auf 16-GB-Macs erleichtert (bis zu +826 MB Speicher beim größten Budget). Dazu laufen Structured Outputs bei Thinking-Modellen in einem Durchgang, und „model not found"-Fehler bei großen lokalen Modellbibliotheken sind behoben. **NVIDIA PAIR (Personal AI Router)** ist der strukturell interessanteste Baustein: Die Software verbindet kompatible macOS-, Windows- und Linux-Systeme mit RTX-GPUs (ab 20er-Serie), RTX PRO Workstation-GPUs, DGX Spark und Macs zu einem gemeinsamen Inferenz-Cluster — ohne Special Cables oder Rack-Setup. PAIR entdeckt die Knoten selbst, verwaltet die Engines und stellt **Ollama-kompatible sowie OpenAI-kompatible Proxy-Endpoints** bereit; Agent-Harnesses müssen nicht geändert werden, Prompts und Kontext bleiben im lokalen Netz. Auf der IFA hat NVIDIA zudem neue llama.cpp-/vLLM-Optimierungen mit bis zu 1,9x schnellerer lokaler Inferenz angekündigt (direkt verfügbar sowie über LM Studio und Ollama) — und vereinfachte Agent-Setups in Hermes Agent, OpenClaw und Perplexity Portable Computer. Den Engpass „Kontext frisst Speicher" greift **DeepSeeks Technical Report zu V4.1-Flash** an (arXiv 2609.19969): Durch Compressed Sparse Attention 2 mit Cross-Layer-KV-Reuse, FP4-KV-Caching und „SWA Bounded Replay" sinkt der KV-Cache auf **890 Bytes pro Token — etwa ein Viertel des V4-Flash-Werts in HBM** und rund ein Achtel für den persistenten Teil. Eine 100K-Token-Agenten-Session, die früher ~40 GB brauchte, läuft damit in ~10 GB. Zusammengelesen: Modellgröße (MiMo, Bonsai), Kontext-Speicher (DeepSeek) und Multi-Machine-Verteilung (PAIR) — die drei historischen Flaschenhälse lokaler Agenten werden gleichzeitig angegriffen.
Hardware für lokale und Edge-AI: RAIDEN, Zhenwu V900, AKD1500 und Jetson-Thor-Systeme
Die Hardware-Welle der Woche zeigt eine klare Richtung: Inferenz wandert raus aus dem Rechenzentrum — in Roboter, Fabrikhallen und Heimnetzwerke. **EdgeCortix** (Kanagawa, Japan) hat am 24. September **RAIDEN** vorgestellt: eine skalierbare AI-Chiplet-Plattform von einem Die bis zum vier-Die-Flaggschiff X4 mit bis zu **3,36 PFLOPS FP4, 256 GB Speicher und 6,4 Tb/s Chip-to-Chip-Scale-out** — dimensioniert für „Physical AI at the thick edge" (Roboter, Luftfahrt/Verteidigung, Edge-AI-Server). Design Wins sind bereits gesichert (u. a. Kawasaki Heavy Industries); Sampling startet Anfang 2027. In China zeigt **Alibabas T-Head** mit dem **Zhenwu V900** den Full-Stack-Ansatz: 216 GB Speicher, 1.200 GB/s Inter-Chip-Bandbreite, natives FP8/FP4 — und über ICN-Switch-Interconnects lassen sich über 1.000 Chips als ein System verbinden, Cluster skalieren auf bis zu 500.000 Acceleratoren; Massenfertigung ab Q1 2027. Am anderen Ende der Skala liefert **BrainChip** die **Akida AKD1500 als PCIe-Karte**: event-basiertes neuromorphes Silizium, das in jedem Desktop mit freiem Gen3-Slot läuft — convolutionale und Transformer-Netze on-device, On-Chip-Lernen neuer Klassen, Sub-Milliwatt-Betrieb. **Aetina** schickt die DeviceEdge AIE-KT78/68 (NVIDIA Jetson Thor: 128 GB bzw. 64 GB LPDDR5X, bis zu 2.070 FP4 TFLOPS) in General Availability — kompakte Systeme für Cobots und Humanoid-Roboter mit lokaler Ausführung von LLMs, VLMs und Vision-Language-Action-Modellen plus EtherCAT-Master für deterministische Ansteuerung; parallel startet die MXM-Reihe auf RTX PRO Blackwell (MX5000B-XA: 40,62 TFLOPS FP32, laut Validierung 2x schnellere LLM-Inferenz mit Gemma-2-9b).
DevDay-Vorbereitung: Legacy-Modelle laufen am 28. September aus
Morgen, am **29. September**, findet OpenAIs **DevDay** in San Francisco statt (Fort Mason; Keynote-Livestream kostenlos, Voranmeldungen geschlossen). Operativ relevant ist der Tag davor: Am **28. September laufen vier Legacy-Modelle aus** — gpt-3.5-turbo-instruct, babbage-002, davinci-002 und gpt-3.5-turbo-1106 (alle zeigen auf gpt-5.6-terra) — und die Sora 2 Videos API wurde am 24. September bereits entfernt. Wer heute noch Code gegen diese IDs schreibt oder API-Keys ohne Expiry-Policy führt, sollte das vor dem Wochenende erledigen: Im September lieferten zudem Agents API im Public Beta, GPT-Live 1 mit Minutenpreis ($0,05/Min), Key-Creation-Governance und Expiry-Limits — sowie die Einschränkungen von GPT-6 Astra (kein none-reasoning-effort, kein Custom temperature/top_p, keine logprobs). Für Unternehmen mit OpenAI-Abhängigkeiten ist das DevDay damit doppelt relevant: als Ankündigungs-Event und als harter Migrations-Termin.
Fazit & Ausblick
Für Unternehmen, die auf lokale KI setzen, ist diese Woche ein Reifungssignal: Die drei historischen Flaschenhälse — Modellgröße, Kontext-Speicher und Multi-Machine-Verteilung — werden gleichzeitig angegriffen, und zwar mit offenen Gewichten (MiMo-V2.6-Pro unter MIT), dokumentierten Techniken (DeepSeek KV-Cache auf 890 Bytes/Token) und betriebsfertiger Software (Ollama v0.34.4, NVIDIA PAIR). Gleichzeitig halbiert OpenAI die GPT-6-Preise und Anthropic bringt Opus-Niveau unterhalb der alten Sätze — der Cloud-Preisdruck steigt, aber er trifft auf eine offene Frontier-Klasse, die bei Intelligenz und Lizenz inzwischen konkurrenzfähig ist. Die praxisnahe Konsequenz: Routing pro Workload wird zur Standardarchitektur, und wer morgen DevDay-Ankündigungen einpreist, sollte seine Legacy-Modelle (Auslauf am 28.) und API-Key-Policies bereits heute geordnet haben. Der 12. November — Cursor verliert den OpenAI-Zugang — bleibt der nächste harte Testfall für hybrides Modell-Routing im Produktivbetrieb.
Alle Quellen (17)
-
Xiaomi MiMo-V2.6 Tops Open-Weights AI Index At 46
-
MiMo-V2.6-Pro Intelligence, Performance & Price Analysis
-
Open-Source LLM Leaderboard 2026: 85 Models Ranked
-
GPT-6 Sol and Luna: Pricing, Benchmarks, Tested
-
Anthropic releases Opus 5.5 with lower prices and Fable-level performance
-
Claude Opus 5.5 takes the top spot on the Artificial Analysis Intelligence Index
-
September 2026 AI Model Updates: Every Launch, Price Move, and Architecture Shift
-
Ollama 0.34.4 on Mac: Qwen 3.8 Prefill +19%, Gemma 4 Fix
-
NVIDIA PAIR Virtual Inference Router Expands Available Compute on Your Local Network
-
Sparks Fly: NVIDIA Accelerates Local AI at IFA 2026
-
DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression (arXiv 2609.19969)
-
OpenAI DevDay Is September 29: What to Have Ready Now
-
Announcing OpenAI DevDay 2026
-
EdgeCortix Unveils RAIDEN, a Scalable, Energy-Efficient AI Chiplet Platform for Physical AI
-
T-Head unveils Zhenwu V900 AI chip in Alibaba's push to expand its AI infrastructure stack
-
BrainChip Launches AKD1500 PCIe Card For Edge AI Evaluation
-
Aetina Introduces AIE-KT78/68 for Integrated AI Perception, Decision-Making and Control in Robotics