Aktuell

KI & LLM News

KI & Lokale LLMs – Daily Digest 24. Juli 2026: GLM-5.2 führt Benchmarks an, Ollama wird benutzerfreundlich

Open-Weights-Modelle erreichen erstmals konsistent die Leistung proprietärer Cloud-Angebote. GLM-5.2 führt die Benchmarks an, NVIDIA Nemotron 3 Super setzt neue Architektur-Maßstäbe, und Ollama…

Was mich heute besonders interessiert: Die Kluft zwischen proprietären Cloud-LLMs und lokalen Open-Weights-Modellen schließt sich rasant. GLM-5.2 erreicht Benchmarks auf GPT-5.5-Niveau — bei einem Sechstel der Kosten. In meinen Workshops erlebe ich regelmäßig, dass Unternehmen genau nach diesem Punkt suchen: Leistung ohne Abhängigkeit. Für Unternehmen bedeutet das konkret: Jetzt ist der richtige Zeitpunkt, lokale KI-Infrastruktur ernsthaft zu evaluieren.

Harald Bertram, Inhaber und Gründer von BusinessBeyond.de

GLM-5.2: Das neue Open-Weights-Leitmodell

Z.ai hat mit GLM-5.2 ein 744-Billionen-Parameter Mixture-of-Experts-Modell unter MIT-Lizenz veröffentlicht — und damit die Debatte über die Machbarkeit lokaler KI neu definiert. Mit etwa 40 Milliarden aktivierten Parametern pro Token, einem Kontextfenster von einer Million Tokens und zwei Reasoning-Stufen positioniert sich GLM-5.2 auf dem Artificial Analysis Intelligence Index an der Spitze aller Open-Weights-Modelle. Besonders bemerkenswert: Auf Coding-Benchmarks übertrifft GLM-5.2 sogar Claude Opus 4.8, während die Inferenzkosten bei einem Sechstel von GPT-5.5 liegen. Für Unternehmen, die KI-Projekte lokal betreiben wollen, ist dies ein starkes Signal — die Performance-Lücke existiert praktisch nicht mehr.

NVIDIA Nemotron 3 Super: Hybrid-Architektur für agentic Reasoning

NVIDIA hat mit Nemotron 3 Super einen architektonischen Meilenstein gesetzt: Ein offenes Mixture-of-Experts-Modell, das Transformer und Mamba kombiniert. Die Innovation liegt im Latent MoE-Ansatz — durch Komprimierung der Tokens vor den Expertenschichten ruft das Modell viermal so viele Spezialisten auf, ohne die Inferenzkosten zu erhöhen. Parallel dazu hat NVIDIA Nemotron-Labs-3-Puzzle-75B-A9B veröffentlicht — eine komprimierte Variante mit 75 Milliarden Gesamtparametern (9 Milliarden aktiv), die deutlich effizienter für den Produktivbetrieb auf begrenzter Hardware ist.

Ollama v0.32.0: Lokale KI wird benutzerfreundlich

Ollamas Version 0.32.0, veröffentlicht am 11./13. Juli 2026, markiert einen wichtigen Schritt in Richtung Mainstream-Akzeptanz lokaler LLMs. Der Befehl `ollama` ohne Argumente startet nun einen interaktiven Agenten — keine trockene Help-Seite mehr, sondern eine echte Konversationserfahrung direkt im Terminal. Technisch bringt die Version Multi-Token-Prediction-Support für spekulatives Decoding und unterstützt neue Modelle wie Kimi-K2.6, GLM-5.2 und MiniMax. Für Home-Labs und kleine Teams bedeutet dies: Lokale KI ist jetzt mit einem Befehl startklar.

Gemma 4 12B: Multimodalität auf einer einzigen GPU

Google DeepMind hat mit Gemma 4 12B ein Modell veröffentlicht, das Audio und Video nativ verarbeitet — ohne separaten Vision-Encoder. Das Ergebnis: Ein 12-Billionen-Parameter-Modell, das auf 16 GB VRAM läuft und unter Apache 2.0 lizenziert ist. Das Juli-Update brachte Flash Attention 4 für Hopper-Architekturen und verbessertes Tool Calling. Für Unternehmen mit begrenzter Hardware ist Gemma 4 12B die derzeit beste Wahl für multimodale lokale KI.

Cloud vs. Lokal: Die Parität ist erreicht

Ein Benchmark von FluxHuman zeigt deutlich: Selbstgehostete Open-Weights-Modelle haben die Leistung proprietärer Cloud-LLMs eingeholt. Der entscheidende Unterschied liegt nicht mehr in der Qualität, sondern in Datenschutz, Kostenkontrolle und regulatorischer Compliance. Für europäische Unternehmen ist dies besonders relevant — der EU AI Act mit den Omnibus-Änderungen von Mai 2026 verschärft die Anforderungen an Datenverarbeitung. Selbstgehostete LLMs bieten DSGVO-Konformität, Datenhoheit und niedrigere Betriebskosten in einem Paket.

Hardware: DeepSeek baut eigenen Chip, NPU vs. GPU bleibt umstritten

DeepSeek entwickelt einen eigenen AI-Inferenz-Chip, um die Abhängigkeit von NVIDIA und Huawei zu durchbrechen. Dies spiegelt einen breiteren Trend wider: Modellentwickler wollen Kontrolle über ihre gesamte Stack-Kette. Auf der Hardware-Seite für lokale Nutzer bleibt die Debatte zwischen NPU und GPU aktuell. Benchmarks zeigen klar: Für echte LLM-Inferenz gewinnt eine dedizierte RTX-GPU — Copilot+ PC NPUs kommen nicht annähernd an die Performance heran.

Fazit & Ausblick

Die Nachrichten der letzten Tage senden ein klares Signal: Lokale KI ist keine Nischenlösung mehr. GLM-5.2 beweist, dass Open-Weights-Modelle mit den besten proprietären Systemen konkurrieren können. Ollama v0.32.0 senkt die Einstiegshürde für Nicht-Entwickler. Und der regulatorische Druck in Europa macht Self-Hosting zur strategischen Notwendigkeit. Für Unternehmen bedeutet das: Die Evaluierungsphase ist vorbei. Jetzt geht es um Implementierung — welche Modelle passen zu Ihren Use Cases, wie sieht Ihre Hardware-Strategie aus, und wie integrieren Sie lokale KI nahtlos in bestehende Workflows?

Alle Quellen (18)

  1. GLM-5.2 beats GPT-5.5 on coding benchmarks
    Kategorie: lokale-llms
  2. GLM-5.2 Complete Guide 2026
    Kategorie: lokale-llms
  3. GLM-5.2 is probably the most powerful text-only open weights LLM
    Kategorie: lokale-llms
  4. Nemotron-Labs-3-Puzzle-75B-A9B
    Kategorie: lokale-llms
  5. Nemotron 3 Super: Open Hybrid Mamba-Transformer MoE
    Kategorie: lokale-llms
  6. Ollama v0.32.0 Update + Best Models
    Kategorie: inferenz-tools
  7. Ollama 0.32.0 Interactive Agent Mode
    Kategorie: inferenz-tools
  8. Gemma 4 12B Developer Guide
    Kategorie: lokale-llms
  9. Llama 4 vs Qwen 3.5 vs Mistral
    Kategorie: cloud-vs-lokal
  10. Best Open-Source LLMs July 2026 Leaderboard
    Kategorie: lokale-llms
  11. Open Source LLM Benchmark: Replacing Cloud Lock-In
    Kategorie: cloud-vs-lokal
  12. DeepSeek building own AI inference chip
    Kategorie: hardware
  13. NPU vs GPU Local LLM Benchmarking 2026
    Kategorie: hardware
  14. EU AI Act Compliance Guide 2026
    Kategorie: regulierung
  15. Complete Guide to Local LLM Inference Tools July 2026
    Kategorie: inferenz-tools
  16. Speculative Decoding Audit: MTP, DFlash
    Kategorie: inferenz-tools
  17. GDPR Compliant Self-Hosted LLMs Europe 2026
    Kategorie: cloud-vs-lokal
  18. Local LLM Cheat Sheet 2026
    Kategorie: lokale-llms