Aktuell

KI & LLM News

KI & Lokale LLMs - Daily Digest 03. August 2026

Alibaba veroffentlicht Qwen3.8-Max, Chinas groesstes KI-Modell mit Benchmark-Werten auf Level von Anthropic und OpenAI. Moonshot AI gibt Kimi K3 (2,8T Parameter) unter MIT-Lizenz frei. Die EU setzt ab…

Was mich heute besonders interessiert: Alibaba hat mit Qwen3.8-Max ein Modell veröffentlicht, das selbst OpenAI und Anthropic unter Druck setzt - und gleichzeitig treten in der EU die ersten Transparenzpflichten des AI Act in Kraft. Wenn ich mich mit Unternehmerinnen und Unternehmern über KI austausche, dann höre ich immer wieder dieselbe Frage: Wo bleibt die Kontrolle? Lokale Open-Weight-Modelle wie Kimi K3 oder Phi-4 werden nicht nur aus Kostengründen interessant - sondern auch als strategische Antwort auf regulatorische Anforderungen.

Harald Bertram, Inhaber und Gründer von BusinessBeyond.de

Chinas KI-Offensive: Qwen3.8-Max und MiniMax M3 setzen neue Massstaebe

Alibaba hat am 3. August 2026 sein bisher groesstes KI-Modell veroffentlicht - Qwen3.8-Max mit 2,4 Billionen Parametern. Die Benchmarks sind beeindruckend: Das Modell uebertrifft GPT-5.6 Sol und Claude Fable 5 in sieben Coding- und General-Evaluation-Aufgaben sowie in 36 multimodalen Tests. Bloomberg stuft es als direkten Rivalen von Anthropic PBC ein. Parallel dazu fuehrt MiniMax M3 im August 2026 das Open-Weight-Benchmark-Ranking an (68,7/100 Punkte auf BenchLM.ai). Das Modell bietet native Multimodalitaet mit Bild- und Videoeingabe sowie ein Kontextfenster von einer Million Token - alles unter offener Lizenz. Die Luecke zwischen geschlossenen Frontier-Modellen und Open-Weight-Alternativen schliesst sich zusehends.

Kimi K3 und Laguna S 2.1: Open-Weight-Giganten fuer den lokalen Einsatz

Zwei Veroeffentlichungen Ende Juli pragen die lokale LLM-Landschaft im August. Moonshot AI hat am 27. Juli die voelligsten Open Weights von Kimi K3 freigegeben - ein Mixture-of-Experts-Modell mit 2,8 Billionen Parametern unter modifizierter MIT-Lizenz. Die Gewichte summieren sich auf 1,56 TB, erreichen 88,3% auf Terminal-Bench 2.1 und bieten ein Kontextfenster von einer Million Token. Etwas kompakter: Poolside Laguna S 2.1 (118B Parameter) positioniert sich als agentic Coding-Modell, das Konkurrenten mit zehnmal mehr Parametern uebertrifft - mit 70,2% auf agentic-coding-Benchmarks und 40,4% auf DeepSWE.

Microsoft Phi-4: Leistungsstarke KI auf Consumer-Hardware

Microsofts Phi-4-Familie demonstriert, dass klein nicht mehr schwach bedeutet. Die sieben MIT-lizenzierten Varianten reichen vom 3,8B Mini bis zum 15B Reasoning Vision - und das 14,7B Phi-4 erreicht auf mehreren Benchmarks Werte des Llama 3.3 70B. Entscheidend: Das Modell laeuft auf einer GPU mit nur 12 GB VRAM. Ollama 0.22 und LM Studio 0.4.12 bieten offizielle GGUF-Unterstuetzung.

OpenAI Astra: Zehn mathematische Probleme mit maschinenpruefbaren Beweisen geloest

OpenAI hat bekanntgegeben, dass ein internes Astra-Modell zehn langjahrige offene Probleme in Mathematik und theoretischer Informatik geloest hat. Die Beweise wurden als Lean-4-Zertifikate auf GitHub veroeffentlicht - maschinenpruefbar, nicht nur vertrauensbasiert. Ein 249-seitiges Manuskript begleitet die Ergebnisse. Token-Kosten fuer alle Loesungen: rund $2.000.

EU AI Act: Transparenzpflichten treten in Kraft - was Unternehmen jetzt tun muessen

Seit dem 2. August 2026 setzt die Europaeische Kommission die Transparenzregeln des AI Act durch (Artikel 50). Nutzer muessen klar informiert werden, wenn sie mit einem KI-System interagieren. Deepfakes und Hochrisiko-Anwendungen benoetigen explizite Kennzeichnung. Fuer Unternehmen, die lokale LLMs einsetzen, ist dies eine Chance: On-Premise-Modelle bieten von Haus aus mehr Transparenz und Kontrolle als Cloud-APIs.

Inferenz-Tools im August: MTP, Speculative Decoding und Runtime-Vergleich

llama.cpp hat Multi-Token Prediction (MTP) stabil integriert - die Technik beschleunigt Token-Generierung um 2-3x durch parallele Vorhersage ohne externen Draft-Modell. Ollama und LM Studio folgen mit eigener MTP-Unterstuetzung. Aktueller Runtime-Vergleich: Ollama fuer schnellstes Setup, LM Studio fuer GUI-first-Ansatz, llama.cpp fuer maximale Kontrolle, vLLM fuer Team-Serving.

Hardware: Optische Interconnects, Rubin vs MI350X und der Edge-AI-Boom

Chinesische Forscher haben ein voellig optisches Interconnect-System entwickelt, das verteilte KI-Inferenz um 100x beschleunigt. Der Vergleich zwischen NVIDIA Rubin (bis zu 10x niedrigere Token-Kosten als Blackwell) und AMD MI350X (gleiche 288 GB Speicher bei niedrigerem Preis/Stromverbrauch) zeigt ein differenziertes Bild. Der Edge-AI-Hardware-Markt waechst von $47 Mrd. (2026) auf prognostizierte $445 Mrd. bis 2034 - CAGR 32,5%.

Cloud vs. Lokal: Der Kosten-Tipping-Point und reale Agenten-Tests

Ab monatlich $80 API-Ausgaben spricht die Mathematik fuer lokale Hardware - doch Hybrid-Ansaetze dominieren in der Praxis. EPAM hat lokale LLM-Agenten (Qwen vs Gemma) in realistischen Software-Projekten getestet: Lokale Agenten erreichen bei bestimmten Aufgaben Cloud-Niveau, zeigen aber bei komplexem Refactoring noch messbare Luecken.

Fazit & Ausblick

Der 3. August 2026 zeigt ein KI-Landschaft im rasanten Wandel: Chinas Modell-Power waechst (Qwen3.8-Max, MiniMax M3), Open-Weight-Modelle werden produktionsreif fuer den lokalen Einsatz (Kimi K3, Laguna S 2.1, Phi-4), und die EU beginnt regulatorisch durchzugreifen. Fuer Unternehmen ergeben sich drei klare Handlungsfelder: Erstens die Evaluation von Open-Weight-Modellen fuer konkrete Use Cases - insbesondere Coding-Assistenz mit Laguna S 2.1 oder allgemeine Aufgaben mit Phi-4. Zweitens die Vorbereitung auf AI-Act-Transparenzpflichten durch dokumentierte On-Premise-Architekturen. Drittens die Investition in Hardware, bei der AMD MI350X und Edge-NPUs zunehmend attraktive Alternativen zu reinen NVIDIA-Loesungen darstellen.

Alle Quellen (19)

  1. Alibaba Qwen3.8-Max Release
    Kategorie: ki-allgemein
  2. Qwen3.8-Max vs GPT-5.6 Sol & Claude Fable 5
    Kategorie: ki-allgemein
  3. OpenAI Astra: 10 Math Problems Solved with Lean Proofs
    Kategorie: ki-allgemein
  4. OpenAI Astra Lean Proofs Analysis
    Kategorie: ki-allgemein
  5. EU AI Act Transparency Rules Enforcement Starts August 2
    Kategorie: regulierung
  6. AI Act Article 50 Transparency Rules Practical Guide
    Kategorie: regulierung
  7. Kimi K3 Open Weights Local LLM Guide
    Kategorie: lokale-llms
  8. Kimi K3: The Real 1.56TB Download and License Details
    Kategorie: lokale-llms
  9. MiniMax M3 Leads Open-Weight Ranking August 2026
    Kategorie: lokale-llms
  10. Microsoft Phi-4 Local AI GPU Guide 2026
    Kategorie: lokale-llms
  11. Best Open Source LLMs to Run Locally in 2026
    Kategorie: lokale-llms
  12. Poolside drops Laguna S 2.1 Open-Weight Coding Model
    Kategorie: lokale-llms
  13. China Optical Interconnect Boosts AI Speed 100-Fold
    Kategorie: hardware
  14. NVIDIA Blackwell vs AMD MI350X AI GPU Comparison 2026
    Kategorie: hardware
  15. Edge AI Hardware Market Forecast to 2034
    Kategorie: hardware
  16. Ollama vs LM Studio vs llama.cpp: Which Runtime in 2026?
    Kategorie: inferenz-tools
  17. Multi-Token Prediction in llama.cpp: Complete Tutorial
    Kategorie: inferenz-tools
  18. Local LLM vs Cloud API: Complete Cost Analysis 2026
    Kategorie: cloud-vs-lokal
  19. Qwen vs Gemma: Local LLM Coding Agent Review 2026
    Kategorie: cloud-vs-lokal