Marcel Moré gab einen Überblick über die Neuigkeiten aus der AI-Welt – diesmal bewusst als Stichwortgeber für die Diskussion gedacht. Seit dem letzten Treffen war einiges passiert.
GPT-6 Astra, Claude Fable, Atlas Weltmodell
Die größte Ankündigung lag erst wenige Tage zurück: GPT-6 Astra von OpenAI. Jörg Köster hatte sich bereits einige Tutorials angesehen. Astra soll besonders stark darin sein, selbstständig auf dem Desktop zu arbeiten und sich durch Programme zu klicken. OpenAI warb unter anderem mit Excel-Wettbewerben, in denen Astra sehr gut abgeschnitten habe, und auch komplexe CAD-Modelle sollen mit wenigen Prompts entstehen. Jörg möchte das ausprobieren – er hat einige nervige Klick-Prozesse ohne Schnittstelle, die sich damit lösen ließen, wenn man dem System vertrauen kann.
Marcel ergänzte das Beispiel eines deutschen YouTubers, der Astra beauftragte, den Hamburger Michel nachzubauen – nur per Beschreibung, ohne Bilder oder Daten. Astra recherchierte selbstständig, verwendete die Originalmaße und modellierte über einige Stunden Außenfassade und Innenraum samt Altarbild und Orgel als 3D-Modell. Kritische Stimmen mahnen zwar, mit dem ständigen Gerede von AGI aufzuhören, weil es unglaubwürdig wird. Aber wer konkrete Anwendungsfälle testet, findet durchaus beeindruckende Ergebnisse.
Noch jünger ist Atlas, ein sogenanntes Weltmodell. Statt Sprache verarbeitet es Physik und Geometrie und kann so Abläufe simulieren, die in der realen Welt tatsächlich möglich sind, statt “Phantasiegeschichten” zu erzeugen. Bisher gibt es dazu nur Demovideos.
Wie schnell sind die Limits erreicht?
Adam Augustin wies darauf hin, dass Astra und Claude Fable bei den API-Kosten gleichauf liegen – was man im Abo deutlich an der Geschwindigkeit sieht, mit der das Kontingent schwindet. Marcel arbeitet seit einigen Wochen mit Fable, inzwischen in Version 5.1 und auf der zweithöchsten Denkstufe. Trotz täglich stundenlanger Nutzung ist er noch nie an ein Limit gestoßen. Sein Eindruck: Fable startet sehr viele Subagenten und kommt dadurch schneller ans Ziel als Opus. Adam relativierte: Anthropic gewährt derzeit noch 50 Prozent zusätzliche Nutzung, und das große Abo bietet ohnehin viel Spielraum.
Die Erfahrungen gingen auseinander. Frank Brunner stößt mit dem Max-Abo für rund 90 Euro im Monat meist schon nach zwei Stunden an die Grenze des Fünf-Stunden-Fensters, Adam einmal sogar nach einer Stunde. Es hänge eben stark davon ab, was man tut. Jörg berichtete von einem Versuch auf der höchsten Stufe: Eine umfangreiche Aufgabe war in einer Dreiviertelstunde erledigt – eine komplette Bibliothek für Benutzeroberflächen samt Dokumentation und Handbuch. In der Spitze liefen rund 80 Agenten parallel, in API Tokens umgerechnet hätte das knapp 850 Euro gekostet.
Agenten-Teams in der Cloud
Eine Ebene höher setzen Systeme wie Hermes Agent oder der Grokbot an, mit denen man ganze Teams von Agenten losschickt. Der Grokbot aus dem Umfeld von Elon Musk wird auf Social Media gelobt, erfordert aber ein großes Abo. Er bedient virtuelle Rechner in der Cloud: Man beschreibt eine Aufgabe, und der Agent nutzt alle installierten Programme, um sie zu lösen. Jeder Bot erhält ein eigenes Profil mit eigenem Gedächtnis, Modell, MCPs und Skills. Mehrere Bots lassen sich in einen gemeinsamen Team-Chat einladen und teilen sich die Arbeit nach Spezialisierung.
Hintergrund ist die Übernahme von Cursor. Dort entstand eine Art GitHub für AI-Agenten, weil Git auf menschliche Nutzer ausgelegt ist und bei vielen gleichzeitigen Commits an Grenzen stößt. Dabei sollen allerdings ungefragt Daten von Cursor-Kunden in die Cloud gelangt und zum Training genutzt worden sein – aufgeklärt ist das noch nicht, sorgt aber für einige Empörung.
Warmwind: Robotik statt Sprachmodell
Einen ganz anderen Weg geht Warmwind, ein deutsches Startup aus Jena, das erst vor wenigen Wochen an die Öffentlichkeit gegangen ist. Statt eines Sprachmodells haben die Gründer ein Modell aus der Robotik trainiert, das Benutzeroberflächen direkt bedient – ohne dass erst ein Vision-Modell den Bildschirm deuten und ein Sprachmodell den nächsten Klick entscheiden muss. Für das Training ließen sie eigens Spezialhardware in Taiwan bauen.
Die Idee: virtuelle Kollegen in der Cloud, die etwa per SAP-Zugang Kunden-E-Mails beantworten oder Daten abrufen. Die Launch-Videos wirken etwas großspurig, ein Technikvideo erklärt aber die Hintergründe. Marcel kam beim Test mit dem kostenlosen Guthaben nicht weit, weil das System, das auf GPUs bei Hetzner läuft, völlig überlastet war. Gerade mit Blick auf Datenschutz und eine deutsche Cloud sei Warmwind aber einen Blick wert.
Lokale AI
Auch bei der lokalen AI tut sich einiges. JetBrains hat eine lokale Version seines Coding-Agenten Junie veröffentlicht, der auf Hugging Face bereitsteht und für Apple-Hardware optimiert per LM Studio auf einem gut ausgestatteten Mac laufen soll. Marcel hat im vergangenen Jahr intensiv mit Junie an einem PHP-Projekt gearbeitet – so, wie er heute mit Claude arbeitet – und war beeindruckt, wie schnell Junie auch große Projekte semantisch erfasst. Spannend ist nun, ob die lokale Variante auch jenseits von PHP und Java so gut funktioniert.
Mit SwarmLLM tauchen zudem erste Frameworks auf, die Modelle verteilt betreiben. Das Modell liegt dabei partitioniert im Browser und läuft per WebGPU. Mehrere Geräte lassen sich koppeln und teilen sich Speicher und Rechenleistung – in einer Demo streamt ein Mac jeweils den gerade benötigten Teil des Modells auf ein iPhone. Schnell ist das wegen der Latenz nicht, aber prinzipiell nutzbar. Adam verwies auf das ähnliche Projekt exo, mit dem sich mehrere Mac minis zu einem großen Rechner zusammenschalten lassen. Holger Herbst ergänzte, dass Apple inzwischen das Zusammenschalten des Unified Memory mehrerer Rechner über Thunderbolt 5 ermöglicht – für die AI wirkt das dann wie ein einziger Rechner mit sehr viel Speicher.
Erfahrungen aus der Runde
Armin Egginger hatte am Wochenende ein lokales Setup auf einem MacBook Pro mit M5 Max und 128 GB eingerichtet, angebunden an Obsidian und per VPN auch von den iPads aus nutzbar. Im Einsatz sind Qwen 3.8 in der 27B-Variante und Gemma 4. Sein Fazit fiel ernüchternd aus: Im Vergleich zu den Online-Modellen ist das “schnarchlangsam”, der Lüfter läuft ständig, und Komfortfunktionen wie Cowork oder Claude Code fehlen – auf iOS lässt sich so kaum mit Dateien arbeiten. Für kleinere Aufgaben, etwa die gemeinsame Planung einer Reise, funktioniert es; für seine großen Projekte nicht. Mehr Geld für leistungsfähigere Hardware will er vorerst nicht ausgeben.
Jörg nutzt Qwen 3.8 auf einem 64-GB-Rechner über Open WebUI als Chat und findet die Qualität durchaus brauchbar, wenn man etwas Geduld mitbringt. Die 4-Bit-Variante sei laut Tests nur etwa drei Prozent schlechter als die große. Swen Bauer berichtete von einem Kunden, der Qwen 3.8 auf einem Hetzner-Server agentisch einsetzt; durch das Caching im Hauptspeicher laufe das recht flüssig. Außerdem hat er FileMaker an LM Studio angebunden und berechnet die Embeddings nun lokal – erfreulich schnell.
Zum Schluss ging es noch um die Größe des Kontextfensters. Jörg beginnt meist ab etwa 30 Prozent Auslastung eine neue Session. Adam gab zu bedenken, dass 30 Prozent von einer Million Tokens bereits mehr sind als jeder Kontext, den man früher hatte – und dass ein sehr großer Kontext “nicht so gesund” sei: Je mehr Daten, desto unzuverlässiger das Ergebnis.
Weitere Infos
GPT 6 Astra
https://openai.com/de-DE/index/gpt-6-astra/
Claude Fable 5.1 and Mythos 5.1
https://www.anthropic.com/claude-fable-and-mythos-5-1
Atlas Worldmodel
https://www.worldlabs.ai/blog/atlas
Hermes Agent - Bot Mode
https://hermes-agent.nousresearch.com/docs/user-guide/bot-mode
Grok Bot
https://x.ai/bot
Warmwind - Autonome Cloud-Workforce
https://warmwind.com
Junie Local
https://junie.jetbrains.com/blog/junie-local-launch/
SwarmLLM - Peer-to-peer LLM inference in the browser
https://pooled.run
Github: pooled
https://github.com/Nehanth/pooled
EXO Labs
https://exolabs.net
Hugging Face: Qwen 3.8 27B
https://huggingface.co/Qwen/Qwen3.8-27B
heise+ Lokale Kl ausprobiert: Das leistet Qwen3.8-27B
https://www.heise.de/news/Lokale-KI-ausprobiert-Das-leistet-Qwen3-8-27B-11415293.html