Zum Inhalt

Modell-Rollen

Jede Rolle ist durch ein Turnier belegt, nicht durch ein Datenblatt. Stand: Testrunde 2, abgeschlossen am 31.07.2026. Die Konfiguration dazu steht in llama-swap/config.yaml, die vollständigen Turnierprotokolle im aiserver-Repo unter docs/testrunde-2/.

Gesetzte Rollen

Rolle Modell Quelle Gruppe Kennwerte
Voice-Agent qwen3:4b-instruct-2507 Q4_K_M Ollama-Blob resident 24/25 Kommandos, End-to-End 634 ms mit Parakeet
Embeddings embeddinggemma:300m Q8 HF-GGUF resident R@5 93 %, MRR 0,756, 6 ms
Brain / Standard qwen3.6:35b MTP HF-GGUF (unsloth) heavy 89 t/s, Langkontext 110k Nadeln 5/5
Coder qwen3-coder:30b Ollama-Blob heavy 93 t/s, Tool-Calls fehlerfrei
Übersetzer gemma4:26b + MTP-Draft HF-GGUF (ggml-org) heavy 79–86 t/s, Turnier-Sieger
Vision qwen3-vl:4b + mmproj HF-GGUF (Qwen) heavy 1,5–3 s je Bild
OCR german-ocr-3.1 Q8 + mmproj HF-GGUF (Keyven) docs Konsens-Recall 90,1 %
Allrounder (nur Text) nemotron3 / Nano-Omni-30B HF-GGUF (unsloth) heavy 61 t/s, Sieger bei Token-Effizienz
Cleanup / Präzision laguna-xs-2.1 Q8 Ollama-Blob heavy 63 t/s, --reasoning-budget 0
JSON / Metadaten granite4.1:8b Ollama-Blob docs 3/3 valide, ~2 s je Dokument
ASR parakeet-tdt-0.6b-v3 eigener Container CPU WER 7,6 %, 0,12 s je Kommando
TTS Piper de_DE-thorsten-high eigener Container CPU

Die Modell-IDs an der API tragen alle das Suffix -llamacpp, etwa brain-llamacpp.

Entscheidungen hinter den Rollen

Langkontext gehört zu Brain. Im Nachtest mit Nadeln in echtem Vault-Text findet qwen3.6 bei 110k Tokens 5/5, bei 55k 3/5. gpt-oss schafft bei 55k 4/5 — mehr gibt seine 65k-Konfiguration nicht her — bei 2,5-fachem Prefill-Aufwand (257 s gegen 104 s). Mehr nutzbarer Kontext, schnelleres Einlesen, gleiche Trefferquote: gpt-oss wurde damit verzichtbar und gelöscht.

Die JSON-Klasse arbeitet zweistufig. ocr extrahiert Text, json zieht daraus die Felder. Einstufiges german-ocr-JSON scheiterte in 2 von 3 Fällen an unquoteten deutschen Dezimalkommas (66,90) und verwechselte einmal Absender und Empfänger. Deshalb liegen beide in derselben Gruppe docs.

Vision ging an das kleinere Modell. Im Turnier schlug die MoE-Architektur die dichten Modelle um Faktor 4,3 bei der Geschwindigkeit; minicpm-v4.6 fiel als serieller Halluzinator auf. nemotron3 ist für Vision gesperrt — der Runner blieb hängen; die Rolle hat qwen3-vl:4b.

Die NPU spielt nicht mit. Whisper auf der NPU verlor den Sprachpfad-Vergleich doppelt: WER 12,1 % gegen 7,6 % und die 16-fache Latenz. In zwei Testrunden fand sich kein Anwendungsfall — der FastFlowLM-Stack ist stillgelegt.

Modelle ohne Rolle

Bewusst behalten, weil eine Neubeschaffung teurer wäre als der Plattenplatz:

Modell Grund Größe
qwen3.5:4b Qualitätsreserve für Voice (25/25 im Test) 3,4 GB
gemma4:e4b Audio-Fallback einstufig 9,6 GB
bge-m3:567m Embedding-Reserve — ein Indexwechsel bedeutet Neuaufbau 1,2 GB

Pflicht-Blobs — nicht löschen

qwen3-coder:30b · qwen3:4b-instruct-2507-q4_K_M · laguna-xs-2.1:q8_0 · granite4.1:8b. llama-swap liest diese Blobs als Dateien. Siehe llama-swap.

Aufräumen nach Testrunde 2

Am 31.07.2026 wurden rund 585 GB Modellbestand gelöscht — 30 Manifeste über ollama rm, dazu HF-gptoss und ein redundantes GGUF. /opt ging von 853 auf 231 GB belegt zurück (−622 GB), der Blob-Store auf 71 GB, die HF-GGUFs auf ~68 GB. Alle vier Pflicht-Blobs wurden nach der Löschung verifiziert.

Die größten Posten: nemotron-3-super:120b (86 GB, in keinem Turnier vorn), devstral-2:123b (74 GB, RADV-Wedge), gpt-oss:120b (65 + 63 GB, Rolle an qwen3.6 verloren).

Nutzung in der Oberfläche

Acht Rollen sind in Open WebUI sichtbar und dort mit Anzeigenamen und Beschreibung versehen. voice-llamacpp und embed-llamacpp sind ausgeblendet: Die eine gehört Home Assistant und ist auf kurze Sprachkommandos getrimmt, die andere ist kein Chat-Modell — ein Chatversuch liefert einen Vektor.

Beobachtungsliste

Kandidaten aus der Scout-Recherche, die noch nicht getestet sind (docs/modell-radar.md im aiserver-Repo):

Kandidat Klasse Warum interessant Warum vertagt
GLM-4.7-Flash 30B-A3B Coder 59,2 % SWE-bench Verified, MIT-Lizenz Coder nicht dringend; llama.cpp-Historie turbulent
Soofi S 30B-A3B Brain (Deutsch) Deutsches Konsortium, Deutsch hochgewichtet Closed Beta, Instruct-Preview erst auf 14B-Niveau
DeepSeek-OCR-2 OCR Seit Mai 2026 offiziell in llama.cpp GGUF-Setup mit mmproj aufwendiger
Qwen3-Embedding 4b/8b Embeddings MTEB-Multilingual deutlich über bge-m3 Lizenzlage uneinheitlich berichtet

Für deutschsprachiges Transkript-Cleanup existiert kein Spezialmodell — die Nische ist englisch. Der gemessene laguna-Ansatz bleibt der Stand der Dinge.