Modell-Rollen¶
Jede Rolle ist durch ein Turnier belegt, nicht durch ein Datenblatt. Stand:
Testrunde 2, abgeschlossen am 31.07.2026. Die Konfiguration dazu steht in
llama-swap/config.yaml, die vollständigen Turnierprotokolle im aiserver-Repo
unter docs/testrunde-2/.
Gesetzte Rollen¶
| Rolle | Modell | Quelle | Gruppe | Kennwerte |
|---|---|---|---|---|
| Voice-Agent | qwen3:4b-instruct-2507 Q4_K_M | Ollama-Blob | resident | 24/25 Kommandos, End-to-End 634 ms mit Parakeet |
| Embeddings | embeddinggemma:300m Q8 | HF-GGUF | resident | R@5 93 %, MRR 0,756, 6 ms |
| Brain / Standard | qwen3.6:35b MTP | HF-GGUF (unsloth) | heavy | 89 t/s, Langkontext 110k Nadeln 5/5 |
| Coder | qwen3-coder:30b | Ollama-Blob | heavy | 93 t/s, Tool-Calls fehlerfrei |
| Übersetzer | gemma4:26b + MTP-Draft | HF-GGUF (ggml-org) | heavy | 79–86 t/s, Turnier-Sieger |
| Vision | qwen3-vl:4b + mmproj | HF-GGUF (Qwen) | heavy | 1,5–3 s je Bild |
| OCR | german-ocr-3.1 Q8 + mmproj | HF-GGUF (Keyven) | docs | Konsens-Recall 90,1 % |
| Allrounder (nur Text) | nemotron3 / Nano-Omni-30B | HF-GGUF (unsloth) | heavy | 61 t/s, Sieger bei Token-Effizienz |
| Cleanup / Präzision | laguna-xs-2.1 Q8 | Ollama-Blob | heavy | 63 t/s, --reasoning-budget 0 |
| JSON / Metadaten | granite4.1:8b | Ollama-Blob | docs | 3/3 valide, ~2 s je Dokument |
| ASR | parakeet-tdt-0.6b-v3 | eigener Container | CPU | WER 7,6 %, 0,12 s je Kommando |
| TTS | Piper de_DE-thorsten-high |
eigener Container | CPU | — |
Die Modell-IDs an der API tragen alle das Suffix -llamacpp, etwa
brain-llamacpp.
Entscheidungen hinter den Rollen¶
Langkontext gehört zu Brain. Im Nachtest mit Nadeln in echtem Vault-Text findet qwen3.6 bei 110k Tokens 5/5, bei 55k 3/5. gpt-oss schafft bei 55k 4/5 — mehr gibt seine 65k-Konfiguration nicht her — bei 2,5-fachem Prefill-Aufwand (257 s gegen 104 s). Mehr nutzbarer Kontext, schnelleres Einlesen, gleiche Trefferquote: gpt-oss wurde damit verzichtbar und gelöscht.
Die JSON-Klasse arbeitet zweistufig. ocr extrahiert Text, json zieht
daraus die Felder. Einstufiges german-ocr-JSON scheiterte in 2 von 3 Fällen an
unquoteten deutschen Dezimalkommas (66,90) und verwechselte einmal Absender
und Empfänger. Deshalb liegen beide in derselben Gruppe docs.
Vision ging an das kleinere Modell. Im Turnier schlug die MoE-Architektur
die dichten Modelle um Faktor 4,3 bei der Geschwindigkeit; minicpm-v4.6 fiel
als serieller Halluzinator auf. nemotron3 ist für Vision gesperrt — der
Runner blieb hängen; die Rolle hat qwen3-vl:4b.
Die NPU spielt nicht mit. Whisper auf der NPU verlor den Sprachpfad-Vergleich doppelt: WER 12,1 % gegen 7,6 % und die 16-fache Latenz. In zwei Testrunden fand sich kein Anwendungsfall — der FastFlowLM-Stack ist stillgelegt.
Modelle ohne Rolle¶
Bewusst behalten, weil eine Neubeschaffung teurer wäre als der Plattenplatz:
| Modell | Grund | Größe |
|---|---|---|
| qwen3.5:4b | Qualitätsreserve für Voice (25/25 im Test) | 3,4 GB |
| gemma4:e4b | Audio-Fallback einstufig | 9,6 GB |
| bge-m3:567m | Embedding-Reserve — ein Indexwechsel bedeutet Neuaufbau | 1,2 GB |
Pflicht-Blobs — nicht löschen
qwen3-coder:30b · qwen3:4b-instruct-2507-q4_K_M · laguna-xs-2.1:q8_0 ·
granite4.1:8b. llama-swap liest diese Blobs als Dateien. Siehe
llama-swap.
Aufräumen nach Testrunde 2¶
Am 31.07.2026 wurden rund 585 GB Modellbestand gelöscht — 30 Manifeste über
ollama rm, dazu HF-gptoss und ein redundantes GGUF. /opt ging von 853 auf
231 GB belegt zurück (−622 GB), der Blob-Store auf 71 GB, die HF-GGUFs auf
~68 GB. Alle vier Pflicht-Blobs wurden nach der Löschung verifiziert.
Die größten Posten: nemotron-3-super:120b (86 GB, in keinem Turnier vorn),
devstral-2:123b (74 GB, RADV-Wedge), gpt-oss:120b (65 + 63 GB, Rolle an
qwen3.6 verloren).
Nutzung in der Oberfläche¶
Acht Rollen sind in Open WebUI sichtbar und dort mit
Anzeigenamen und Beschreibung versehen. voice-llamacpp und embed-llamacpp
sind ausgeblendet: Die eine gehört Home Assistant und ist auf kurze
Sprachkommandos getrimmt, die andere ist kein Chat-Modell — ein Chatversuch
liefert einen Vektor.
Beobachtungsliste¶
Kandidaten aus der Scout-Recherche, die noch nicht getestet sind
(docs/modell-radar.md im aiserver-Repo):
| Kandidat | Klasse | Warum interessant | Warum vertagt |
|---|---|---|---|
| GLM-4.7-Flash 30B-A3B | Coder | 59,2 % SWE-bench Verified, MIT-Lizenz | Coder nicht dringend; llama.cpp-Historie turbulent |
| Soofi S 30B-A3B | Brain (Deutsch) | Deutsches Konsortium, Deutsch hochgewichtet | Closed Beta, Instruct-Preview erst auf 14B-Niveau |
| DeepSeek-OCR-2 | OCR | Seit Mai 2026 offiziell in llama.cpp | GGUF-Setup mit mmproj aufwendiger |
| Qwen3-Embedding 4b/8b | Embeddings | MTEB-Multilingual deutlich über bge-m3 | Lizenzlage uneinheitlich berichtet |
Für deutschsprachiges Transkript-Cleanup existiert kein Spezialmodell — die Nische ist englisch. Der gemessene laguna-Ansatz bleibt der Stand der Dinge.