Messung · 8. September 2026
llama.cpp gegen halogen-flash-server.
Dasselbe Modell, dieselben zwanzig Aufgaben, dieselbe Reihenfolge: 17 gegen 18 gelöste Aufgaben, aber 486 gegen 157 Minuten.
Qwen3.8-Flash-Next auf dem HP ZBook Ultra G1a
- 886Token/s
- Prompt-Verarbeitungbei 69.000 Token Kontext
- 39,9Token/s
- Ausgabe im langen Kontextdieselben 69.000 Token im Vorlauf
- 39,3Token/s
- Ausgabe im Chatkurze Fragen, unter 800 Token Prompt
- 157Minuten
- für alle zwanzig Aufgaben339.134 Token erzeugt
Gemessen mit halogen-flash-server. Mittelwerte über die Aufgaben der jeweiligen Gruppe, gemessen an den Antworten des Laufs selbst, nicht an Füllsätzen. Temperatur 0, Prompt-Cache aus, 70 W GPU-Budget.
Messbericht öffnen

