Monday at 02:51 PM5 days am Mittwoch kommen noch zwei weitere dazu "Ja, genau der Benchmark passt. Ich habe ihn direkt auf deinem laufenden vLLM-Endpoint ausgeführt." <-- GPT CodexTool-Eval-Bench Short + PerfModel: qwen3.8-27bEndpoint: http://xxxxxxxxxxxEngine: vLLM 0.27.1Tokenizer: philbert440/Qwen3.8-27B-W4A16-AWQRun: --short --perf --benchy-runs 1Tool-Use Score15 / 15 PASS Score: 100 / 100 ★★★★★ Excellent Completed in 83.1sToken/s Wertepp2048 tg128 @ d0 c1: pp 2,254 t/s | tg 95.0 t/s | TTFT 991 ms pp2048 tg128 @ d0 c2: pp 1,875 t/s | tg 164.8 t/s | TTFT 2,235 ms pp2048 tg128 @ d0 c4: pp 1,563 t/s | tg 127.1 t/s | TTFT 3,462 ms pp2048 tg128 @ d4096 c1: pp 2,219 t/s | tg 77.2 t/s | TTFT 2,853 ms pp2048 tg128 @ d4096 c2: pp 2,179 t/s | tg 129.9 t/s | TTFT 5,566 ms pp2048 tg128 @ d4096 c4: pp 1,828 t/s | tg 64.7 t/s | TTFT 9,455 ms pp2048 tg128 @ d8192 c1: pp 2,120 t/s | tg 73.8 t/s | TTFT 4,915 ms pp2048 tg128 @ d8192 c2: pp 2,083 t/s | tg 122.1 t/s | TTFT 9,742 ms pp2048 tg128 @ d8192 c4: pp 1,714 t/s | tg 43.4 t/s | TTFT 17,321 msKurzfassung: Tool-Use perfekt, Prefill stark, Decode single-stream ~74-95 t/s je nach Context, c2 peak ~165 t/s. Edited Monday at 03:21 PM5 days by domrockt
Join the conversation
You can post now and register later. If you have an account, sign in now to post with your account.
Note: Your post will require moderator approval before it will be visible.