#qwen

digestqwenopen-source

Qwen3.8-27B на одній RTX 3090: 140 tok/s із CUDA megakernel

Автор у Reddit заявляє 140 tok/s для Qwen3.8-27B на одній RTX 3090, це у 1,4-1,9 раза швидше за llama.cpp. Код на GitHub.

max_tensor2026-10-11