#qwen

digestqwenopen-source
Qwen3.8-27B на одній RTX 3090: 140 tok/s із CUDA megakernel
Автор у Reddit заявляє 140 tok/s для Qwen3.8-27B на одній RTX 3090, це у 1,4-1,9 раза швидше за llama.cpp. Код на GitHub.

Автор у Reddit заявляє 140 tok/s для Qwen3.8-27B на одній RTX 3090, це у 1,4-1,9 раза швидше за llama.cpp. Код на GitHub.