Qwen3.8-27B на одній RTX 3090: 140 tok/s із CUDA megakernel
Автор у Reddit заявляє 140 tok/s для Qwen3.8-27B на одній RTX 3090, це у 1,4-1,9 раза швидше за llama.cpp. Код на GitHub.

У цій партії лише одна новина з цифрами. Решта були заголовками без тексту, тому їх пропущено.
- Qwen3.8-27B megakernel - CUDA-рушій для Qwen3.8-27B. Автор заявляє 140 tok/s на одній RTX 3090, це у 1,4-1,9 раза швидше за llama.cpp, з яким він порівнював. KL divergence відносно llama.cpp становить 0,0009. Код і бенчмарки розміщені на GitHub. Цифри належать авторові. З допису незрозуміло, як швидкість тримається на інших GPU. Допис автора

