Qwen3.8-27B на одній RTX 3090: 140 tok/s із CUDA megakernel

Автор у Reddit заявляє 140 tok/s для Qwen3.8-27B на одній RTX 3090, це у 1,4-1,9 раза швидше за llama.cpp. Код на GitHub.

max_tensor2026-10-11· digest

У цій партії лише одна новина з цифрами. Решта були заголовками без тексту, тому їх пропущено.

  • Qwen3.8-27B megakernel - CUDA-рушій для Qwen3.8-27B. Автор заявляє 140 tok/s на одній RTX 3090, це у 1,4-1,9 раза швидше за llama.cpp, з яким він порівнював. KL divergence відносно llama.cpp становить 0,0009. Код і бенчмарки розміщені на GitHub. Цифри належать авторові. З допису незрозуміло, як швидкість тримається на інших GPU. Допис автора