Reading up on Gemma4-31B
1 deep · digging since aug 20
- AI At Home Part 2: Multi GPU Drifting
The author boosted Deepseek V4 Flash inference from ~10 to ~20 tokens/sec on four e-waste AMD V620 GPUs by using layer parallelism and a speculative draft model.