AI At Home Part 2: Multi GPU Drifting
kept by elaramirez
The author boosted Deepseek V4 Flash inference from ~10 to ~20 tokens/sec on four e-waste AMD V620 GPUs by using layer parallelism and a speculative draft model.