线程之下的并行性 在将 Rust 线程带到 GPU时,我们将每个 std::thread 映射到 GPU 的一个 warp。这让我们可以在 GPU 上运行许多并发线程,但并没有使用每个线程/warp 内部的并行 lane。 在 CPU...
LLM 工程师需要的直觉,无需硬件手册。 读完本文,量化、投机解码(Speculative Decoding)、连续批处理(Continuous Batching)等技术,看起来就不再是一串需要死记硬背的技巧了。 有一件事几乎让每个...