Learn/Core Concept How does speculative decoding speed inference? Speculative decoding uses a smaller draft model to suggest tokens, then a larger model verifies them in batches. It can cut latency without changing output quality, as llm-visuals helps measure. InferenceLatency |