World Wires · story 28612 · corroborated · 1 source(s)

Training Parallel Speculative Draft Models for LLM Inference

A method is proposed to train parallel and semi-autoregressive draft models by directly minimizing expected decoding rounds for speculative inference.

Open in the desk

Coverage

What this site indexes