DSpark : prédire plusieurs tokens d'avance avec un draft model pour accélérer le decoding
Un draft model prédit plusieurs tokens à l'avance, le gros modèle les vérifie d'un coup. Comment DSpark corrige les défauts des approches existantes, et ce que trois méthodes donnent réellement sur deux RTX 3090 : le drafter dédié perd, la méthode sans modèle gagne.