Le couteau suisse à l'heure de l'IA
Retour d'expérience sur la migration de KServe/vLLM vers llama.cpp pour servir GLM-4.7-Flash sur une RTX 3090, avec n-gram speculative decoding.