Explica el KV caching y la cuantización en inferencia de LLM — ¿por qué importan?
El KV caching guarda los vectores key y value calculados para tokens anteriores, así generar cada token nuevo solo requiere calcular attention para ese único token nuevo en vez de recalcular toda la secuencia — sin esto, la generación autorregresiva sería cuadráticamente más lenta. La cuantización reduce la precisión de los pesos (de FP16 a INT8 o INT4, por ejemplo) para reducir el uso de memoria y aumentar el throughput, cambiando una pérdida de precisión pequeña, normalmente aceptable, por una gran reducción en el costo de serving. Ambas cosas son las que hacen económicamente viable servir un modelo de 70 mil millones de parámetros.