Explique o KV caching e a quantização na inferência de LLM — por que eles importam?
O KV caching guarda os vetores key e value calculados para tokens anteriores, então gerar cada novo token exige calcular attention apenas para esse novo token, em vez de recalcular a sequência inteira — sem isso, a geração autorregressiva seria quadraticamente mais lenta. A quantização reduz a precisão dos pesos (de FP16 para INT8 ou INT4, por exemplo) para diminuir o uso de memória e aumentar o throughput, trocando uma perda pequena e geralmente aceitável de precisão por uma grande redução no custo de serving. Os dois juntos são o que tornam viável, economicamente, servir um modelo de 70 bilhões de parâmetros.