Объясните KV-кэширование и квантование в инференсе LLM — почему они важны?
KV-кэш хранит векторы key и value, посчитанные для предыдущих токенов, так что генерация каждого нового токена требует attention только для этого одного нового токена вместо пересчёта всей последовательности — без этого авторегрессивная генерация была бы квадратично медленнее. Квантование снижает точность весов (например, с FP16 до INT8 или INT4), уменьшая потребление памяти и повышая пропускную способность, обменивая небольшую, обычно приемлемую потерю качества на значительное снижение стоимости serving. Именно эти два приёма делают экономически возможным обслуживание модели на 70 миллиардов параметров вообще.