Поясніть KV-кешування та квантування в інференсі LLM — чому вони важливі?
KV-кеш зберігає вектори key і value, пораховані для попередніх токенів, тож генерація кожного нового токена потребує attention лише для цього одного нового токена замість перерахунку всієї послідовності — без цього авторегресивна генерація була б квадратично повільнішою. Квантування знижує точність ваг (наприклад, з FP16 до INT8 чи INT4), зменшуючи споживання памʼяті й підвищуючи пропускну здатність, обмінюючи невелику, зазвичай прийнятну втрату якості на суттєве зниження вартості serving. Саме ці два прийоми роблять економічно можливим обслуговування моделі на 70 мільярдів параметрів узагалі.