Erkläre KV-Caching und Quantisierung bei LLM-Inferenz — warum sind sie wichtig?
KV-Caching speichert die für vorherige Tokens berechneten Key- und Value-Vektoren, sodass die Generierung jedes neuen Tokens nur Attention für dieses eine neue Token benötigt, statt die gesamte Sequenz neu zu berechnen — ohne das wäre autoregressive Generierung quadratisch langsamer. Quantisierung reduziert die Präzision der Gewichte (etwa von FP16 zu INT8 oder INT4), um den Speicherbedarf zu senken und den Durchsatz zu steigern, wobei ein kleiner, meist akzeptabler Genauigkeitsverlust gegen eine deutliche Senkung der Serving-Kosten getauscht wird. Beides zusammen macht das Servieren eines 70-Milliarden-Parameter-Modells überhaupt erst wirtschaftlich sinnvoll.