Bei der Inferenz wendet das Modell sein bereits gelerntes Wissen an, ohne seine internen Parameter zu veraendern. Sie ist der Schritt, der jedes Mal ablaeuft, wenn du mit ChatGPT oder Claude interagierst. Die Geschwindigkeit der Inferenz (Latenz) und die dabei verbrauchten Token bestimmen Kosten und Nutzererlebnis. Optimierungen wie Quantisierung und Caching machen die Inferenz schneller und guenstiger.
