Performans, Yavaş TPS, Yüksek Latency

GPU underutilized, CPU bottleneck, first-token latency, context çok büyük, quant seçimi etkisi, flash-attention, vLLM vs Ollama vs llama.cpp triyaj.