Saturación GPU y KV Cache: SageMaker Inference Gateway Rellena el Cuello de Botella
algoritmos-round-robinLos sistemas de inferencia generativa operan bajo una tensión física constante entre la capacidad de memoria de los chips y los requisitos de latencia impuestos por los usuarios finales. Cuando un modelo lingüístico genera texto, el contexto anterior se almacena en estructuras llamadas cachés Key-Value (KV), residiendo directamente en la VRAM de la GPU. Los balanceadores de carga tradicionales de Kubernetes, basados en algoritmos round-robin o least-connections, distribuyen las solicitudes sin ninguna visibilidad sobre el estado interno de estos acumuladores. El resultado es una saturación asimétrica: algunos nodos alcanzan el límite de memoria y activan operaciones de swapping hacia la RAM del sistema, un cuello de botella que multiplica los tiempos de respuesta, mientras que otros permanecen subutilizados.
Read Report →