Saturação GPU e caches KV: SageMaker Inference Gateway supera o gargalo de 100 bilhões de parâmetros
amazon-sagemaker-inference-gatewayOs sistemas de inferência generativa operam sob uma tensão física constante entre a capacidade de memória dos chips e os requisitos de latência impostos pelos usuários finais. Quando um modelo linguístico gera texto, o contexto anterior é armazenado em estruturas chamadas caches Key-Value (KV), residindo diretamente na VRAM da GPU. Essa ineficiência estrutural é abordada com o lançamento do Amazon SageMaker Inference Gateway, um addon Kubernetes-native projetado para gerenciar o roteamento em nível de cluster dedicado. A solução proposta pela AWS move o foco da disponibilidade do nó para a disponibilidade da capacidade lógica dentro do chip.
Read Report →