SageMaker AI : Inférence divisée par 2 grâce à 32 tokens parallèles
AmazonSageMaker AI utilise une architecture P-EAGLE innovante pour générer jusqu'à 32 tokens parallèles. Cette approche réduit l'inférence de moitié, marquant un changement majeur dans le traitement du langage.
Read Report →