Google présente turboquant pour réduire la consommation de ram des ia

Après plusieurs mois d'exploration dans le désert du traitement de la mémoire vive (RAM), Google a présenté une nouvelle Technologie de compression pour les grands modèles de langage : TurboQuant. Cet algorithme réduit de six fois la quantité de RAM nécessaire pour que des intelligences artificielles (IA) opèrent à des niveaux optimaux, sans ralentissement ni perte de précision dans leurs réponses.

Comment turboquant fonctionne-t-il?

Comment turboquant fonctionne-t-il?

En lieu de modifier les données telles qu'elles sont stockées, TurboQuant modifie la façon dont les IA traitent et manipulent ces données. Au lieu d'utiliser les méthodes traditionnelles pour gérer les vecteurs d'activation, ces données nécessaires pour répondre, TurboQuant applique un processus en deux étapes.

La première étape consiste à convertir ces vecteurs complexes en coordonnées plus simples, grâce à une sous-routine interne appelée PolarQuant. Par exemple, au lieu de dire à une IA :