Récemment, ChatGPT est devenu le nouveau point chaud de l'IA, Microsoft et Google dans la Silicon Valley investissant massivement dans cette technologie (Microsoft détient une participation de 10 milliards de dollars dans OpenAI, la société derrière ChatGPT, et Google a récemment publié son propre modèle BARD), tandis que les entreprises de technologie Internet en Chine, représentées par Baidu et d'autres, ont également indiqué qu'elles développent une telle technologie et qu'elles seront mises en service dans un proche avenir. En Chine, Baidu et d'autres sociétés de technologie Internet ont également indiqué qu'elles développaient de telles technologies et qu'elles les mettront en service dans un proche avenir.
Les modèles génératifs représentés par ChatGPT ont une caractéristique commune, à savoir qu'ils utilisent des données massives pour la pré-formation et sont souvent associés à un modèle de langage plus puissant. La fonction principale du modèle de langage est d'apprendre à partir du corpus massif existant, et après apprentissage, il peut comprendre les instructions linguistiques de l'utilisateur, ou en outre, générer une sortie de texte pertinente selon les instructions de l'utilisateur.
Les modèles génératifs peuvent être classés en deux grandes catégories, l'une étant les modèles génératifs basés sur le langage et l'autre les modèles génératifs basés sur l'image. Les modèles génératifs basés sur le langage sont représentés par ChatGPT, dont le modèle de langage peut non seulement apprendre à comprendre la signification des commandes de l'utilisateur (par exemple, "écrire un poème, dans le style de Li Bai"), mais également générer un texte pertinent basé sur l'utilisateur commandes après entraînement avec des données massives (dans l'exemple ci-dessus, écrire un poème dans le style de Li Bai). poème). Cela signifie que ChatGPT doit avoir un grand modèle de langage (LLM) qui comprend la langue de l'utilisateur et peut produire une sortie linguistique de haute qualité - par exemple, le modèle doit comprendre comment générer des poèmes, comment générer des poèmes dans le style de Li Bai , et ainsi de suite. Cela signifie également que les grands modèles de langage dans l'IA générative basée sur le langage nécessitent un très grand nombre de paramètres pour effectuer ce type d'apprentissage complexe et mémoriser autant d'informations. ChatGPT, par exemple, a 175 milliards de paramètres (700 Go d'espace de stockage si des nombres à virgule flottante standard sont utilisés), ce qui montre à quel point son modèle de langage est "grand".
Une autre classe de modèles génératifs est le modèle de génération d'images représenté par Diffusion, généralement Dalle d'OpenAI, ImaGen de Google, et actuellement le Stable Diffusion le plus populaire de Runway AI. Ces modèles de génération de type image utilisent également un modèle de langage pour comprendre les commandes linguistiques de l'utilisateur, puis génèrent des images de haute qualité basées sur ces commandes. Contrairement aux modèles génératifs basés sur le langage, le modèle de langage utilisé ici utilise principalement le langage pour comprendre l'entrée de l'utilisateur sans générer de sortie de langage, de sorte que le nombre de paramètres peut être assez petit (de l'ordre de quelques centaines de millions), tandis que le nombre de paramètres pour modèles de diffusion basés sur l'image est relativement petit, de l'ordre de quelques milliards au total, mais l'effort de calcul n'est pas faible car la résolution des images ou des vidéos générées peut être très élevée.
Les modèles génératifs peuvent produire une sortie de haute qualité sans précédent grâce à une formation massive de données, et il existe déjà un certain nombre de marchés d'applications clairs, y compris la recherche, les robots de dialogue, la génération et l'édition d'images, etc. puces associées.
Le besoin de puces pour générer des modèles de classe
Comme mentionné précédemment, ChatGPT représente un modèle génératif qui doit apprendre à partir de grandes quantités de données de formation afin d'obtenir une sortie générative de haute qualité. Afin de prendre en charge une formation et une inférence efficaces, les modèles génératifs ont leurs propres exigences pour les puces associées.
Le premier est le besoin de calcul distribué ; le nombre de paramètres pour les modèles générateurs de langage tels que ChatGPT se chiffre en centaines de milliards, et il est presque impossible d'utiliser la formation et l'inférence sur un seul ordinateur, mais beaucoup de calculs distribués doivent être utilisés. Dans l'informatique distribuée, la bande passante d'interconnexion de données entre les machines et la puce informatique pour une telle informatique distribuée (telle que RDMA) a une forte demande, car souvent le goulot d'étranglement de la tâche peut ne pas être dans l'informatique, mais dans l'interconnexion de données ci-dessus, en particulier dans ce type d'informatique distribuée à grande échelle, la puce pour le support efficace de l'informatique distribuée est devenue plus critique.
Vient ensuite la capacité mémoire et la bande passante. Bien que la formation distribuée et l'inférence soient inévitables pour les modèles génératifs basés sur le langage, la mémoire locale et la bande passante de chaque puce détermineront en grande partie l'efficacité d'exécution d'une seule puce (car la mémoire de chaque puce est utilisée à sa limite). Pour les modèles génératifs basés sur l'image, il est possible de mettre tous les modèles (environ 20 Go) dans la mémoire de la puce, mais à mesure que les modèles génératifs basés sur l'image évoluent davantage à l'avenir, il est probable que ses besoins en mémoire augmenteront également. . De ce point de vue, la technologie de mémoire à bande passante ultra élevée représentée par HBM deviendra le choix inévitable pour les puces accélératrices associées, tandis que les modèles de classe générative accéléreront également la mémoire HBM pour augmenter encore la capacité et la bande passante. En plus de HBM, de nouvelles technologies de stockage telles que CXL couplées à des optimisations logicielles auront également le potentiel d'augmenter la capacité et les performances du stockage local dans de telles applications et devraient être davantage adoptées par l'industrie grâce à la montée en puissance du modèle de classe générative.
Enfin, le calcul, les modèles de classe génératifs basés sur le langage et les images ont une grande demande de calcul, et les modèles génératifs basés sur l'image peuvent avoir une demande beaucoup plus élevée de puissance arithmétique car ils génèrent des résolutions de plus en plus élevées et se déplacent vers des applications vidéo. Les modèles génératifs d'images grand public ont un volume de calcul d'environ 20 TFlops, et en ce qui concerne la haute résolution et les images, 100-1000 TFLOPS de demande arithmétique est susceptible d'être la norme.
Pour résumer, nous pensons que les exigences des modèles génératifs pour les puces incluent l'informatique distribuée, le stockage et le calcul, ce qui peut être considéré comme impliquant tous les aspects de la conception des puces et, plus important encore, comment combiner toutes ces exigences de manière raisonnable. pour s'assurer qu'un seul aspect ne devienne pas un goulot d'étranglement, qui deviendra également un problème d'ingénierie du système de conception de puces.
GPU et la nouvelle puce AI, qui a de meilleures chances
Les modèles génératifs ont une nouvelle demande de puces. Qui a la meilleure chance de capter cette nouvelle demande et ce nouveau marché pour les GPU (représentés par Nvidia et AMD) et les nouvelles puces IA (représentées par Habana, GraphCore) ?
Premièrement, du point de vue des modèles génératifs basés sur le langage, les fournisseurs de GPU qui ont actuellement une disposition complète dans ce type d'écologie sont plus avantageux en raison du grand nombre de participants et de la nécessité d'un bon support informatique distribué. Il s'agit d'un problème d'ingénierie système qui nécessite une solution logicielle et matérielle complète, et à cet égard, Nvidia a combiné ses GPU pour lancer la solution Triton, qui prend en charge la formation distribuée et l'inférence distribuée, permettant à un modèle d'être divisé en plusieurs parties et traité sur différents GPU, résolvant ainsi le problème d'un trop grand nombre de paramètres qui ne peuvent pas être pris en charge par la mémoire principale d'un GPU. Cela résout le problème du trop grand nombre de paramètres pour la mémoire principale d'un GPU. Que vous utilisiez Triton directement ou que vous fassiez d'autres développements sur la base de Triton à l'avenir, il est plus pratique d'avoir un GPU écologique complet. D'un point de vue informatique, puisque le calcul principal du modèle de génération basé sur le langage est le calcul matriciel, qui est la force du GPU, la nouvelle puce AI n'a pas d'avantage évident sur le GPU de ce point de vue.
Du point de vue des modèles de génération basés sur l'image, le nombre de paramètres de tels modèles est également important mais un à deux ordres de grandeur plus petit que les modèles de génération basés sur le langage, en plus de son calcul sera encore utilisé dans un grand nombre de calculs convolutionnels, donc les applications d'inférence, si vous pouvez faire une très bonne optimisation, les puces AI peuvent avoir des opportunités. Ici, l'optimisation comprend une grande quantité de stockage sur puce pour prendre en charge les paramètres et les résultats de calcul intermédiaires, pour la convolution et la prise en charge efficace des opérations matricielles.
En général, la génération actuelle de puces IA est conçue pour cibler des modèles plus petits (nombre de paramètres au niveau du milliard, calcul au niveau 1TOPS), alors que la demande de modèles génératifs est encore relativement plus importante que l'objectif de conception d'origine. Les GPU sont conçus pour être plus flexibles au détriment de l'efficacité, tandis que les puces AI sont conçues pour faire le contraire, en recherchant l'efficacité de l'application cible. Par conséquent, nous pensons que les GPU domineront toujours cette accélération des modèles génératifs au cours des deux prochaines années, mais à mesure que les conceptions de modèles génératifs deviennent plus stables et que les conceptions de puces IA ont le temps de rattraper les itérations de modèles génératifs, les puces IA ont la possibilité de surpasser les GPU. dans l'espace du modèle génératif du point de vue de l'efficacité.

