Agents AI - Introduction aux terminologies LLM et AI
AI Agents - Introduction to LLM and AI Terminologies
LLM LLM est un modèle, ce qui signifie une équation. Exemple : Un modèle est en fait composé de poids. Dans n'importe quel modèle, par exemple le modèle ChatGPT ou le modèle Gemini, ils auraient utilisé une grande quantité d'entrées pour former le modèle. Entrée signifie une grande quantité de données texte/image qui est disponible sur Internet. L'entrée aurait été introduite dans l'architecture Transformer pour obtenir la sortie, qui est le modèle. Les poids sont des nombres flottants qui représentent les paramètres appris du modèle. Un modèle de paramètre 10B ou 100B signifie combien de paramètres (poids) sont présents à l'intérieur du modèle. Nous ne pouvons pas stocker un modèle de grand paramètre sur notre ordinateur en raison de la puissance de stockage et de calcul insuffisante. Le stockage et la puissance CPU/GPU décident de la taille du modèle qui peut être exécuté sur un ordinateur. Pour exécuter un modèle localement, nous pouvons utiliser...
LLM LLM est un modèle, ce qui signifie une équation. Exemple : Un modèle est en fait composé de poids. Dans n'importe quel modèle, par exemple le modèle ChatGPT ou le modèle Gemini, ils auraient utilisé une grande quantité d'entrées pour former le modèle. Entrée signifie une grande quantité de données texte/image qui est disponible sur Internet. L'entrée aurait été introduite dans l'architecture Transformer pour obtenir la sortie, qui est le modèle. Les poids sont des nombres flottants qui représentent les paramètres appris du modèle. Un modèle de paramètre 10B ou 100B signifie combien de paramètres (poids) sont présents à l'intérieur du modèle. Nous ne pouvons pas stocker un modèle de grand paramètre sur notre ordinateur en raison de la puissance de stockage et de calcul insuffisante. Le stockage et la puissance CPU/GPU décident de la taille du modèle qui peut être exécuté sur un ordinateur. Pour exécuter un modèle localement, nous pouvons utiliser l'un des outils suivants : Llama.cpp Ollama LM Studio Open Weight Model vs Open Source Model Un modèle à poids ouvert partage ses poids modèles. Donc, nous pouvons les diriger, les affiner et les accueillir sur un système local. Ici, le code de formation, les données et la méthodologie complète ne sont pas partagés. Alors que, dans un modèle open-source, les poids, le code de formation, les données et parfois l'ensemble de données sont partagés. Pourquoi devons-nous utiliser les LLM? LLM est un prédicteur du mot suivant. Supposons qu'on demande : "Salut, comment..." La réponse peut être: Comment allez-vous? Comment allez-vous ? Comment va ta vie ? etc. Ce sont des possibilités. Ici, la plupart du temps, la réponse sera "Comment allez-vous?" parce que si un mot a plus de présence, il a une possibilité plus élevée de se produire. Chaque possibilité aura un score entre 0 et 1. Nous avons 3 paramètres de contrôle pour contrôler la sortie générée par le LLM. 1. Température habituellement réglée à partir de 0–1. Il contrôle le caractère aléatoire du modèle. Si la valeur est 0–0,3, ce qui est faible, cela signifie générer les mots les plus probables, c'est-à-dire les faits ou les mots courants. Si la valeur est élevée, le modèle choisira des mots moins probables. Nous utilisons cette grande valeur dans la narration et l'écriture créative. 2. Haut K Contrôle le nombre de possibilités. Par exemple, K = 3 signifie choisir seulement les 3 possibilités les plus probables. Top K sera utilisé avec la température. Par exemple, si nous définissons Top K = 5 et Temperature = 0.5, le LLM prendra des possibilités à partir des valeurs de Top K sélectionnées en fonction de la température. Top K est utilisé pour limiter le nombre de possibilités. 3. Haut P Elle est également appelée méthode d'échantillonnage. Les scores de possibilité sont ajoutés jusqu'à ce qu'ils atteignent la valeur définie dans Top P. Top P est également utilisé avec Température. Jetons Les jetons sont le processus de division des mots en petits morceaux. Une petite pièce peut ne pas être complète. Par exemple, un jeton peut être divisé en « vers » et « jetons ». Ceux-ci sont appelés jetons, et le processus est appelé tokenisation. Un tokenizer, comme ceux utilisés par OpenAI et GPT, peut être utilisé. Nous pouvons spécifier la taille du jeton que nous voulons diviser. Chaque jeton sera représenté par un nombre, qui à son tour est converti en un encastrement. Fenêtre contextuelle C'est une mémoire à court terme. La fenêtre contextuelle est le nombre maximal de jetons qu'un modèle peut voir à un moment donné. La fenêtre contextuelle courte et la fenêtre contextuelle longue sont les types.