Large Language Models : GPT, Claude, Llama, fine-tuning et prompting
LLMAvancé
Pourquoi un GPU qui génère pour un seul utilisateur tourne à vide, comment le continuous batching et PagedAttention corrigent ça, et comment régler vLLM en production.
18 min de lecture · 5 vues
LLMIntermédiaire
Comprenez le KV cache, la structure qui évite de recalculer toute l'attention à chaque token généré, et apprenez à estimer combien de mémoire GPU il consomme.
12 min de lecture · 4 vues
LLMDébutant
Installez et utilisez des LLMs directement sur votre machine avec Ollama : confidentialité totale, coût zéro, et intégration Python en quelques lignes.
15 min de lecture · 40 vues
LLMIntermédiaire
Découvrez comment les LLMs décomposent le texte en tokens, pourquoi le français coûte plus cher que l'anglais, et comment maîtriser vos coûts d'API avec tiktoken.
16 min de lecture · 97 vues
LLMIntermédiaire
Comprenez les limites de mémoire des LLMs, le phénomène lost-in-the-middle, et maîtrisez les stratégies pour gérer efficacement de longs contextes en production.
18 min de lecture · 36 vues
LLMDébutant
Comment fonctionnent ChatGPT, Claude et Llama ? Découvrez la tokenisation, la génération de texte et apprenez à bien utiliser les LLMs.
22 min de lecture · 74 vues
LLMIntermédiaire
Maîtrisez les techniques avancées de prompting (CoT, few-shot, JSON mode) et construisez des applications avec les APIs LLM et le function calling.
25 min de lecture · 39 vues
LLMAvancé
Personnalisez des LLMs avec LoRA/QLoRA, exécutez des modèles en local avec Ollama et maîtrisez la quantification (GGUF, AWQ).
28 min de lecture · 42 vues
LLMAvancé
Explorez les outils de pointe : JAX vs PyTorch, RAG et vector search, alignement des LLMs avec DPO et GRPO.
7 min de lecture · 45 vues