Publié le · Par Tetyana Tarasenko, développeuse IA · Lecture : ~20 min · Données vérifiées au 31 juillet 2026
Top 25 des meilleurs LLM open source en 2026 : DeepSeek, Qwen3, Llama 4, Mistral, Gemma et les autres
Mis à jour en juillet 2026, ce comparatif présente les 25 meilleurs LLM open weight disponibles, leurs performances sur les benchmarks clés (MMLU, GPQA, SWE-bench, MATH-500), leurs besoins en VRAM, leurs licences et leurs principaux cas d'utilisation — du datacenter au smartphone.
Note open source vs open weight : par simplification et pour correspondre aux recherches courantes, cet article emploie l'expression « LLM open source ». Techniquement, la grande majorité des modèles présentés sont des modèles open weight : leurs poids sont accessibles publiquement, mais les données d'entraînement et le code complet ne sont pas toujours publiés. Seuls quelques projets (CroissantLLM, Lucie) satisfont aux critères stricts de l'open source.
1. Pourquoi les modèles open weight sont incontournables en 2026
En 2023, GPT-4 distançait les meilleurs modèles ouverts de plusieurs générations. En juillet 2026, l'écart s'est fortement réduit — et sur certains benchmarks spécifiques, des modèles open weight se hissent au niveau ou au-dessus des modèles propriétaires. Les modèles propriétaires conservent cependant des avantages sur la robustesse agentique, la multimodalité avancée et la disponibilité d'API.
Trois facteurs expliquent la progression des modèles ouverts :
Le Mixture of Experts permet de créer des modèles avec des centaines de milliards de paramètres tout en n'activant qu'une fraction (10–20%) par token. Résultat : des performances de modèles très grands, avec une inférence proche des modèles denses de taille réduite.
Alibaba (Qwen), DeepSeek, Zhipu AI (GLM), Moonshot AI (Kimi) et MiniMax ont publié en open weight des modèles qui rivalisent — ou surpassent — GPT-4o et Claude Opus sur plusieurs benchmarks.
Apache 2.0 et MIT sont devenues très courantes parmi les nouveaux modèles ouverts : usage commercial libre, fine-tuning, redistribution sans restriction. C'est un changement majeur par rapport à 2023, où les licences restrictives (non-commerciales, usage limité) dominaient.
Ce comparatif couvre 25 modèles open weight publiés jusqu'en juillet 2026, sélectionnés à partir de leurs fiches techniques officielles, de benchmarks publics et de résultats publiés par les éditeurs ou des plateformes indépendantes (LMSYS Arena, Papers with Code, SWE-bench.com). Certains modèles ont été testés directement par notre équipe (Qwen3-8B, Qwen3-32B, DeepSeek-R1-Distill-Qwen-32B, Phi-4 14B, Mistral Small 3.1), d'autres sont présentés sur la base des données officielles. Les caractéristiques des modèles uniquement disponibles via API (et non téléchargeables) ne sont pas incluses dans ce classement.
2. Les benchmarks expliqués
Avant de plonger dans le classement, voici les benchmarks utilisés et ce qu'ils mesurent réellement :
| Benchmark | Ce qu'il mesure | Fiabilité / limites |
|---|---|---|
| MMLU | Culture générale — 57 domaines (droit, médecine, sciences, histoire…) | Largement saturé, forte contamination possible |
| MMLU-Pro / GPQA Diamond | Culture générale avancée · Questions doctorat (chimie, physique, bio) | Plus fiables que MMLU classique |
| MATH-500 / AIME | Raisonnement mathématique — problèmes niveau lycée à compétition olympiade | Fiable pour les modèles de raisonnement |
| SWE-bench Verified | Résolution de vrais bugs GitHub — 500 issues validées par des humains | Parmi les plus fiables pour le code. Les scores avec agent ≠ modèle seul |
| HumanEval | Génération de code Python — résolution de fonctions à partir de docstrings | Saturé (~90%+ pour les grands modèles). Préférer SWE-bench |
| Arena ELO (LMSYS) | Préférences humaines — votes blind sur des millions de comparaisons | Référence fiable et indépendante des éditeurs pour l'usage général |
3. Tableau comparatif des 25 modèles
Ce tableau présente les 25 modèles du classement avec leurs caractéristiques techniques clés. La colonne "Poids Q4 (approx.)" indique la taille approximative des poids en quantification 4 bits — la mémoire totale nécessaire en production est plus élevée (KV cache, buffers, overhead moteur).
| # | Modèle | Lab | Params | Actifs | Poids Q4 (approx.) | Contexte | Licence | Force |
|---|---|---|---|---|---|---|---|---|
| ▶ TIER S — FRONTIER (multi-GPU / datacenter · VRAM Q4 ≥ 120 GB) | ||||||||
| 1 | Qwen3-235B-A22B | Alibaba | 235B MoE | 22B | ~120 GB | 256K | Apache 2.0 | Polyvalent, parmi les meilleurs |
| 2 | GLM-5.2 | Zhipu AI | ~753B MoE | ~40B | ~380 GB | 1M | MIT | GPQA très élevé, HumanEval fort |
| 3 | DeepSeek V4 Pro | DeepSeek | 1,6T MoE | 49B | ~800 GB | 1M | MIT | Code + raisonnement |
| 4 | Kimi K2.7 Code | Moonshot AI | 1T MoE | 32B | ~500 GB | 256K | Mod. MIT | Coding fort, attribution au-delà des seuils |
| 5 | MiniMax M3 | MiniMax | 428B MoE | ~23B | ~215 GB | 1M | ⚠️ MiniMax Lic. | Multimodal + 1M ctx |
| 6 | Llama 4 Maverick | Meta | 400B MoE | 17B | ~200 GB | 1M | Llama 4 Lic. | Multimodal, MMLU fort |
| 7 | Qwen3-Coder-480B | Alibaba | 480B MoE | 35B | ~240 GB | 256K | Apache 2.0 | 69,6% SWE-bench (Alibaba, protocole agentic) |
| ▶ TIER A — MULTI-GPU / SERVEUR LOCAL (50–350 GB VRAM) | ||||||||
| 8 | DeepSeek R1 | DeepSeek | 671B MoE | 37B | ~336 GB | 128K | MIT | MATH-500 97,3% |
| 9 | Mistral Large 3 | Mistral AI | 675B MoE | 41B | ~338 GB | 256K | Apache 2.0 | Très bon français et langues européennes |
| 10 | DeepSeek V4 Flash | DeepSeek | 284B MoE | 13B | ~142 GB | 1M | MIT | V4 efficace, 1M contexte |
| 11 | Mistral Small 4 | Mistral AI | 119B MoE | 6,5B | ~60 GB | 256K | Apache 2.0 | Inférence rapide (6,5B actifs) |
| 12 | Llama 4 Scout | Meta | 109B MoE | 17B | ~55 GB† | 10M | Llama 4 Lic. | Contexte 10M tokens unique |
| 13 | Llama 3.3 70B | Meta | 70B | 70B | ~35 GB | 128K | Llama 3 Lic. | Référence éprouvée |
| ▶ TIER B — GPU 16–24 GB | ||||||||
| 14 | Qwen3-32B | Alibaba | 32B | 32B | ~20 GB | 256K | Apache 2.0 | MMLU ~87%, dense, polyvalent |
| 15 | Gemma 4 31B | 31B | 31B | ~18 GB | 256K | Apache 2.0 | Multimodal, 256K | |
| 16 | DeepSeek-R1-Distill-Qwen-32B | DeepSeek | 32B | 32B | ~20 GB | 128K | MIT | Raisonnement local fort |
| 17 | Gemma 4 26B MoE | 26B MoE | ~4B | ~13 GB | 256K | Apache 2.0 | MoE léger multimodal | |
| 18 | Phi-4 14B | Microsoft | 14,7B | 14,7B | ~7 GB | 16K | MIT | MMLU ~84,8%, STEM fort |
| 19 | Qwen3-14B | Alibaba | 14B | 14B | ~7 GB | 256K | Apache 2.0 | Polyvalent mid-range |
| 20 | Qwen3-30B-A3B | Alibaba | 30B MoE | 3B | ~15 GB† | 256K | Apache 2.0 | Bon rapport qualité/taille, GPU 20–24 GB recommandé |
| ▶ TIER C — GPU 8–16 GB (grand public) et EDGE (< 8 GB) | ||||||||
| 21 | Mistral Small 3.1 | Mistral AI | 24B | 24B | ~12 GB | 128K | Apache 2.0 | Très bon français local |
| 22 | Qwen3-8B | Alibaba | 8B | 8B | ~4 GB | 256K | Apache 2.0 | Excellent 8B 2026 |
| 23 | DeepSeek-R1-Distill-Qwen-7B | DeepSeek | 7B | 7B | ~4 GB | 128K | MIT | Raisonnement entry-level |
| 24 | Phi-4-Mini 3.8B | Microsoft | 3,8B | 3,8B | ~2 GB | 128K | MIT | Smartphone / edge |
| 25 | Gemma 4 E4B | ~4,5B | ~4,5B | ~2 GB | 128K | Apache 2.0 | Edge, on-device | |
"Actifs" = paramètres calculés par token (MoE). Tous les poids restent en VRAM. Les commandes Ollama listées sont indicatives — vérifiez le tag exact sur ollama.com/library.
4. Tier S — Frontier (serveur requis)
Ces modèles nécessitent une infrastructure cloud ou multi-GPU pour tourner. Sur plusieurs benchmarks publiés, certains affichent des scores comparables à GPT-5 et Claude Opus — les comparaisons directes restant difficiles à établir en l'absence de protocoles unifiés.
1. Qwen3-235B-A22B — parmi les meilleurs modèles généralistes
Alibaba · Apache 2.0 · 235B MoE (22B actifs) · 256K tokens
Qwen3-235B-A22B est parmi les modèles open weight les plus équilibrés de 2026. Ses résultats le placent régulièrement dans le top 3 des benchmarks publics disponibles au moment de la rédaction (raisonnement, code, langues asiatiques, suivi d'instructions). Son architecture MoE (22B paramètres actifs sur 235B) lui permet d'être inféré efficacement sur un cluster A100/H100.
Sa licence Apache 2.0 complète — sans restriction d'utilisation commerciale — en fait le choix par défaut pour les entreprises qui veulent auto-héberger un modèle frontier. Disponible via Ollama (ollama pull qwen3:235b, puis ollama run qwen3:235b) sur des configurations multi-GPU.
2. GLM-5.2 — très performant sur GPQA et HumanEval
Zhipu AI · MIT · ~753B MoE (~40B actifs) · 1M tokens · 17 juin 2026
GLM-5.2, présenté officiellement le 17 juin 2026, affiche des résultats très élevés sur les benchmarks scientifiques — 91,2% sur GPQA Diamond et un score HumanEval parmi les meilleurs scores open weight publiés (selon les chiffres officiels Zhipu AI). Son contexte d'1 million de tokens en fait un outil de choix pour analyser de larges corpus. Les poids sont disponibles sur Hugging Face (zai-org/GLM-5.2).
Avec ~753B paramètres totaux (~380 GB en Q4 — nécessite un cluster GPU), c'est un des plus grands modèles de cette liste. La licence MIT, extrêmement permissive, est un avantage majeur pour les applications commerciales.
3. DeepSeek V4 Pro — MIT et 1M de contexte
DeepSeek · MIT · 1,6T MoE (49B actifs) · 1M tokens
Présenté le 26 avril 2026, DeepSeek V4 Pro compte 1,6 trillion de paramètres totaux (49B actifs par token) et un contexte d'1 million de tokens sous licence MIT. Ses poids en Q4 représentent environ 800 GB — infrastructure multi-GPU ou cluster GPU requis. Très bon rapport performances/coût pour les déploiements self-hosted à grande échelle, selon les benchmarks publiés par DeepSeek.
Sa version Flash (DeepSeek V4 Flash, #10) offre 284B paramètres avec seulement 13B actifs (~142 GB en Q4) — beaucoup plus accessible en termes de VRAM.
4. Kimi K2.7 Code — spécialiste agentic coding
Moonshot AI · Modified MIT · 1T MoE (32B actifs) · 256K tokens
Kimi K2.7 Code, sorti le 12 juin 2026, affiche une amélioration significative sur les benchmarks de coding par rapport à son prédécesseur K2.6 (selon les chiffres officiels Moonshot AI). Son architecture 1T/32B actifs le positionne parmi les meilleurs modèles open weight pour les tâches agentic de développement logiciel — à condition de vérifier la licence avant usage commercial.
5. MiniMax M3 — multimodal natif + 1M contexte
MiniMax · ⚠️ MiniMax Community License · 428B MoE (~23B actifs) · 1M tokens · juin 2026
MiniMax M3, lancé le 1er juin 2026, combine performances très élevées en coding, contexte d'1 million de tokens et multimodalité native (~215 GB en Q4). Très bien positionné sur les benchmarks de génération de code. Attention à la licence : la MiniMax Community License impose la mention "Built with MiniMax M3" pour tout usage commercial. En dessous de 20 M$ de chiffre d'affaires annuel, un simple avis à MiniMax est requis ; au-dessus de ce seuil, une autorisation préalable est nécessaire — à vérifier avant tout usage commercial (licence sur HF).
6. Llama 4 Maverick — multimodal de Meta
Meta · Meta Llama License · 400B MoE (17B actifs) · 1M tokens · ~200 GB VRAM (Q4)
Llama 4 Maverick est l'offre phare de Meta : 400B paramètres MoE avec 1M de contexte et des capacités multimodales (texte + images). Il affiche 85,5% sur MMLU, parmi les meilleurs scores des modèles open source, et de très bons résultats sur les tâches multimodales (ChartQA 90,0%, DocVQA 94,4% selon les chiffres officiels Meta). Avec ~200 GB de VRAM nécessaires en Q4 (400B × 0,5 bytes), il requiert une infrastructure multi-GPU — datacenter ou cluster H100/A100.
7. Qwen3-Coder-480B — très performant sur le code
Alibaba · Apache 2.0 · 480B MoE (35B actifs) · 256K tokens · ~240 GB Q4
Alibaba publie un score de 69,6% sur SWE-bench Verified avec son protocole d'évaluation agentic — un des scores les plus élevés jamais publiés par un modèle open weight sur ce benchmark de résolution de vrais bugs GitHub. Le score SWE-bench dépend fortement du scaffold, de l'agent et du budget de calcul utilisés ; comparez avec précaution. Très bon choix pour les applications de développement logiciel assisté par IA à grande échelle.
5. Tier A — Workstation haute gamme (50–350 GB VRAM)
Ces modèles nécessitent des GPU professionnels (A10, A40, L40S, H100) ou des configurations multi-GPU grand public (2× RTX 3090 / 2× RTX 4090). Certains peuvent tourner avec de l'offloading CPU/RAM sur des workstations puissantes.
8. DeepSeek R1 — référence raisonnement mathématique
DeepSeek · MIT · 671B MoE (37B actifs) · 128K tokens
DeepSeek R1 reste en 2026 une référence majeure pour le raisonnement mathématique : 97,3% sur MATH-500, équivalent à o1 d'OpenAI sur les compétitions AIME. Sa phase de post-entraînement par apprentissage par renforcement dédié au raisonnement (sans imitation de teacher model) lui permet de produire des étapes intermédiaires utiles à examiner — celles-ci ne garantissent pas la fidélité du raisonnement interne, mais peuvent aider à identifier des erreurs.
Les versions distillées (32B, 14B, 7B) permettent d'accéder à une grande partie de ces capacités sur du matériel grand public — voir la section Tier B et C.
9. Mistral Large 3 — un modèle frontier multilingue avec support du français
Mistral AI · Apache 2.0 · 675B MoE (41B actifs) · 256K tokens · décembre 2025
Mistral Large 3 (sorti en décembre 2025) est parmi les meilleurs modèles open weight pour le français et les langues européennes selon les benchmarks publiés par Mistral AI. Son architecture 675B/41B actifs (inférence allégée comparée aux 675B totaux) offre d'excellentes performances, et la licence Apache 2.0 simplifie le déploiement commercial. Disponible sur Ollama : ollama pull mistral-large-3.
10. DeepSeek V4 Flash — 1M de contexte accessible
DeepSeek · MIT · 284B MoE (13B actifs) · 1M tokens
Version plus légère du V4 Pro, DeepSeek V4 Flash combine les bénéfices du V4 (raisonnement RL, 1M contexte) avec une empreinte plus raisonnable : 284B totaux / 13B actifs (~142 GB en Q4, nécessite du multi-GPU). Bon choix pour accéder à 1M de contexte avec une infrastructure multi-GPU modérée.
11. Mistral Small 4 — inférence rapide, 256K contexte
Mistral AI · Apache 2.0 · 119B MoE (6,5B actifs) · 256K tokens · ~60 GB VRAM (Q4)
Mistral Small 4 est remarquable sur le rapport inférence/performance : 119B paramètres totaux, seulement 6,5B actifs par token — ce qui le rend très rapide à l'inférence. La VRAM requise est d'environ ~60 GB en Q4 pour charger tous les poids (multi-GPU requis, ou offloading CPU/RAM). Excellent sur le français, les langues européennes et les tâches enterprise (extraction, classification, summarisation longue). Disponible via NVIDIA NIM et en téléchargement direct sur Hugging Face.
12. Llama 4 Scout — 109B MoE, contexte 10M tokens
Meta · Meta Llama License · 109B MoE (17B actifs) · 10M tokens · ~55 GB VRAM (Q4)
Llama 4 Scout est la surprise technique de 2026 : 109B paramètres totaux, 10 millions de tokens de contexte, et une inférence allégée grâce à ses 17B paramètres actifs (MoE). Le contexte 10M — soit environ 7,5 millions de mots — ouvre des cas d'usage inédits : analyser une base de code entière, traiter des corpus documentaires massifs, maintenir une mémoire de conversation extrêmement longue. En termes de VRAM : ~55 GB en Q4 pour charger tous les poids, ou possibilité d'offloading CPU/RAM si votre GPU est plus limité (avec une baisse de vitesse significative).
ollama pull llama4:scout.
13. Llama 3.3 70B — la référence éprouvée
Meta · Meta Llama License · 70B · 128K tokens · ~35 GB VRAM (Q4)
Llama 3.3 70B n'est plus le dernier modèle de Meta, mais il reste une valeur sûre : 87% MMLU, 82% HumanEval, support tool use mature, intégration native dans tous les frameworks (LangChain, LlamaIndex, LangGraph). Idéal si vous avez déjà une infrastructure taillée pour lui et que vous ne voulez pas changer.
6. Tier B — Grand public (16–24 GB VRAM)
La catégorie la plus intéressante pour les développeurs : ces modèles tournent sur une RTX 3090, RTX 4090 ou Apple M4 Pro. Ils couvrent une large majorité des cas d'usage professionnels courants.
14. Qwen3-32B — référence 24 GB polyvalent
Alibaba · Apache 2.0 · 32B dense · 256K tokens · ~20 GB VRAM
Sur une RTX 4090 (24 GB) ou deux RTX 3090, le Qwen3-32B est le choix optimal : 87% MMLU, 86,5% HumanEval, thinking mode activable, contexte 256K. Dense et stable — pas les complexités de routing MoE. Il rivalise sérieusement avec des API cloud pour les tâches de raisonnement et de code complexes. À 20-28 tok/s, c'est parfaitement utilisable en interactif.
Pour l'utiliser avec Ollama : ollama pull qwen3:32b
15. Gemma 4 31B — multimodal Google
Google DeepMind · Apache 2.0 · 31B dense · 256K tokens · ~18 GB poids Q4 (mémoire totale supérieure)
Sorti le 31 mars 2026, Gemma 4 31B est le fleuron de la famille Gemma : modèle dense multimodal (texte + images) avec une génération de texte remarquablement fluide. Il affiche de meilleurs résultats que Llama 3.3 70B sur plusieurs benchmarks publiés, tout en tenant dans environ 18 GB de poids Q4 (contre ~35 GB pour Llama 3.3 70B). Intégration native dans Ollama, LM Studio et Hugging Face.
16. DeepSeek-R1-Distill-Qwen-32B — raisonnement local accessible
DeepSeek · MIT · 32B distillé Qwen2.5 · 64K tokens · ~20 GB VRAM
DeepSeek-R1-Distill-Qwen-32B est un modèle Qwen2.5 32B affiné sur des traces de raisonnement issues de R1 (671B). Il affiche d'excellentes performances en maths et logique formelle — avec des chaînes de raisonnement intermédiaires explicites dans la réponse. Ce n'est pas une compression directe du modèle complet, mais un fine-tuning qui transmet le style de raisonnement.
17. Gemma 4 26B MoE — la surprise légère
Google DeepMind · Apache 2.0 · 26B MoE (3,8B actifs) · 256K tokens · ~13 GB VRAM (Q4)
La version MoE de Gemma 4 26B requiert ~13 GB de VRAM en Q4 (26B × 0,5 bytes) — l'ensemble des poids est chargé en mémoire, comme pour tout modèle MoE. En revanche, ses 3,8B paramètres actifs par token le rendent aussi rapide à l'inférence qu'un modèle dense 4B. Multimodal comme le 31B, c'est un excellent choix pour les GPU 16 GB qui veulent les capacités vision de Gemma avec une inférence rapide.
18. Phi-4 14B — très bon STEM dans sa catégorie
Microsoft · MIT · 14,7B · 16K tokens · ~7 GB VRAM (Q4)
Phi-4 14B est très performant sur les tâches STEM (~84,8% MMLU selon les benchmarks officiels Microsoft). Sa force réside dans son entraînement sur des données synthétiques ultra-qualitatives (textbooks, exercices STEM, raisonnement formel) plutôt que sur du web brut. Ses 14,7B paramètres lui permettent d'atteindre 50–70 tok/s sur RTX 4090 (Ollama, Q4_K_M, contexte court) avec seulement ~7 GB de VRAM en Q4.
Sa version Phi-4 Reasoning Vision ajoute la compréhension d'images. Limite importante : fenêtre de contexte de 16K tokens seulement selon la version standard, contre 256K pour Qwen3-14B. Vérifiez la version exacte dans la fiche officielle Hugging Face.
19. Qwen3-14B — polyvalent mid-range
Alibaba · Apache 2.0 · 14B dense · 256K tokens · ~7 GB VRAM (Q4)
Qwen3-14B est le modèle de référence pour les GPU 12–16 GB : bon sur le code, le raisonnement, le multilingue, avec un contexte 256K. Sur une RTX 3080 10 GB, un chargement en Q4_K_M est possible avec très peu de marge (les poids seuls approchent 7–8 GB), mais le KV cache sera limité — préférez une quantification Q3 ou Q2 pour conserver de la marge. Il offre un excellent rapport qualité/vitesse (55–70 tok/s sur RTX 4090, Ollama, Q4_K_M, contexte court).
20. Qwen3-30B-A3B — excellent rapport qualité/taille
Alibaba · Apache 2.0 · 30B MoE (3B actifs) · 256K tokens · ~15 GB VRAM (Q4)
Qwen3-30B-A3B illustre bien la puissance du MoE : 30B paramètres totaux, seulement 3B activés par token — ce qui le rend aussi rapide à l'inférence qu'un modèle 3B dense. Les poids en Q4 approchent déjà ~15 GB (30B × 0,5 bytes), auxquels s'ajoutent KV cache, buffers et overhead moteur. Un GPU de 20–24 GB est recommandé pour une inférence confortable et un contexte normal ; sur 16 GB, prévoyez une quantification plus compacte (Q3 ou Q2) ou un contexte réduit, avec risque d'offloading partiel.
Commande Ollama : ollama pull qwen3:30b-a3b (vérifiez le tag exact sur ollama.com/library)
7. Tier C — GPU 8–16 GB (grand public) et edge (< 8 GB)
Pour les GPU 8–16 GB, les Macs avec 8–24 GB de RAM unifiée, les laptops, ou les déploiements edge. Ces modèles ont progressé spectaculairement en 2026. Note : pour les MoE, la VRAM indiquée correspond au chargement de tous les poids, pas seulement des paramètres actifs.
21. Mistral Small 3.1 — très bon français en local
Mistral AI · Apache 2.0 · 24B · 128K tokens · ~12 GB VRAM (Q4)
Pour les applications en français sur GPU 12–16 GB, Mistral Small 3.1 (24B, sorti en mars 2025) est parmi les meilleurs choix. Selon Mistral AI, il a été entraîné sur un corpus européen conséquent incluant du texte français — ce qui se traduit par de bonnes performances sur les tâches en français dans cette gamme de taille, selon les benchmarks publiés par l'éditeur. Disponible sur Ollama : ollama pull mistral-small3.1.
22. Qwen3-8B — excellent modèle 8B en 2026
Alibaba · Apache 2.0 · 8B · 256K tokens · ~5 GB VRAM
Qwen3-8B figure parmi les meilleurs modèles 8B de 2026 sur les benchmarks de raisonnement et de code. Contexte de 256K tokens (contre 128K pour Llama 3.1 8B), thinking mode activable, support 100+ langues. Il tient dans 5 GB de VRAM et atteint 80–95 tok/s sur RTX 4090 (Ollama, Q4_K_M, contexte court) — parfait pour les applications interactives.
Pour débuter avec Ollama : ollama pull qwen3:8b — c'est le modèle à essayer en premier si vous démarrez l'IA locale.
23. DeepSeek-R1-Distill-Qwen-7B — raisonnement entry-level
DeepSeek · MIT · 7B distillé Qwen2.5 · 64K tokens · ~5 GB VRAM
DeepSeek-R1-Distill-Qwen-7B est un modèle Qwen2.5 7B affiné sur des traces de raisonnement issues de R1. Il conserve les chaînes de raisonnement explicites et surpasse les modèles 7B classiques sur les tâches mathématiques. MIT license, 5 GB de VRAM. Préférez le Qwen3-8B pour un usage général, mais le R1-Distill-7B est très fort pour les tâches de raisonnement formel dans cette gamme de taille.
24. Phi-4-Mini 3.8B — smartphone et edge
Microsoft · MIT · 3,8B · 128K tokens · ~2 GB VRAM (Q4)
Phi-4-Mini est conçu pour les environnements contraints : smartphones Android haut de gamme, iOS via Core ML, Raspberry Pi 5, applications on-device. Avec seulement 3,8B paramètres, ses poids Q4 représentent environ 2–2,5 GB (mémoire totale supérieure en pratique) et il supporte officiellement une fenêtre de contexte de 128K tokens (selon la fiche Microsoft sur HF). Il offre des performances remarquables sur les tâches STEM grâce à la méthode d'entraînement sur données synthétiques de qualité de Microsoft.
25. Gemma 4 E4B — on-device Google
Google DeepMind · Apache 2.0 · ~4,5B · 128K tokens · ~2 GB VRAM (Q4)
Gemma 4 E4B (Edge 4B) est optimisé pour le déploiement on-device : iPhone, appareils Android, ARM. Ses ~4,5B paramètres offrent de bonnes performances pour un modèle de cette taille — selon les benchmarks publiés par Google DeepMind, il se positionne favorablement sur la génération de texte créatif et le raisonnement général par rapport à d'autres modèles edge de taille similaire, avec des performances légèrement inférieures sur les tâches STEM. Idéal pour les applications mobiles nécessitant confidentialité totale et fonctionnement hors ligne.
8. Modèles pour le français
Le français est bien supporté par les grands modèles généralistes (Qwen3, Llama 4, DeepSeek). Mais pour des applications spécifiquement françaises — juridique, médical, administratif — certains modèles se distinguent.
| Modèle | Taille | Atout français | Licence |
|---|---|---|---|
| Mistral Large 3 | 675B MoE | Très bon français et langues européennes (frontier) | Apache 2.0 |
| Mistral Small 4 | 119B MoE / 6B actifs | Français enterprise, 256K, léger | Apache 2.0 |
| Mistral Small 3.1 | 24B | Très bon français local, ~14 GB VRAM | Apache 2.0 |
| CroissantLLM | 1,3B | Bilingue FR/EN (ratio 1:1), données traçables | Apache 2.0 |
| Lucie-7B | 7B | Multilingue (~32% FR), données traçables | Apache 2.0 |
9. Guide de sélection par profil
→ Qwen3-14B (~7 GB poids Q4, polyvalent) · Qwen3-8B (polyvalent rapide) · DeepSeek-R1-Distill-Qwen-7B (maths/logique) — Qwen3-30B-A3B : GPU 20–24 GB recommandé (Q3/Q2 seulement sur 16 GB)
→ Qwen3-32B (polyvalent) · DeepSeek-R1-Distill-Qwen-32B (raisonnement) · Gemma 4 31B (multimodal)
→ Qwen3-32B (M4 Pro 48 GB) · Qwen3-14B (M4 Pro 24 GB) · Mistral Small 3.1 (M4 Pro 24 GB, français)
→ Qwen3-235B-A22B (Apache 2.0, polyvalent) · Mistral Large 3 (Apache 2.0, français) · DeepSeek V4 Pro (MIT, performances très élevées)
→ DeepSeek R1 (671B, MATH-500 97,3%) · GLM-5.2 (GPQA Diamond 91,2%) · DeepSeek-R1-Distill-Qwen-32B (local accessible)
→ Qwen3-Coder-480B (69,6% SWE-bench selon Alibaba) · Kimi K2.7 (agentic coding) · Qwen3-32B (local, très bon code)
→ Phi-4-Mini 3.8B (STEM, MIT) · Gemma 4 E4B (polyvalent, Apache 2.0) · Qwen3-8B (si 6+ GB RAM)
→ Mistral Small 3.1 (local, excellent) · Mistral Small 4 (enterprise, 256K) · Lucie-7B (souverain, données FR traçables)
10. Licences — ce qu'il faut savoir
Le choix de la licence est critique pour les applications commerciales. Voici ce que chaque licence autorise réellement :
| Licence | Usage commercial | Fine-tuning | Redistribution | Modèles |
|---|---|---|---|---|
| Apache 2.0 | ✓ Libre | ✓ Libre | ✓ Libre | Qwen3, Gemma 4, Mistral (tous) |
| MIT | ✓ Libre | ✓ Libre | ✓ Libre | DeepSeek (tous), GLM-5.2, Phi-4 |
| Meta Llama License | ✓ jusqu'à 700M MAU | ✓ | Encadrée | Llama 4 (Scout, Maverick), Llama 3.3 |
| Modified MIT (Kimi) | ✓ Permis† | ⚠️ | ✓ Avec cond. | Kimi K2.7 — †attribution requise >100M MAU ou >20M$/mois |
| MiniMax Community | ⚠️ Mention req. | ⚠️ | ⚠️ Auth. >20M$/an | MiniMax M3 — notification req. <20M$/an, autorisation req. au-dessus |
Lire aussi : Fine-tuning LoRA & QLoRA en Python pour adapter ces modèles à vos données, et guide Unsloth pour le fine-tuning 2× plus rapide.
11. FAQ
Quel est le meilleur LLM open source en 2026 ?
En juillet 2026, Qwen3-235B-A22B (Alibaba, Apache 2.0) est parmi les meilleurs modèles généralistes open weight. Pour le code, Qwen3-Coder-480B publie 69,6% sur SWE-bench Verified (selon Alibaba, protocole agentic). Pour le raisonnement scientifique, GLM-5.2 affiche 91,2% sur GPQA Diamond (chiffres officiels des éditeurs). Sur GPU grand public, Qwen3-32B est un excellent choix sur RTX 4090 ou Mac M4.
Quel LLM open source avec 8 GB de VRAM ?
Avec 8 GB de VRAM : Qwen3-8B (~4–5 GB, excellent rapport qualité/taille, 256K contexte, 80–95 tok/s sur RTX 4090 avec Ollama Q4_K_M) et DeepSeek-R1-Distill-Qwen-7B (~4–5 GB, raisonnement formel fort). Pour 16 GB, Qwen3-14B (~7 GB poids Q4) est fiable. Le Qwen3-30B-A3B (~15 GB poids Q4) est recommandé sur GPU 20–24 GB ; sur 16 GB, prévoir Q3/Q2 ou un contexte réduit.
Quelle licence pour un usage commercial ?
Préférez Apache 2.0 (Qwen3, Gemma 4, Mistral) ou MIT (DeepSeek, GLM-5.2, Phi-4) — usage commercial libre, fine-tuning, redistribution sans restriction. La Meta Llama License est commerciale jusqu'à 700M MAU actifs. La "Modified MIT" de Kimi K2.7 est commercialement permise en dessous de 100M MAU ou 20M$/mois — au-delà, l'affichage "Kimi K2.7 Code" est requis. MiniMax M3 exige la mention "Built with MiniMax M3" et une autorisation au-dessus de 20M$/an de CA.
DeepSeek R1 vs Qwen3 : lequel choisir ?
DeepSeek R1 (MIT) excelle en maths et raisonnement formel — MATH-500 à 97,3% (source : paper R1), chaînes de raisonnement intermédiaires explicites. Qwen3-235B (Apache 2.0) est plus polyvalent : très performant en code, suivi d'instructions, langues multiples. Pour les maths/sciences : R1. Pour un assistant général ou des agents complexes : Qwen3.
Qu'est-ce qu'un modèle MoE et pourquoi ça change tout ?
MoE (Mixture of Experts) divise le modèle en plusieurs "experts" spécialisés. Pour chaque token, seul un sous-ensemble est activé. Exemple : Qwen3-235B-A22B a 235B paramètres au total mais seulement 22B actifs par token — le calcul est ~10× plus léger. Important : en VRAM, tous les poids doivent quand même être chargés (pas seulement les paramètres actifs). Exemple : Llama 4 Scout (109B total, 17B actifs) requiert ~55 GB en Q4 — pas 12 GB. Le gain MoE est sur la vitesse d'inférence, pas sur la VRAM nécessaire.
12. Méthodologie
Ce classement repose sur plusieurs critères pondérés :
- Performances benchmarks publics — MMLU-Pro, GPQA Diamond, MATH-500, SWE-bench Verified, HumanEval. Les scores cités sont ceux publiés par les éditeurs (non reproductions indépendantes).
- Disponibilité des poids — tous les modèles listés ont des poids téléchargeables publiquement sur Hugging Face au 27 juillet 2026.
- Licence — préférence aux licences permissives (Apache 2.0, MIT) pour les usages commerciaux.
- Déployabilité — compatibilité Ollama, vLLM, LM Studio, GGUF/exllamav2.
- Poids Q4 (approx.) — taille approximative des poids estimée à total_params × 0,5 bytes pour Q4 (hors KV cache, buffers et overhead moteur). Pour les MoE, tous les poids sont chargés en VRAM (seul le calcul est réduit aux paramètres actifs). La mémoire totale en production est supérieure.
13. Sources
- Open LLM Leaderboard — Hugging Face, classement benchmarks MMLU, ARC, etc.
- LMSYS Chatbot Arena — classement ELO par votes humains en aveugle.
- Artificial Analysis — benchmarks vitesse, VRAM, coût, qualité par modèle.
- SWE-bench — benchmark de résolution de bugs GitHub réels.
- Papers With Code — état de l'art par tâche et dataset.
- Ollama Library — disponibilité des modèles et commandes de déploiement.
- Model cards des modèles cités (liens directs) :
- Qwen3-235B-A22B, Qwen3-Coder-480B-A35B-Instruct, Qwen3-32B, Qwen3-14B, Qwen3-8B, Qwen3-30B-A3B — Alibaba/Qwen
- DeepSeek R1, R1-Distill-Qwen-32B, R1-Distill-Qwen-7B, DeepSeek V4 Pro, DeepSeek V4 Flash — DeepSeek
- Llama 4 Maverick, Llama 4 Scout, Llama 3.3 70B — Meta
- Mistral Large 3, Mistral Small 4, Mistral Small 3.1 — Mistral AI
- Gemma 4 31B, Gemma 4 26B-A4B MoE, Gemma 4 E4B — Google DeepMind
- Phi-4 14B, Phi-4-Mini — Microsoft
- GLM-5.2 — Zhipu AI · Kimi K2.7 Code — Moonshot AI · MiniMax M3 — MiniMax
- CroissantLLM · Lucie-7B — modèles à données traçables
Conclusion
Le paysage des LLM open source a radicalement changé en 2026. Sur certains benchmarks critiques (GPQA, SWE-bench, MATH), l'écart avec les modèles propriétaires s'est fortement réduit — et les meilleurs modèles open weight se hissent en tête sur des tâches spécifiques.
Trois takeaways pratiques :
- MoE change la vitesse d'inférence — Qwen3-30B-A3B (~15 GB poids Q4, GPU 20–24 GB recommandé) rivalise avec des modèles denses bien plus lourds. Attention : la VRAM nécessaire dépasse le poids Q4 seul (KV cache, buffers).
- Apache 2.0 / MIT sont désormais la norme — les licences permissives dominent les nouvelles publications open weight, plus de raison de choisir des licences restrictives pour les nouvelles applications.
- Les labs chinois dominent les benchmarks — Qwen (Alibaba), DeepSeek, GLM (Zhipu), Kimi (Moonshot) occupent 5 des 7 premières places du classement.
ollama pull qwen3:8b (~4 GB) ou ollama pull qwen3:32b (~20 GB, GPU 24 GB recommandé) selon votre GPU. En quelques minutes vous avez un modèle local performant, sans envoyer vos données dans le cloud. Vérifiez les tags exacts sur ollama.com/library.