Publié le · Par Tetyana Tarasenko, développeuse IA · Lecture : ~20 min · Données vérifiées au 27 juillet 2026
Top 25 des meilleurs LLM open source en 2026 : DeepSeek, Qwen3, Llama 4, Mistral, Gemma et les autres
Mis à jour en juillet 2026, ce comparatif présente les 25 meilleurs LLM open weight disponibles, leurs performances sur les benchmarks clés (MMLU, GPQA, SWE-bench, MATH-500), leurs besoins en VRAM, leurs licences et leurs principaux cas d'utilisation — du datacenter au smartphone.
Note open source vs open weight : par simplification et pour correspondre aux recherches courantes, cet article emploie l'expression « LLM open source ». Techniquement, la grande majorité des modèles présentés sont des modèles open weight : leurs poids sont accessibles publiquement, mais les données d'entraînement et le code complet ne sont pas toujours publiés. Seuls quelques projets (CroissantLLM, Lucie) satisfont aux critères stricts de l'open source.
1. Pourquoi les modèles open weight sont incontournables en 2026
En 2023, GPT-4 distançait les meilleurs modèles ouverts de plusieurs générations. En juillet 2026, l'écart s'est fortement réduit — et sur certains benchmarks spécifiques, des modèles open weight se hissent au niveau ou au-dessus des modèles propriétaires. Les modèles propriétaires conservent cependant des avantages sur la robustesse agentique, la multimodalité avancée et la disponibilité d'API.
Trois facteurs expliquent la progression des modèles ouverts :
Le Mixture of Experts permet de créer des modèles avec des centaines de milliards de paramètres tout en n'activant qu'une fraction (10–20%) par token. Résultat : des performances de modèles très grands, avec une inférence proche des modèles denses de taille réduite.
Alibaba (Qwen), DeepSeek, Zhipu AI (GLM), Moonshot AI (Kimi) et MiniMax ont publié en open weight des modèles qui rivalisent — ou surpassent — GPT-4o et Claude Opus sur plusieurs benchmarks.
Apache 2.0 et MIT sont devenues très courantes parmi les nouveaux modèles ouverts : usage commercial libre, fine-tuning, redistribution sans restriction. C'est un changement majeur par rapport à 2023, où les licences restrictives (non-commerciales, usage limité) dominaient.
Ce comparatif couvre 25 modèles open weight publiés jusqu'en juillet 2026, sélectionnés à partir de leurs fiches techniques officielles, de benchmarks publics et de résultats publiés par les éditeurs ou des plateformes indépendantes (LMSYS Arena, Papers with Code, SWE-bench.com). Certains modèles ont été testés directement par notre équipe (Qwen3-8B, Qwen3-32B, DeepSeek R1 32B, Phi-4 14B, Mistral Small 3.1), d'autres sont présentés sur la base des données officielles. Les caractéristiques des modèles uniquement disponibles via API (et non téléchargeables) ne sont pas incluses dans ce classement.
2. Les benchmarks expliqués
Avant de plonger dans le classement, voici les benchmarks utilisés et ce qu'ils mesurent réellement :
| Benchmark | Ce qu'il mesure | Fiabilité / limites |
|---|---|---|
| MMLU | Culture générale — 57 domaines (droit, médecine, sciences, histoire…) | Largement saturé, forte contamination possible |
| MMLU-Pro / GPQA Diamond | Culture générale avancée · Questions doctorat (chimie, physique, bio) | Plus fiables que MMLU classique |
| MATH-500 / AIME | Raisonnement mathématique — problèmes niveau lycée à compétition olympiade | Fiable pour les modèles de raisonnement |
| SWE-bench Verified | Résolution de vrais bugs GitHub — 500 issues validées par des humains | Parmi les plus fiables pour le code. Les scores avec agent ≠ modèle seul |
| HumanEval | Génération de code Python — résolution de fonctions à partir de docstrings | Saturé (~90%+ pour les grands modèles). Préférer SWE-bench |
| Arena ELO (LMSYS) | Préférences humaines — votes blind sur des millions de comparaisons | Le plus fiable pour l'usage général, indépendant des éditeurs |
3. Tableau comparatif des 25 modèles
Ce tableau présente les 25 modèles du classement avec leurs caractéristiques techniques clés. Les tailles VRAM sont indiquées pour une quantization Q4_K_M (sauf mention contraire).
| # | Modèle | Lab | Params | Actifs | VRAM min | Contexte | Licence | Force |
|---|---|---|---|---|---|---|---|---|
| ▶ TIER S — FRONTIER (multi-GPU / datacenter · VRAM Q4 ≥ 120 GB) | ||||||||
| 1 | Qwen3-235B-A22B | Alibaba | 235B MoE | 22B | ~120 GB | 256K | Apache 2.0 | Polyvalent, parmi les meilleurs |
| 2 | GLM-5.2 | Zhipu AI | 744B MoE | ~40B | ~370 GB | 1M | MIT | GPQA très élevé, HumanEval fort |
| 3 | DeepSeek V4 Pro | DeepSeek | 1,6T MoE | 49B | ~800 GB | 1M | MIT | Code + raisonnement |
| 4 | Kimi K2.7 Code | Moonshot AI | 1T MoE | 32B | ~500 GB | 256K | Mod. MIT | Coding fort, restr. commerciales |
| 5 | MiniMax M3 | MiniMax | 428B MoE | ~23B | ~215 GB | 1M | ⚠️ MiniMax Lic. | Multimodal + 1M ctx |
| 6 | Llama 4 Maverick | Meta | 400B MoE | 17B | ~200 GB | 1M | Llama 4 Lic. | Multimodal, MMLU fort |
| 7 | Qwen3-Coder-480B | Alibaba | 480B MoE | 35B | ~240 GB | 256K | Apache 2.0 | SWE-bench Verified 69,6% |
| ▶ TIER A — MULTI-GPU / SERVEUR LOCAL (50–350 GB VRAM) | ||||||||
| 8 | DeepSeek R1 | DeepSeek | 671B MoE | 37B | ~336 GB | 128K | MIT | MATH-500 97,3% |
| 9 | Mistral Large 3 | Mistral AI | 675B MoE | 41B | ~338 GB | 256K | Apache 2.0 | Très bon français frontier |
| 10 | DeepSeek V4 Flash | DeepSeek | 284B MoE | 13B | ~142 GB | 1M | MIT | V4 efficace, 1M contexte |
| 11 | Mistral Small 4 | Mistral AI | 119B MoE | 6,5B | ~60 GB | 256K | Apache 2.0 | Inférence rapide (6,5B actifs) |
| 12 | Llama 4 Scout | Meta | 109B MoE | 17B | ~55 GB† | 10M | Llama 4 Lic. | Contexte 10M tokens unique |
| 13 | Llama 3.3 70B | Meta | 70B | 70B | ~35 GB | 128K | Llama 3 Lic. | Référence éprouvée |
| ▶ TIER B — GPU 16–24 GB / WORKSTATION (8–24 GB VRAM) | ||||||||
| 14 | Qwen3-32B | Alibaba | 32B | 32B | ~16 GB | 256K | Apache 2.0 | MMLU ~87%, dense, polyvalent |
| 15 | Gemma 4 31B | 31B | 31B | ~16 GB | 256K | Apache 2.0 | Multimodal, 256K | |
| 16 | DeepSeek R1 32B | DeepSeek | 32B | 32B | ~16 GB | 64K | MIT | Raisonnement local fort |
| 17 | Gemma 4 26B MoE | 26B MoE | ~4B | ~13 GB | 256K | Apache 2.0 | MoE léger multimodal | |
| 18 | Phi-4 14B | Microsoft | 14,7B | 14,7B | ~7 GB | 16K | MIT | MMLU ~84,8%, STEM fort |
| 19 | Qwen3-14B | Alibaba | 14B | 14B | ~7 GB | 256K | Apache 2.0 | Polyvalent mid-range |
| ▶ TIER C — GPU 8–16 GB (grand public) et EDGE (< 8 GB) | ||||||||
| 20 | Qwen3-30B-A3B | Alibaba | 30B MoE | 3B | ~15 GB | 256K | Apache 2.0 | Très bon rapport qualité/taille |
| 21 | Mistral Small 3.1 | Mistral AI | 24B | 24B | ~12 GB | 128K | Apache 2.0 | Très bon français local |
| 22 | Qwen3-8B | Alibaba | 8B | 8B | ~4 GB | 256K | Apache 2.0 | Excellent 8B 2026 |
| 23 | DeepSeek R1 7B | DeepSeek | 7B | 7B | ~4 GB | 64K | MIT | Raisonnement entry-level |
| 24 | Phi-4-Mini 3.8B | Microsoft | 3,8B | 3,8B | ~2 GB | 16K | MIT | Smartphone / edge |
| 25 | Gemma 4 E4B | ~4,5B | ~4,5B | ~2 GB | 128K | Apache 2.0 | Edge, on-device | |
"Actifs" = paramètres calculés par token (MoE). Tous les poids restent en VRAM. Les commandes Ollama listées sont indicatives — vérifiez le tag exact sur ollama.com/library.
4. Tier S — Frontier (serveur requis)
Ces modèles nécessitent une infrastructure cloud ou multi-GPU pour tourner. Ils rivalisent directement avec GPT-5 et Claude Opus sur la plupart des benchmarks.
1. Qwen3-235B-A22B — parmi les meilleurs modèles généralistes
Alibaba · Apache 2.0 · 235B MoE (22B actifs) · 256K tokens
Qwen3-235B-A22B est parmi les modèles open weight les plus équilibrés de 2026. Ses résultats le placent régulièrement dans le top 3 des benchmarks publics disponibles au moment de la rédaction (raisonnement, code, langues asiatiques, suivi d'instructions). Son architecture MoE (22B paramètres actifs sur 235B) lui permet d'être inféré efficacement sur un cluster A100/H100.
Sa licence Apache 2.0 complète — sans restriction d'utilisation commerciale — en fait le choix par défaut pour les entreprises qui veulent auto-héberger un modèle frontier. Disponible via Ollama (ollama pull qwen3:235b, puis ollama run qwen3:235b) sur des configurations multi-GPU.
2. GLM-5.2 — très performant sur GPQA et HumanEval
Zhipu AI · MIT · 744B MoE (~40B actifs) · 1M tokens · juin 2026
GLM-5.2, sorti le 13 juin 2026, affiche des résultats très élevés sur les benchmarks scientifiques — GPQA Diamond et HumanEval parmi les meilleurs scores open weight publiés. Son contexte d'1 million de tokens en fait un outil de choix pour analyser de larges corpus. Les poids sont disponibles sur Hugging Face (zai-org/GLM-5.2).
Avec 744B paramètres totaux (~370 GB en Q4 — nécessite un cluster GPU), c'est un des plus grands modèles de cette liste. La licence MIT, extrêmement permissive, est un avantage majeur pour les applications commerciales.
3. DeepSeek V4 Pro — MIT et 1M de contexte
DeepSeek · MIT · 1,6T MoE (49B actifs) · 1M tokens
Sorti le 24 avril 2026, DeepSeek V4 Pro pousse les limites avec 1,6 trillion de paramètres totaux (49B actifs par token) et un contexte d'1 million de tokens sous licence MIT. Très bon rapport performances/coût pour les déploiements self-hosted à grande échelle, selon les benchmarks publiés par DeepSeek.
Sa version Flash (DeepSeek V4 Flash, #10) offre 284B paramètres avec seulement 13B actifs — beaucoup plus accessible en termes de VRAM.
4. Kimi K2.7 Code — spécialiste agentic coding
Moonshot AI · Modified MIT · 1T MoE (32B actifs) · 256K tokens
Kimi K2.7 Code, sorti le 12 juin 2026, affiche une amélioration significative sur les benchmarks de coding par rapport à son prédécesseur K2.6 (selon les chiffres officiels Moonshot AI). Son architecture 1T/32B actifs le positionne parmi les meilleurs modèles open weight pour les tâches agentic de développement logiciel — à condition de vérifier la licence avant usage commercial.
5. MiniMax M3 — multimodal natif + 1M contexte
MiniMax · ⚠️ MiniMax Community License · 428B MoE (~23B actifs) · 1M tokens · juin 2026
MiniMax M3, lancé le 1er juin 2026, combine performances très élevées en coding, contexte d'1 million de tokens et multimodalité native (~215 GB en Q4). Très bien positionné sur les benchmarks de génération de code. Attention à la licence : la MiniMax Community License exige une attribution explicite et, pour les entreprises dépassant 20 M$/an de revenus, un accord commercial séparé — à vérifier avant tout usage commercial (licence sur HF).
6. Llama 4 Maverick — multimodal de Meta
Meta · Meta Llama License · 400B MoE (17B actifs) · 1M tokens · ~200 GB VRAM (Q4)
Llama 4 Maverick est l'offre phare de Meta : 400B paramètres MoE avec 1M de contexte et des capacités multimodales (texte + images). Il affiche 85,5% sur MMLU, parmi les meilleurs scores des modèles open source, et de très bons résultats sur les tâches multimodales (ChartQA 90,0%, DocVQA 94,4% selon les chiffres officiels Meta). Avec ~200 GB de VRAM nécessaires en Q4 (400B × 0,5 bytes), il requiert une infrastructure multi-GPU — datacenter ou cluster H100/A100.
7. Qwen3-Coder-480B — très performant sur le code
Alibaba · Apache 2.0 · 480B MoE (35B actifs) · 256K tokens · ~240 GB Q4
Qwen3-Coder-480B atteint 69,6% sur SWE-bench Verified — un des scores les plus élevés jamais publiés par un modèle open weight sur ce benchmark de résolution de vrais bugs GitHub (selon les chiffres officiels Alibaba au moment de la publication). Très bon choix pour les applications de développement logiciel assisté par IA à grande échelle.
5. Tier A — Workstation haute gamme (50–350 GB VRAM)
Ces modèles nécessitent des GPU professionnels (A10, A40, L40S, H100) ou des configurations multi-GPU grand public (2× RTX 3090 / 2× RTX 4090). Certains peuvent tourner avec de l'offloading CPU/RAM sur des workstations puissantes.
8. DeepSeek R1 — référence raisonnement mathématique
DeepSeek · MIT · 671B MoE (37B actifs) · 128K tokens
DeepSeek R1 reste en 2026 une référence majeure pour le raisonnement mathématique : 97,3% sur MATH-500, équivalent à o1 d'OpenAI sur les compétitions AIME. Sa phase de post-entraînement par apprentissage par renforcement dédié au raisonnement (sans imitation de teacher model) lui permet de produire des étapes intermédiaires utiles à examiner — celles-ci ne garantissent pas la fidélité du raisonnement interne, mais peuvent aider à identifier des erreurs.
Les versions distillées (32B, 14B, 7B) permettent d'accéder à une grande partie de ces capacités sur du matériel grand public — voir la section Tier B et C.
9. Mistral Large 3 — le français au plus haut niveau
Mistral AI · Apache 2.0 · 675B MoE (41B actifs) · 256K tokens · décembre 2025
Mistral Large 3 (sorti en décembre 2025) est parmi les meilleurs modèles open weight pour le français et les langues européennes — entraîné sur un corpus incluant des textes juridiques, administratifs et littéraires français. Son architecture 675B/41B actifs (inference légère comparée aux 675B totaux) offre d'excellentes performances, et la licence Apache 2.0 simplifie le déploiement commercial. Disponible sur Ollama : ollama pull mistral-large-3.
10. DeepSeek V4 Flash — 1M de contexte accessible
DeepSeek · MIT · 284B MoE (13B actifs) · 1M tokens
Version plus légère du V4 Pro, DeepSeek V4 Flash combine les bénéfices du V4 (raisonnement RL, 1M contexte) avec une empreinte plus raisonnable : 284B totaux / 13B actifs (~142 GB en Q4, nécessite du multi-GPU). Bon choix pour accéder à 1M de contexte avec une infrastructure multi-GPU modérée.
11. Mistral Small 4 — inférence rapide, 256K contexte
Mistral AI · Apache 2.0 · 119B MoE (6,5B actifs) · 256K tokens · ~60 GB VRAM (Q4)
Mistral Small 4 est remarquable sur le rapport inférence/performance : 119B paramètres totaux, seulement 6,5B actifs par token — ce qui le rend très rapide à l'inférence. La VRAM requise est d'environ ~60 GB en Q4 pour charger tous les poids (multi-GPU requis, ou offloading CPU/RAM). Excellent sur le français, les langues européennes et les tâches enterprise (extraction, classification, summarisation longue). Disponible via NVIDIA NIM et en téléchargement direct sur Hugging Face.
12. Llama 4 Scout — 109B MoE, contexte 10M tokens
Meta · Meta Llama License · 109B MoE (17B actifs) · 10M tokens · ~55 GB VRAM (Q4)
Llama 4 Scout est la surprise technique de 2026 : 109B paramètres totaux, 10 millions de tokens de contexte, et une inférence allégée grâce à ses 17B paramètres actifs (MoE). Le contexte 10M — soit environ 7,5 millions de mots — ouvre des cas d'usage inédits : analyser une base de code entière, traiter des corpus documentaires massifs, maintenir une mémoire de conversation extrêmement longue. En termes de VRAM : ~55 GB en Q4 pour charger tous les poids, ou possibilité d'offloading CPU/RAM si votre GPU est plus limité (avec une baisse de vitesse significative).
ollama pull llama4:scout.
13. Llama 3.3 70B — la référence éprouvée
Meta · Meta Llama License · 70B · 128K tokens · ~35 GB VRAM (Q4)
Llama 3.3 70B n'est plus le dernier modèle de Meta, mais il reste une valeur sûre : 87% MMLU, 82% HumanEval, support tool use mature, intégration native dans tous les frameworks (LangChain, LlamaIndex, LangGraph). Idéal si vous avez déjà une infrastructure taillée pour lui et que vous ne voulez pas changer.
6. Tier B — Grand public (8–24 GB VRAM)
La catégorie la plus intéressante pour les développeurs : ces modèles tournent sur une RTX 3090, RTX 4090 ou Apple M4 Pro. Ils couvrent 80% des cas d'usage professionnels.
14. Qwen3-32B — référence 24 GB polyvalent
Alibaba · Apache 2.0 · 32B dense · 256K tokens · ~20 GB VRAM
Sur une RTX 4090 (24 GB) ou deux RTX 3090, le Qwen3-32B est le choix optimal : 87% MMLU, 86,5% HumanEval, thinking mode activable, contexte 256K. Dense et stable — pas les complexités de routing MoE. Il rivalise sérieusement avec des API cloud pour les tâches de raisonnement et de code complexes. À 20-28 tok/s, c'est parfaitement utilisable en interactif.
Pour l'utiliser avec Ollama : ollama pull qwen3:32b
15. Gemma 4 31B — multimodal Google
Google DeepMind · Apache 2.0 · 31B dense · 256K tokens · ~16 GB VRAM (Q4)
Sorti le 31 mars 2026, Gemma 4 31B est le fleuron de la famille Gemma : modèle dense multimodal (texte + images) avec une génération de texte remarquablement fluide. Il affiche de meilleurs résultats que Llama 3.3 70B sur plusieurs benchmarks publiés, tout en tenant dans deux fois moins de VRAM. Intégration native dans Ollama, LM Studio et Hugging Face.
16. DeepSeek R1 32B — raisonnement local accessible
DeepSeek · MIT · 32B distillé · 64K tokens · ~20 GB VRAM
Version distillée du grand R1 (671B), DeepSeek R1 32B conserve environ 90% des capacités de raisonnement mathématique du modèle complet. Très performant pour résoudre des problèmes de maths, de logique et de code step-by-step — avec des chaînes de raisonnement intermédiaires explicites dans la réponse.
17. Gemma 4 26B MoE — la surprise légère
Google DeepMind · Apache 2.0 · 26B MoE (3,8B actifs) · 256K tokens · ~13 GB VRAM (Q4)
La version MoE de Gemma 4 26B requiert ~13 GB de VRAM en Q4 (26B × 0,5 bytes) — l'ensemble des poids est chargé en mémoire, comme pour tout modèle MoE. En revanche, ses 3,8B paramètres actifs par token le rendent aussi rapide à l'inférence qu'un modèle dense 4B. Multimodal comme le 31B, c'est un excellent choix pour les GPU 16 GB qui veulent les capacités vision de Gemma avec une inférence rapide.
18. Phi-4 14B — très bon STEM dans sa catégorie
Microsoft · MIT · 14,7B · 16K tokens · ~7 GB VRAM (Q4)
Phi-4 14B est très performant sur les tâches STEM (~84,8% MMLU selon les benchmarks officiels Microsoft). Sa force réside dans son entraînement sur des données synthétiques ultra-qualitatives (textbooks, exercices STEM, raisonnement formel) plutôt que sur du web brut. Ses 14,7B paramètres lui permettent d'atteindre 50–70 tok/s sur RTX 4090 avec seulement ~7 GB de VRAM en Q4.
Sa version Phi-4 Reasoning Vision ajoute la compréhension d'images. Limite importante : fenêtre de contexte de 16K tokens seulement selon la version standard, contre 256K pour Qwen3-14B. Vérifiez la version exacte dans la fiche officielle Hugging Face.
19. Qwen3-14B — polyvalent mid-range
Alibaba · Apache 2.0 · 14B dense · 256K tokens · ~7 GB VRAM (Q4)
Qwen3-14B est le modèle de référence pour les GPU 12–16 GB : bon sur le code, le raisonnement, le multilingue, avec un contexte 256K. Il tient sur une RTX 3080 10 GB en Q4_K_M et offre un rapport qualité/vitesse excellent (55–70 tok/s sur RTX 4090).
7. Tier C — Grand public (8–16 GB VRAM) et edge (< 8 GB)
Pour les GPU 8–16 GB, les Macs avec 8–24 GB de RAM unifiée, les laptops, ou les déploiements edge. Ces modèles ont progressé spectaculairement en 2026. Note : pour les MoE, la VRAM indiquée correspond au chargement de tous les poids, pas seulement des paramètres actifs.
20. Qwen3-30B-A3B — excellent rapport qualité/taille
Alibaba · Apache 2.0 · 30B MoE (3B actifs) · 256K tokens · ~15 GB VRAM (Q4)
Qwen3-30B-A3B illustre bien la puissance du MoE : 30B paramètres totaux, seulement 3B activés par token — ce qui le rend aussi rapide à l'inférence qu'un modèle 3B dense. En Q4, il faut compter environ 15 GB de VRAM (30B × 0,5 bytes) pour charger tous les poids, avec des performances nettement supérieures aux modèles 7B. À 25 tok/s sur RTX 4090 en inférence GPU complète, c'est un excellent choix pour un GPU 16 GB.
Commande Ollama : ollama pull qwen3:30b-a3b (vérifiez le tag exact sur ollama.com/library)
21. Mistral Small 3.1 — très bon français en local
Mistral AI · Apache 2.0 · 24B · 128K tokens · ~12 GB VRAM (Q4)
Pour les applications en français sur GPU 12–16 GB, Mistral Small 3.1 (24B, sorti en mars 2025) est parmi les meilleurs choix. Entraîné sur un corpus européen conséquent, il gère les nuances juridiques, administratives et techniques du français mieux que la plupart des modèles dans cette gamme de taille. Disponible sur Ollama : ollama pull mistral-small3.1.
22. Qwen3-8B — excellent modèle 8B en 2026
Alibaba · Apache 2.0 · 8B · 256K tokens · ~5 GB VRAM
Qwen3-8B figure parmi les meilleurs modèles 8B de 2026 sur les benchmarks de raisonnement et de code. Contexte de 256K tokens (contre 128K pour Llama 3.1 8B), thinking mode activable, support 100+ langues. Il tient dans 5 GB de VRAM et atteint 80–95 tok/s sur RTX 4090 — parfait pour les applications interactives.
Pour débuter avec Ollama : ollama pull qwen3:8b — c'est le modèle à essayer en premier si vous démarrez l'IA locale.
23. DeepSeek R1 7B — raisonnement entry-level
DeepSeek · MIT · 7B distillé · 64K tokens · ~5 GB VRAM
Version la plus légère de la famille R1, le 7B distillé conserve les chaînes de raisonnement explicites et surpasse les modèles 7B classiques sur les tâches mathématiques. MIT license, 5 GB de VRAM. Préférez le Qwen3-8B pour un usage général, mais le R1 7B est très fort pour les tâches de raisonnement formel dans cette gamme de taille.
24. Phi-4-Mini 3.8B — smartphone et edge
Microsoft · MIT · 3,8B · 16K tokens · ~2 GB VRAM (Q4)
Phi-4-Mini est conçu pour les environnements contraints : smartphones Android haut de gamme, iOS via Core ML, Raspberry Pi 5, applications on-device. Avec seulement 3,8B paramètres, il tient dans ~2 GB de VRAM en Q4 et offre des performances remarquables sur les tâches STEM grâce à la méthode d'entraînement sur données synthétiques de qualité de Microsoft.
25. Gemma 4 E4B — on-device Google
Google DeepMind · Apache 2.0 · ~4,5B · 128K tokens · ~2 GB VRAM (Q4)
Gemma 4 E4B (Edge 4B) est optimisé pour le déploiement on-device : iPhone, appareils Android, ARM. Ses ~4,5B paramètres offrent de bonnes performances pour un modèle de cette taille — meilleur que Phi-4-Mini sur la génération de texte créatif et le raisonnement général, légèrement moins bon sur les tâches STEM. Idéal pour les applications mobiles nécessitant confidentialité totale et fonctionnement hors ligne.
8. Modèles pour le français
Le français est bien supporté par les grands modèles généralistes (Qwen3, Llama 4, DeepSeek). Mais pour des applications spécifiquement françaises — juridique, médical, administratif — certains modèles se distinguent.
| Modèle | Taille | Atout français | Licence |
|---|---|---|---|
| Mistral Large 3 | 675B MoE | Meilleur français frontier, textes juridiques FR | Apache 2.0 |
| Mistral Small 4 | 119B MoE / 6B actifs | Français enterprise, 256K, léger | Apache 2.0 |
| Mistral Small 3.1 | 24B | Très bon français local, ~14 GB VRAM | Apache 2.0 |
| CroissantLLM | 1,3B | 100% français, souveraineté totale | Apache 2.0 |
| Lucie-7B | 7B | Français souverain, données FR vérifiées | Apache 2.0 |
9. Guide de sélection par profil
→ Qwen3-30B-A3B (raisonnement + code) · Qwen3-8B (polyvalent rapide) · DeepSeek R1 7B (maths/logique)
→ Qwen3-32B (polyvalent) · DeepSeek R1 32B (raisonnement) · Gemma 4 31B (multimodal)
→ Qwen3-32B (M4 Pro 48 GB) · Qwen3-14B (M4 Pro 24 GB) · Mistral Small 3.1 (M4 Pro 24 GB, français)
→ Qwen3-235B-A22B (Apache 2.0, polyvalent) · Mistral Large 3 (Apache 2.0, français) · DeepSeek V4 Pro (MIT, performance maximale)
→ DeepSeek R1 (671B, MATH-500 97,3%) · GLM-5.2 (GPQA Diamond 91,2%) · DeepSeek R1 32B (local accessible)
→ Qwen3-Coder-480B (SWE-bench 69,6%) · Kimi K2.7 (agentic coding) · Qwen3-32B (local, très bon code)
→ Phi-4-Mini 3.8B (STEM, MIT) · Gemma 4 E4B (polyvalent, Apache 2.0) · Qwen3-8B (si 6+ GB RAM)
→ Mistral Small 3.1 (local, excellent) · Mistral Small 4 (enterprise, 256K) · Lucie-7B (souverain, données FR traçables)
10. Licences — ce qu'il faut savoir
Le choix de la licence est critique pour les applications commerciales. Voici ce que chaque licence autorise réellement :
| Licence | Usage commercial | Fine-tuning | Redistribution | Modèles |
|---|---|---|---|---|
| Apache 2.0 | ✓ Libre | ✓ Libre | ✓ Libre | Qwen3, Gemma 4, Mistral (tous) |
| MIT | ✓ Libre | ✓ Libre | ✓ Libre | DeepSeek (tous), GLM-5.2, Phi-4 |
| Meta Llama License | ✓ jusqu'à 700M MAU | ✓ | Encadrée | Llama 4 (Scout, Maverick), Llama 3.3 |
| Modified MIT (Kimi) | ⚠️ À vérifier | ⚠️ | ⚠️ | Kimi K2.7 |
| MiniMax Community | ⚠️ Attribution req. | ⚠️ | ✗ >20M$/an | MiniMax M3 |
Lire aussi : Fine-tuning LoRA & QLoRA en Python pour adapter ces modèles à vos données, et guide Unsloth pour le fine-tuning 2× plus rapide.
11. FAQ
Quel est le meilleur LLM open source en 2026 ?
En juillet 2026, Qwen3-235B-A22B (Alibaba, Apache 2.0) est parmi les meilleurs modèles généralistes open weight. Pour le code, Qwen3-Coder-480B publie 69,6% sur SWE-bench Verified. Pour le raisonnement scientifique, GLM-5.2 affiche 91,2% sur GPQA Diamond (chiffres officiels des éditeurs). Sur GPU grand public, Qwen3-32B est un excellent choix sur RTX 4090 ou Mac M4.
Quel LLM open source avec 8 GB de VRAM ?
Avec 8 GB de VRAM : Qwen3-8B (~4–5 GB, excellent rapport qualité/taille, 256K contexte, 80–95 tok/s sur RTX 4090) et DeepSeek R1 7B (~4–5 GB, raisonnement formel fort). Pour un GPU 16 GB, le Qwen3-30B-A3B (~15 GB en Q4) offre des performances bien supérieures aux 7B denses, à 25 tok/s.
Quelle licence pour un usage commercial ?
Préférez Apache 2.0 (Qwen3, Gemma 4, Mistral) ou MIT (DeepSeek, GLM-5.2, Phi-4) — usage commercial libre, fine-tuning, redistribution sans restriction. La Meta Llama License est commerciale jusqu'à 700M MAU actifs. La "Modified MIT" de Kimi K2.7 contient des restrictions à vérifier avant production.
DeepSeek R1 vs Qwen3 : lequel choisir ?
DeepSeek R1 (MIT) excelle en maths et raisonnement formel — MATH-500 à 97,3% (source : paper R1), chaînes de raisonnement intermédiaires explicites. Qwen3-235B (Apache 2.0) est plus polyvalent : très performant en code, suivi d'instructions, langues multiples. Pour les maths/sciences : R1. Pour un assistant général ou des agents complexes : Qwen3.
Qu'est-ce qu'un modèle MoE et pourquoi ça change tout ?
MoE (Mixture of Experts) divise le modèle en plusieurs "experts" spécialisés. Pour chaque token, seul un sous-ensemble est activé. Exemple : Qwen3-235B-A22B a 235B paramètres au total mais seulement 22B actifs par token — le calcul est ~10× plus léger. Important : en VRAM, tous les poids doivent quand même être chargés (pas seulement les paramètres actifs). Exemple : Llama 4 Scout (109B total, 17B actifs) requiert ~55 GB en Q4 — pas 12 GB. Le gain MoE est sur la vitesse d'inférence, pas sur la VRAM nécessaire.
12. Méthodologie
Ce classement repose sur plusieurs critères pondérés :
- Performances benchmarks publics — MMLU-Pro, GPQA Diamond, MATH-500, SWE-bench Verified, HumanEval. Les scores cités sont ceux publiés par les éditeurs (non reproductions indépendantes).
- Disponibilité des poids — tous les modèles listés ont des poids téléchargeables publiquement sur Hugging Face au 27 juillet 2026.
- Licence — préférence aux licences permissives (Apache 2.0, MIT) pour les usages commerciaux.
- Déployabilité — compatibilité Ollama, vLLM, LM Studio, GGUF/exllamav2.
- VRAM requise — estimée à total_params × 0,5 bytes pour Q4 (hors KV cache). Pour MoE, tous les poids sont chargés.
13. Sources
- Open LLM Leaderboard — Hugging Face, classement benchmarks MMLU, ARC, etc.
- LMSYS Chatbot Arena — classement ELO par votes humains en aveugle.
- Artificial Analysis — benchmarks vitesse, VRAM, coût, qualité par modèle.
- SWE-bench — benchmark de résolution de bugs GitHub réels.
- Papers With Code — état de l'art par tâche et dataset.
- Ollama Library — disponibilité des modèles et commandes de déploiement.
- Papers et model cards officiels : Alibaba/Qwen, DeepSeek, Meta, Mistral AI, Google DeepMind, Microsoft.
Conclusion
Le paysage des LLM open source a radicalement changé en 2026. L'écart avec les modèles propriétaires s'est quasi comblé, et sur certains benchmarks critiques (GPQA, SWE-bench, MATH), les meilleurs modèles open weight sont en tête.
Trois takeaways pratiques :
- MoE change la vitesse d'inférence — Qwen3-30B-A3B (~15 GB Q4) rivalise avec des modèles denses bien plus lourds. Attention : la VRAM nécessaire dépend des paramètres totaux, pas actifs.
- Apache 2.0 / MIT sont désormais la norme — les licences permissives dominent les nouvelles publications open weight, plus de raison de choisir des licences restrictives pour les nouvelles applications.
- Les labs chinois dominent les benchmarks — Qwen (Alibaba), DeepSeek, GLM (Zhipu), Kimi (Moonshot) occupent 5 des 7 premières places du classement.
ollama pull qwen3:8b (~4 GB) ou ollama pull qwen3:32b (~16 GB) selon votre GPU. En quelques minutes vous avez un modèle local performant, sans envoyer vos données dans le cloud. Vérifiez les tags exacts sur ollama.com/library.