DEV-AI
LLM Open Source Comparatif Benchmark GPU 2026

Publié le · Par Tetyana Tarasenko, développeuse IA · Lecture : ~20 min · Données vérifiées au 31 juillet 2026

Dernière mise à jour : 31 juillet 2026 — corrections factuelles : noms DeepSeek Distill, tailles DeepSeek V4, GLM-5.2, Kimi K2.7 et MiniMax M3 licences, Phi-4-Mini 128K.

Top 25 des meilleurs LLM open source en 2026 : DeepSeek, Qwen3, Llama 4, Mistral, Gemma et les autres

Mis à jour en juillet 2026, ce comparatif présente les 25 meilleurs LLM open weight disponibles, leurs performances sur les benchmarks clés (MMLU, GPQA, SWE-bench, MATH-500), leurs besoins en VRAM, leurs licences et leurs principaux cas d'utilisation — du datacenter au smartphone.

Ce que vous allez trouver ici : un comparatif de 25 LLM open weight sélectionnés en juillet 2026 — tableau comparatif (VRAM approximative, contexte, licence, benchmarks clés), analyse par modèle, guide de sélection par profil et décryptage des licences pour une utilisation commerciale. Ce comparatif est éditorial : il combine performances publiées, licences, disponibilité des poids, facilité de déploiement et polyvalence.

Note open source vs open weight : par simplification et pour correspondre aux recherches courantes, cet article emploie l'expression « LLM open source ». Techniquement, la grande majorité des modèles présentés sont des modèles open weight : leurs poids sont accessibles publiquement, mais les données d'entraînement et le code complet ne sont pas toujours publiés. Seuls quelques projets (CroissantLLM, Lucie) satisfont aux critères stricts de l'open source.
25 modèles comparés · juillet 2026 MMLU · SWE-bench · GPQA · MATH Apache 2.0 · MIT · Meta License

1. Pourquoi les modèles open weight sont incontournables en 2026

En 2023, GPT-4 distançait les meilleurs modèles ouverts de plusieurs générations. En juillet 2026, l'écart s'est fortement réduit — et sur certains benchmarks spécifiques, des modèles open weight se hissent au niveau ou au-dessus des modèles propriétaires. Les modèles propriétaires conservent cependant des avantages sur la robustesse agentique, la multimodalité avancée et la disponibilité d'API.

Trois facteurs expliquent la progression des modèles ouverts :

1. MoE omniprésent
Le Mixture of Experts permet de créer des modèles avec des centaines de milliards de paramètres tout en n'activant qu'une fraction (10–20%) par token. Résultat : des performances de modèles très grands, avec une inférence proche des modèles denses de taille réduite.
2. Labs chinois très actifs
Alibaba (Qwen), DeepSeek, Zhipu AI (GLM), Moonshot AI (Kimi) et MiniMax ont publié en open weight des modèles qui rivalisent — ou surpassent — GPT-4o et Claude Opus sur plusieurs benchmarks.
3. Licences permissives
Apache 2.0 et MIT sont devenues très courantes parmi les nouveaux modèles ouverts : usage commercial libre, fine-tuning, redistribution sans restriction. C'est un changement majeur par rapport à 2023, où les licences restrictives (non-commerciales, usage limité) dominaient.

Ce comparatif couvre 25 modèles open weight publiés jusqu'en juillet 2026, sélectionnés à partir de leurs fiches techniques officielles, de benchmarks publics et de résultats publiés par les éditeurs ou des plateformes indépendantes (LMSYS Arena, Papers with Code, SWE-bench.com). Certains modèles ont été testés directement par notre équipe (Qwen3-8B, Qwen3-32B, DeepSeek-R1-Distill-Qwen-32B, Phi-4 14B, Mistral Small 3.1), d'autres sont présentés sur la base des données officielles. Les caractéristiques des modèles uniquement disponibles via API (et non téléchargeables) ne sont pas incluses dans ce classement.

2. Les benchmarks expliqués

Avant de plonger dans le classement, voici les benchmarks utilisés et ce qu'ils mesurent réellement :

Benchmark Ce qu'il mesure Fiabilité / limites
MMLUCulture générale — 57 domaines (droit, médecine, sciences, histoire…)Largement saturé, forte contamination possible
MMLU-Pro / GPQA DiamondCulture générale avancée · Questions doctorat (chimie, physique, bio)Plus fiables que MMLU classique
MATH-500 / AIMERaisonnement mathématique — problèmes niveau lycée à compétition olympiadeFiable pour les modèles de raisonnement
SWE-bench VerifiedRésolution de vrais bugs GitHub — 500 issues validées par des humainsParmi les plus fiables pour le code. Les scores avec agent ≠ modèle seul
HumanEvalGénération de code Python — résolution de fonctions à partir de docstringsSaturé (~90%+ pour les grands modèles). Préférer SWE-bench
Arena ELO (LMSYS)Préférences humaines — votes blind sur des millions de comparaisonsRéférence fiable et indépendante des éditeurs pour l'usage général
Important : les benchmarks peuvent être saturés ou ne pas refléter les performances en production. De plus, certains scores sont publiés directement par les éditeurs des modèles et n'ont pas nécessairement été reproduits indépendamment — ils doivent être interprétés comme des indications. Les protocoles, prompts, outils utilisés et budgets de calcul peuvent différer d'un modèle à l'autre. Un score SWE-bench obtenu via un agent logiciel n'est pas directement comparable à un score obtenu par le modèle seul.

3. Tableau comparatif des 25 modèles

Ce tableau présente les 25 modèles du classement avec leurs caractéristiques techniques clés. La colonne "Poids Q4 (approx.)" indique la taille approximative des poids en quantification 4 bits — la mémoire totale nécessaire en production est plus élevée (KV cache, buffers, overhead moteur).

# Modèle Lab Params Actifs Poids Q4 (approx.) Contexte Licence Force
▶ TIER S — FRONTIER (multi-GPU / datacenter · VRAM Q4 ≥ 120 GB)
1Qwen3-235B-A22BAlibaba235B MoE22B~120 GB256KApache 2.0Polyvalent, parmi les meilleurs
2GLM-5.2Zhipu AI~753B MoE~40B~380 GB1MMITGPQA très élevé, HumanEval fort
3DeepSeek V4 ProDeepSeek1,6T MoE49B~800 GB1MMITCode + raisonnement
4Kimi K2.7 CodeMoonshot AI1T MoE32B~500 GB256KMod. MITCoding fort, attribution au-delà des seuils
5MiniMax M3MiniMax428B MoE~23B~215 GB1M⚠️ MiniMax Lic.Multimodal + 1M ctx
6Llama 4 MaverickMeta400B MoE17B~200 GB1MLlama 4 Lic.Multimodal, MMLU fort
7Qwen3-Coder-480BAlibaba480B MoE35B~240 GB256KApache 2.069,6% SWE-bench (Alibaba, protocole agentic)
▶ TIER A — MULTI-GPU / SERVEUR LOCAL (50–350 GB VRAM)
8DeepSeek R1DeepSeek671B MoE37B~336 GB128KMITMATH-500 97,3%
9Mistral Large 3Mistral AI675B MoE41B~338 GB256KApache 2.0Très bon français et langues européennes
10DeepSeek V4 FlashDeepSeek284B MoE13B~142 GB1MMITV4 efficace, 1M contexte
11Mistral Small 4Mistral AI119B MoE6,5B~60 GB256KApache 2.0Inférence rapide (6,5B actifs)
12Llama 4 ScoutMeta109B MoE17B~55 GB†10MLlama 4 Lic.Contexte 10M tokens unique
13Llama 3.3 70BMeta70B70B~35 GB128KLlama 3 Lic.Référence éprouvée
▶ TIER B — GPU 16–24 GB
14Qwen3-32BAlibaba32B32B~20 GB256KApache 2.0MMLU ~87%, dense, polyvalent
15Gemma 4 31BGoogle31B31B~18 GB256KApache 2.0Multimodal, 256K
16DeepSeek-R1-Distill-Qwen-32BDeepSeek32B32B~20 GB128KMITRaisonnement local fort
17Gemma 4 26B MoEGoogle26B MoE~4B~13 GB256KApache 2.0MoE léger multimodal
18Phi-4 14BMicrosoft14,7B14,7B~7 GB16KMITMMLU ~84,8%, STEM fort
19Qwen3-14BAlibaba14B14B~7 GB256KApache 2.0Polyvalent mid-range
20Qwen3-30B-A3BAlibaba30B MoE3B~15 GB†256KApache 2.0Bon rapport qualité/taille, GPU 20–24 GB recommandé
▶ TIER C — GPU 8–16 GB (grand public) et EDGE (< 8 GB)
21Mistral Small 3.1Mistral AI24B24B~12 GB128KApache 2.0Très bon français local
22Qwen3-8BAlibaba8B8B~4 GB256KApache 2.0Excellent 8B 2026
23DeepSeek-R1-Distill-Qwen-7BDeepSeek7B7B~4 GB128KMITRaisonnement entry-level
24Phi-4-Mini 3.8BMicrosoft3,8B3,8B~2 GB128KMITSmartphone / edge
25Gemma 4 E4BGoogle~4,5B~4,5B~2 GB128KApache 2.0Edge, on-device
Note poids Q4 : les valeurs de la colonne "Poids Q4 (approx.)" indiquent la taille approximative des poids du modèle en quantification 4 bits — pas la mémoire totale nécessaire en production. En pratique, il faut y ajouter le KV cache (variable selon le contexte utilisé), les buffers du moteur d'inférence et les overheads système. Pour les modèles 30–32B, comptez 3–5 GB supplémentaires au minimum. Pour les modèles MoE, l'ensemble des poids doit être chargé en mémoire — seul le calcul est allégé (paramètres actifs). La consommation réelle dépend du moteur d'inférence, du niveau de quantification, du contexte, d'un éventuel offloading CPU/RAM et du matériel. "Serveur" = infrastructure multi-GPU ou cloud, les poids ne tiennent pas sur un GPU grand public. Vérifiez toujours dans la documentation du moteur (Ollama, llama.cpp, vLLM) avant d'acheter du matériel. Les performances des modèles quantifiés peuvent être inférieures aux scores officiels, généralement mesurés en BF16 ou FP16.

"Actifs" = paramètres calculés par token (MoE). Tous les poids restent en VRAM. Les commandes Ollama listées sont indicatives — vérifiez le tag exact sur ollama.com/library.

4. Tier S — Frontier (serveur requis)

Ces modèles nécessitent une infrastructure cloud ou multi-GPU pour tourner. Sur plusieurs benchmarks publiés, certains affichent des scores comparables à GPT-5 et Claude Opus — les comparaisons directes restant difficiles à établir en l'absence de protocoles unifiés.

1. Qwen3-235B-A22B — parmi les meilleurs modèles généralistes

Alibaba · Apache 2.0 · 235B MoE (22B actifs) · 256K tokens

Qwen3-235B-A22B est parmi les modèles open weight les plus équilibrés de 2026. Ses résultats le placent régulièrement dans le top 3 des benchmarks publics disponibles au moment de la rédaction (raisonnement, code, langues asiatiques, suivi d'instructions). Son architecture MoE (22B paramètres actifs sur 235B) lui permet d'être inféré efficacement sur un cluster A100/H100.

Sa licence Apache 2.0 complète — sans restriction d'utilisation commerciale — en fait le choix par défaut pour les entreprises qui veulent auto-héberger un modèle frontier. Disponible via Ollama (ollama pull qwen3:235b, puis ollama run qwen3:235b) sur des configurations multi-GPU.

Cas d'usage idéal : assistant enterprise auto-hébergé, agent IA complexe, traitement multilingue, tâches nécessitant du raisonnement avancé avec conformité RGPD.

2. GLM-5.2 — très performant sur GPQA et HumanEval

Zhipu AI · MIT · ~753B MoE (~40B actifs) · 1M tokens · 17 juin 2026

GLM-5.2, présenté officiellement le 17 juin 2026, affiche des résultats très élevés sur les benchmarks scientifiques — 91,2% sur GPQA Diamond et un score HumanEval parmi les meilleurs scores open weight publiés (selon les chiffres officiels Zhipu AI). Son contexte d'1 million de tokens en fait un outil de choix pour analyser de larges corpus. Les poids sont disponibles sur Hugging Face (zai-org/GLM-5.2).

Avec ~753B paramètres totaux (~380 GB en Q4 — nécessite un cluster GPU), c'est un des plus grands modèles de cette liste. La licence MIT, extrêmement permissive, est un avantage majeur pour les applications commerciales.

Cas d'usage idéal : recherche scientifique, analyse de longs documents, génération de code complexe, applications nécessitant une précision maximale.

3. DeepSeek V4 Pro — MIT et 1M de contexte

DeepSeek · MIT · 1,6T MoE (49B actifs) · 1M tokens

Présenté le 26 avril 2026, DeepSeek V4 Pro compte 1,6 trillion de paramètres totaux (49B actifs par token) et un contexte d'1 million de tokens sous licence MIT. Ses poids en Q4 représentent environ 800 GB — infrastructure multi-GPU ou cluster GPU requis. Très bon rapport performances/coût pour les déploiements self-hosted à grande échelle, selon les benchmarks publiés par DeepSeek.

Sa version Flash (DeepSeek V4 Flash, #10) offre 284B paramètres avec seulement 13B actifs (~142 GB en Q4) — beaucoup plus accessible en termes de VRAM.

Cas d'usage idéal : pipelines RAG sur de très longs documents, agents IA avec mémoire longue, applications de code à grande échelle.

4. Kimi K2.7 Code — spécialiste agentic coding

Moonshot AI · Modified MIT · 1T MoE (32B actifs) · 256K tokens

Kimi K2.7 Code, sorti le 12 juin 2026, affiche une amélioration significative sur les benchmarks de coding par rapport à son prédécesseur K2.6 (selon les chiffres officiels Moonshot AI). Son architecture 1T/32B actifs le positionne parmi les meilleurs modèles open weight pour les tâches agentic de développement logiciel — à condition de vérifier la licence avant usage commercial.

Licence : l'usage commercial est permis. La "Modified MIT" impose uniquement d'afficher "Kimi K2.7 Code" dans les interfaces au-delà de 100 millions d'utilisateurs mensuels ou 20 M$ de revenus mensuels. En dessous de ces seuils, aucune obligation d'affichage supplémentaire liée aux seuils ne s'applique (les obligations MIT ordinaires et les notices de tiers restent en vigueur). Vérifiez la licence officielle sur HF (Kimi-K2.7-Code) avant déploiement.

5. MiniMax M3 — multimodal natif + 1M contexte

MiniMax · ⚠️ MiniMax Community License · 428B MoE (~23B actifs) · 1M tokens · juin 2026

MiniMax M3, lancé le 1er juin 2026, combine performances très élevées en coding, contexte d'1 million de tokens et multimodalité native (~215 GB en Q4). Très bien positionné sur les benchmarks de génération de code. Attention à la licence : la MiniMax Community License impose la mention "Built with MiniMax M3" pour tout usage commercial. En dessous de 20 M$ de chiffre d'affaires annuel, un simple avis à MiniMax est requis ; au-dessus de ce seuil, une autorisation préalable est nécessaire — à vérifier avant tout usage commercial (licence sur HF).

6. Llama 4 Maverick — multimodal de Meta

Meta · Meta Llama License · 400B MoE (17B actifs) · 1M tokens · ~200 GB VRAM (Q4)

Llama 4 Maverick est l'offre phare de Meta : 400B paramètres MoE avec 1M de contexte et des capacités multimodales (texte + images). Il affiche 85,5% sur MMLU, parmi les meilleurs scores des modèles open source, et de très bons résultats sur les tâches multimodales (ChartQA 90,0%, DocVQA 94,4% selon les chiffres officiels Meta). Avec ~200 GB de VRAM nécessaires en Q4 (400B × 0,5 bytes), il requiert une infrastructure multi-GPU — datacenter ou cluster H100/A100.

7. Qwen3-Coder-480B — très performant sur le code

Alibaba · Apache 2.0 · 480B MoE (35B actifs) · 256K tokens · ~240 GB Q4

Alibaba publie un score de 69,6% sur SWE-bench Verified avec son protocole d'évaluation agentic — un des scores les plus élevés jamais publiés par un modèle open weight sur ce benchmark de résolution de vrais bugs GitHub. Le score SWE-bench dépend fortement du scaffold, de l'agent et du budget de calcul utilisés ; comparez avec précaution. Très bon choix pour les applications de développement logiciel assisté par IA à grande échelle.

5. Tier A — Workstation haute gamme (50–350 GB VRAM)

Ces modèles nécessitent des GPU professionnels (A10, A40, L40S, H100) ou des configurations multi-GPU grand public (2× RTX 3090 / 2× RTX 4090). Certains peuvent tourner avec de l'offloading CPU/RAM sur des workstations puissantes.

8. DeepSeek R1 — référence raisonnement mathématique

DeepSeek · MIT · 671B MoE (37B actifs) · 128K tokens

DeepSeek R1 reste en 2026 une référence majeure pour le raisonnement mathématique : 97,3% sur MATH-500, équivalent à o1 d'OpenAI sur les compétitions AIME. Sa phase de post-entraînement par apprentissage par renforcement dédié au raisonnement (sans imitation de teacher model) lui permet de produire des étapes intermédiaires utiles à examiner — celles-ci ne garantissent pas la fidélité du raisonnement interne, mais peuvent aider à identifier des erreurs.

Les versions distillées (32B, 14B, 7B) permettent d'accéder à une grande partie de ces capacités sur du matériel grand public — voir la section Tier B et C.

Cas d'usage idéal : mathématiques, sciences formelles, vérification de preuves, tout problème nécessitant un raisonnement pas-à-pas fiable et explicable.

9. Mistral Large 3 — un modèle frontier multilingue avec support du français

Mistral AI · Apache 2.0 · 675B MoE (41B actifs) · 256K tokens · décembre 2025

Mistral Large 3 (sorti en décembre 2025) est parmi les meilleurs modèles open weight pour le français et les langues européennes selon les benchmarks publiés par Mistral AI. Son architecture 675B/41B actifs (inférence allégée comparée aux 675B totaux) offre d'excellentes performances, et la licence Apache 2.0 simplifie le déploiement commercial. Disponible sur Ollama : ollama pull mistral-large-3.

10. DeepSeek V4 Flash — 1M de contexte accessible

DeepSeek · MIT · 284B MoE (13B actifs) · 1M tokens

Version plus légère du V4 Pro, DeepSeek V4 Flash combine les bénéfices du V4 (raisonnement RL, 1M contexte) avec une empreinte plus raisonnable : 284B totaux / 13B actifs (~142 GB en Q4, nécessite du multi-GPU). Bon choix pour accéder à 1M de contexte avec une infrastructure multi-GPU modérée.

11. Mistral Small 4 — inférence rapide, 256K contexte

Mistral AI · Apache 2.0 · 119B MoE (6,5B actifs) · 256K tokens · ~60 GB VRAM (Q4)

Mistral Small 4 est remarquable sur le rapport inférence/performance : 119B paramètres totaux, seulement 6,5B actifs par token — ce qui le rend très rapide à l'inférence. La VRAM requise est d'environ ~60 GB en Q4 pour charger tous les poids (multi-GPU requis, ou offloading CPU/RAM). Excellent sur le français, les langues européennes et les tâches enterprise (extraction, classification, summarisation longue). Disponible via NVIDIA NIM et en téléchargement direct sur Hugging Face.

12. Llama 4 Scout — 109B MoE, contexte 10M tokens

Meta · Meta Llama License · 109B MoE (17B actifs) · 10M tokens · ~55 GB VRAM (Q4)

Llama 4 Scout est la surprise technique de 2026 : 109B paramètres totaux, 10 millions de tokens de contexte, et une inférence allégée grâce à ses 17B paramètres actifs (MoE). Le contexte 10M — soit environ 7,5 millions de mots — ouvre des cas d'usage inédits : analyser une base de code entière, traiter des corpus documentaires massifs, maintenir une mémoire de conversation extrêmement longue. En termes de VRAM : ~55 GB en Q4 pour charger tous les poids, ou possibilité d'offloading CPU/RAM si votre GPU est plus limité (avec une baisse de vitesse significative).

Important VRAM : Llama 4 Scout nécessite ~55 GB de VRAM pour un chargement GPU complet en Q4 (109B × 0,5 bytes). Avec 12 GB de GPU, il fonctionne via offloading CPU/RAM (2–5 tok/s). Pour de l'inférence GPU pure à vitesse correcte, comptez un A40, A6000 ou équivalent. Tags Ollama : ollama pull llama4:scout.

13. Llama 3.3 70B — la référence éprouvée

Meta · Meta Llama License · 70B · 128K tokens · ~35 GB VRAM (Q4)

Llama 3.3 70B n'est plus le dernier modèle de Meta, mais il reste une valeur sûre : 87% MMLU, 82% HumanEval, support tool use mature, intégration native dans tous les frameworks (LangChain, LlamaIndex, LangGraph). Idéal si vous avez déjà une infrastructure taillée pour lui et que vous ne voulez pas changer.

6. Tier B — Grand public (16–24 GB VRAM)

La catégorie la plus intéressante pour les développeurs : ces modèles tournent sur une RTX 3090, RTX 4090 ou Apple M4 Pro. Ils couvrent une large majorité des cas d'usage professionnels courants.

14. Qwen3-32B — référence 24 GB polyvalent

Alibaba · Apache 2.0 · 32B dense · 256K tokens · ~20 GB VRAM

Sur une RTX 4090 (24 GB) ou deux RTX 3090, le Qwen3-32B est le choix optimal : 87% MMLU, 86,5% HumanEval, thinking mode activable, contexte 256K. Dense et stable — pas les complexités de routing MoE. Il rivalise sérieusement avec des API cloud pour les tâches de raisonnement et de code complexes. À 20-28 tok/s, c'est parfaitement utilisable en interactif.

Pour l'utiliser avec Ollama : ollama pull qwen3:32b

15. Gemma 4 31B — multimodal Google

Google DeepMind · Apache 2.0 · 31B dense · 256K tokens · ~18 GB poids Q4 (mémoire totale supérieure)

Sorti le 31 mars 2026, Gemma 4 31B est le fleuron de la famille Gemma : modèle dense multimodal (texte + images) avec une génération de texte remarquablement fluide. Il affiche de meilleurs résultats que Llama 3.3 70B sur plusieurs benchmarks publiés, tout en tenant dans environ 18 GB de poids Q4 (contre ~35 GB pour Llama 3.3 70B). Intégration native dans Ollama, LM Studio et Hugging Face.

16. DeepSeek-R1-Distill-Qwen-32B — raisonnement local accessible

DeepSeek · MIT · 32B distillé Qwen2.5 · 64K tokens · ~20 GB VRAM

DeepSeek-R1-Distill-Qwen-32B est un modèle Qwen2.5 32B affiné sur des traces de raisonnement issues de R1 (671B). Il affiche d'excellentes performances en maths et logique formelle — avec des chaînes de raisonnement intermédiaires explicites dans la réponse. Ce n'est pas une compression directe du modèle complet, mais un fine-tuning qui transmet le style de raisonnement.

17. Gemma 4 26B MoE — la surprise légère

Google DeepMind · Apache 2.0 · 26B MoE (3,8B actifs) · 256K tokens · ~13 GB VRAM (Q4)

La version MoE de Gemma 4 26B requiert ~13 GB de VRAM en Q4 (26B × 0,5 bytes) — l'ensemble des poids est chargé en mémoire, comme pour tout modèle MoE. En revanche, ses 3,8B paramètres actifs par token le rendent aussi rapide à l'inférence qu'un modèle dense 4B. Multimodal comme le 31B, c'est un excellent choix pour les GPU 16 GB qui veulent les capacités vision de Gemma avec une inférence rapide.

18. Phi-4 14B — très bon STEM dans sa catégorie

Microsoft · MIT · 14,7B · 16K tokens · ~7 GB VRAM (Q4)

Phi-4 14B est très performant sur les tâches STEM (~84,8% MMLU selon les benchmarks officiels Microsoft). Sa force réside dans son entraînement sur des données synthétiques ultra-qualitatives (textbooks, exercices STEM, raisonnement formel) plutôt que sur du web brut. Ses 14,7B paramètres lui permettent d'atteindre 50–70 tok/s sur RTX 4090 (Ollama, Q4_K_M, contexte court) avec seulement ~7 GB de VRAM en Q4.

Sa version Phi-4 Reasoning Vision ajoute la compréhension d'images. Limite importante : fenêtre de contexte de 16K tokens seulement selon la version standard, contre 256K pour Qwen3-14B. Vérifiez la version exacte dans la fiche officielle Hugging Face.

19. Qwen3-14B — polyvalent mid-range

Alibaba · Apache 2.0 · 14B dense · 256K tokens · ~7 GB VRAM (Q4)

Qwen3-14B est le modèle de référence pour les GPU 12–16 GB : bon sur le code, le raisonnement, le multilingue, avec un contexte 256K. Sur une RTX 3080 10 GB, un chargement en Q4_K_M est possible avec très peu de marge (les poids seuls approchent 7–8 GB), mais le KV cache sera limité — préférez une quantification Q3 ou Q2 pour conserver de la marge. Il offre un excellent rapport qualité/vitesse (55–70 tok/s sur RTX 4090, Ollama, Q4_K_M, contexte court).

20. Qwen3-30B-A3B — excellent rapport qualité/taille

Alibaba · Apache 2.0 · 30B MoE (3B actifs) · 256K tokens · ~15 GB VRAM (Q4)

Qwen3-30B-A3B illustre bien la puissance du MoE : 30B paramètres totaux, seulement 3B activés par token — ce qui le rend aussi rapide à l'inférence qu'un modèle 3B dense. Les poids en Q4 approchent déjà ~15 GB (30B × 0,5 bytes), auxquels s'ajoutent KV cache, buffers et overhead moteur. Un GPU de 20–24 GB est recommandé pour une inférence confortable et un contexte normal ; sur 16 GB, prévoyez une quantification plus compacte (Q3 ou Q2) ou un contexte réduit, avec risque d'offloading partiel.

Commande Ollama : ollama pull qwen3:30b-a3b (vérifiez le tag exact sur ollama.com/library)

Recommandation : GPU 20–24 GB (RTX 3090/4090) pour un chargement complet en Q4_K_M. Sur 16 GB, utilisable en Q3/Q2 avec un contexte court. Avec 8 GB uniquement, préférez Qwen3-8B.

7. Tier C — GPU 8–16 GB (grand public) et edge (< 8 GB)

Pour les GPU 8–16 GB, les Macs avec 8–24 GB de RAM unifiée, les laptops, ou les déploiements edge. Ces modèles ont progressé spectaculairement en 2026. Note : pour les MoE, la VRAM indiquée correspond au chargement de tous les poids, pas seulement des paramètres actifs.

21. Mistral Small 3.1 — très bon français en local

Mistral AI · Apache 2.0 · 24B · 128K tokens · ~12 GB VRAM (Q4)

Pour les applications en français sur GPU 12–16 GB, Mistral Small 3.1 (24B, sorti en mars 2025) est parmi les meilleurs choix. Selon Mistral AI, il a été entraîné sur un corpus européen conséquent incluant du texte français — ce qui se traduit par de bonnes performances sur les tâches en français dans cette gamme de taille, selon les benchmarks publiés par l'éditeur. Disponible sur Ollama : ollama pull mistral-small3.1.

22. Qwen3-8B — excellent modèle 8B en 2026

Alibaba · Apache 2.0 · 8B · 256K tokens · ~5 GB VRAM

Qwen3-8B figure parmi les meilleurs modèles 8B de 2026 sur les benchmarks de raisonnement et de code. Contexte de 256K tokens (contre 128K pour Llama 3.1 8B), thinking mode activable, support 100+ langues. Il tient dans 5 GB de VRAM et atteint 80–95 tok/s sur RTX 4090 (Ollama, Q4_K_M, contexte court) — parfait pour les applications interactives.

Pour débuter avec Ollama : ollama pull qwen3:8b — c'est le modèle à essayer en premier si vous démarrez l'IA locale.

23. DeepSeek-R1-Distill-Qwen-7B — raisonnement entry-level

DeepSeek · MIT · 7B distillé Qwen2.5 · 64K tokens · ~5 GB VRAM

DeepSeek-R1-Distill-Qwen-7B est un modèle Qwen2.5 7B affiné sur des traces de raisonnement issues de R1. Il conserve les chaînes de raisonnement explicites et surpasse les modèles 7B classiques sur les tâches mathématiques. MIT license, 5 GB de VRAM. Préférez le Qwen3-8B pour un usage général, mais le R1-Distill-7B est très fort pour les tâches de raisonnement formel dans cette gamme de taille.

24. Phi-4-Mini 3.8B — smartphone et edge

Microsoft · MIT · 3,8B · 128K tokens · ~2 GB VRAM (Q4)

Phi-4-Mini est conçu pour les environnements contraints : smartphones Android haut de gamme, iOS via Core ML, Raspberry Pi 5, applications on-device. Avec seulement 3,8B paramètres, ses poids Q4 représentent environ 2–2,5 GB (mémoire totale supérieure en pratique) et il supporte officiellement une fenêtre de contexte de 128K tokens (selon la fiche Microsoft sur HF). Il offre des performances remarquables sur les tâches STEM grâce à la méthode d'entraînement sur données synthétiques de qualité de Microsoft.

25. Gemma 4 E4B — on-device Google

Google DeepMind · Apache 2.0 · ~4,5B · 128K tokens · ~2 GB VRAM (Q4)

Gemma 4 E4B (Edge 4B) est optimisé pour le déploiement on-device : iPhone, appareils Android, ARM. Ses ~4,5B paramètres offrent de bonnes performances pour un modèle de cette taille — selon les benchmarks publiés par Google DeepMind, il se positionne favorablement sur la génération de texte créatif et le raisonnement général par rapport à d'autres modèles edge de taille similaire, avec des performances légèrement inférieures sur les tâches STEM. Idéal pour les applications mobiles nécessitant confidentialité totale et fonctionnement hors ligne.

8. Modèles pour le français

Le français est bien supporté par les grands modèles généralistes (Qwen3, Llama 4, DeepSeek). Mais pour des applications spécifiquement françaises — juridique, médical, administratif — certains modèles se distinguent.

Modèle Taille Atout français Licence
Mistral Large 3675B MoETrès bon français et langues européennes (frontier)Apache 2.0
Mistral Small 4119B MoE / 6B actifsFrançais enterprise, 256K, légerApache 2.0
Mistral Small 3.124BTrès bon français local, ~14 GB VRAMApache 2.0
CroissantLLM1,3BBilingue FR/EN (ratio 1:1), données traçablesApache 2.0
Lucie-7B7BMultilingue (~32% FR), données traçablesApache 2.0
CroissantLLM et Lucie-7B sont les seuls modèles à données d'entraînement entièrement traçables dans cette liste. CroissantLLM est bilingue français/anglais avec un ratio d'entraînement 1:1 (pas monolingue français). Lucie-7B est multilingue : environ 32% de français et 33% d'anglais. Ils sont moins performants que Mistral sur les benchmarks généraux, mais offrent une traçabilité totale — essentiel pour les applications soumises à des contraintes de souveraineté numérique.

9. Guide de sélection par profil

💻 Développeur solo — GPU 8–16 GB

→ Qwen3-14B (~7 GB poids Q4, polyvalent) · Qwen3-8B (polyvalent rapide) · DeepSeek-R1-Distill-Qwen-7B (maths/logique) — Qwen3-30B-A3B : GPU 20–24 GB recommandé (Q3/Q2 seulement sur 16 GB)

🖥️ Workstation — GPU 24 GB (RTX 4090 / 3090)

→ Qwen3-32B (polyvalent) · DeepSeek-R1-Distill-Qwen-32B (raisonnement) · Gemma 4 31B (multimodal)

🍎 Apple Silicon (M4 Pro/Max 24–48 GB)

→ Qwen3-32B (M4 Pro 48 GB) · Qwen3-14B (M4 Pro 24 GB) · Mistral Small 3.1 (M4 Pro 24 GB, français)

🏢 Entreprise — self-hosted, RGPD

→ Qwen3-235B-A22B (Apache 2.0, polyvalent) · Mistral Large 3 (Apache 2.0, français) · DeepSeek V4 Pro (MIT, performances très élevées)

🔢 Maths et raisonnement formel

→ DeepSeek R1 (671B, MATH-500 97,3%) · GLM-5.2 (GPQA Diamond 91,2%) · DeepSeek-R1-Distill-Qwen-32B (local accessible)

💡 Développement logiciel / agents coding

→ Qwen3-Coder-480B (69,6% SWE-bench selon Alibaba) · Kimi K2.7 (agentic coding) · Qwen3-32B (local, très bon code)

📱 Mobile / edge / on-device

→ Phi-4-Mini 3.8B (STEM, MIT) · Gemma 4 E4B (polyvalent, Apache 2.0) · Qwen3-8B (si 6+ GB RAM)

🇫🇷 Applications en français

→ Mistral Small 3.1 (local, excellent) · Mistral Small 4 (enterprise, 256K) · Lucie-7B (souverain, données FR traçables)

10. Licences — ce qu'il faut savoir

Le choix de la licence est critique pour les applications commerciales. Voici ce que chaque licence autorise réellement :

Licence Usage commercial Fine-tuning Redistribution Modèles
Apache 2.0✓ Libre✓ Libre✓ LibreQwen3, Gemma 4, Mistral (tous)
MIT✓ Libre✓ Libre✓ LibreDeepSeek (tous), GLM-5.2, Phi-4
Meta Llama License✓ jusqu'à 700M MAUEncadréeLlama 4 (Scout, Maverick), Llama 3.3
Modified MIT (Kimi)✓ Permis†⚠️✓ Avec cond.Kimi K2.7 — †attribution requise >100M MAU ou >20M$/mois
MiniMax Community⚠️ Mention req.⚠️⚠️ Auth. >20M$/anMiniMax M3 — notification req. <20M$/an, autorisation req. au-dessus
Règle pratique : pour tout projet commercial, privilégiez Apache 2.0 ou MIT. Ces deux licences autorisent l'utilisation commerciale, le fine-tuning et la redistribution sans restriction de taille ou de chiffre d'affaires. La Meta Llama License est commercialement viable pour la quasi-totalité des startups (700M MAU est un seuil très élevé), mais la redistribution des poids fine-tunés est encadrée.

Lire aussi : Fine-tuning LoRA & QLoRA en Python pour adapter ces modèles à vos données, et guide Unsloth pour le fine-tuning 2× plus rapide.

11. FAQ

Quel est le meilleur LLM open source en 2026 ?

En juillet 2026, Qwen3-235B-A22B (Alibaba, Apache 2.0) est parmi les meilleurs modèles généralistes open weight. Pour le code, Qwen3-Coder-480B publie 69,6% sur SWE-bench Verified (selon Alibaba, protocole agentic). Pour le raisonnement scientifique, GLM-5.2 affiche 91,2% sur GPQA Diamond (chiffres officiels des éditeurs). Sur GPU grand public, Qwen3-32B est un excellent choix sur RTX 4090 ou Mac M4.

Quel LLM open source avec 8 GB de VRAM ?

Avec 8 GB de VRAM : Qwen3-8B (~4–5 GB, excellent rapport qualité/taille, 256K contexte, 80–95 tok/s sur RTX 4090 avec Ollama Q4_K_M) et DeepSeek-R1-Distill-Qwen-7B (~4–5 GB, raisonnement formel fort). Pour 16 GB, Qwen3-14B (~7 GB poids Q4) est fiable. Le Qwen3-30B-A3B (~15 GB poids Q4) est recommandé sur GPU 20–24 GB ; sur 16 GB, prévoir Q3/Q2 ou un contexte réduit.

Quelle licence pour un usage commercial ?

Préférez Apache 2.0 (Qwen3, Gemma 4, Mistral) ou MIT (DeepSeek, GLM-5.2, Phi-4) — usage commercial libre, fine-tuning, redistribution sans restriction. La Meta Llama License est commerciale jusqu'à 700M MAU actifs. La "Modified MIT" de Kimi K2.7 est commercialement permise en dessous de 100M MAU ou 20M$/mois — au-delà, l'affichage "Kimi K2.7 Code" est requis. MiniMax M3 exige la mention "Built with MiniMax M3" et une autorisation au-dessus de 20M$/an de CA.

DeepSeek R1 vs Qwen3 : lequel choisir ?

DeepSeek R1 (MIT) excelle en maths et raisonnement formel — MATH-500 à 97,3% (source : paper R1), chaînes de raisonnement intermédiaires explicites. Qwen3-235B (Apache 2.0) est plus polyvalent : très performant en code, suivi d'instructions, langues multiples. Pour les maths/sciences : R1. Pour un assistant général ou des agents complexes : Qwen3.

Qu'est-ce qu'un modèle MoE et pourquoi ça change tout ?

MoE (Mixture of Experts) divise le modèle en plusieurs "experts" spécialisés. Pour chaque token, seul un sous-ensemble est activé. Exemple : Qwen3-235B-A22B a 235B paramètres au total mais seulement 22B actifs par token — le calcul est ~10× plus léger. Important : en VRAM, tous les poids doivent quand même être chargés (pas seulement les paramètres actifs). Exemple : Llama 4 Scout (109B total, 17B actifs) requiert ~55 GB en Q4 — pas 12 GB. Le gain MoE est sur la vitesse d'inférence, pas sur la VRAM nécessaire.

12. Méthodologie

Ce classement repose sur plusieurs critères pondérés :

Modèles testés directement : Qwen3-8B, Qwen3-32B, DeepSeek-R1-Distill-Qwen-32B, Mistral Small 3.1, Phi-4 14B via Ollama sur RTX 4090. Les autres modèles sont évalués sur la base des papers et benchmarks officiels des éditeurs, non vérifiés indépendamment. Les données de ce comparatif ont été collectées en juillet 2026 — les classements évoluent rapidement.

13. Sources

Conclusion

Le paysage des LLM open source a radicalement changé en 2026. Sur certains benchmarks critiques (GPQA, SWE-bench, MATH), l'écart avec les modèles propriétaires s'est fortement réduit — et les meilleurs modèles open weight se hissent en tête sur des tâches spécifiques.

Trois takeaways pratiques :

Pour commencer : installez Ollama, puis lancez ollama pull qwen3:8b (~4 GB) ou ollama pull qwen3:32b (~20 GB, GPU 24 GB recommandé) selon votre GPU. En quelques minutes vous avez un modèle local performant, sans envoyer vos données dans le cloud. Vérifiez les tags exacts sur ollama.com/library.
Pour aller plus loin : benchmark tokens/s par GPU, RAG local en Python, et agents IA avec ces modèles.

Articles liés

OLLAMA
Ollama 2026 : guide complet
Installer et utiliser Llama, Qwen, Mistral en local. API Python, zéro cloud.
BENCHMARK
Benchmark LLM local par GPU
Vitesse tokens/s, VRAM, qualité — guide complet par GPU (RTX 3060→5090).
COMPARATIF
GPT vs Claude vs Gemini 2026
Les modèles propriétaires face aux meilleurs open source — quel écart reste-t-il ?