DEV-AI
LLM Open Source Comparatif Benchmark GPU 2026

Publié le · Par Tetyana Tarasenko, développeuse IA · Lecture : ~20 min · Données vérifiées au 27 juillet 2026

Dernière mise à jour : 27 juillet 2026 — classement révisé avec GLM-5.2, MiniMax M3, Kimi K2.7 et Mistral Small 4.

Top 25 des meilleurs LLM open source en 2026 : DeepSeek, Qwen3, Llama 4, Mistral, Gemma et les autres

Mis à jour en juillet 2026, ce comparatif présente les 25 meilleurs LLM open weight disponibles, leurs performances sur les benchmarks clés (MMLU, GPQA, SWE-bench, MATH-500), leurs besoins en VRAM, leurs licences et leurs principaux cas d'utilisation — du datacenter au smartphone.

Ce que vous allez trouver ici : un comparatif de 25 LLM open weight sélectionnés en juillet 2026 — tableau comparatif (VRAM approximative, contexte, licence, benchmarks clés), analyse par modèle, guide de sélection par profil et décryptage des licences pour une utilisation commerciale. Ce comparatif est éditorial : il combine performances publiées, licences, disponibilité des poids, facilité de déploiement et polyvalence.

Note open source vs open weight : par simplification et pour correspondre aux recherches courantes, cet article emploie l'expression « LLM open source ». Techniquement, la grande majorité des modèles présentés sont des modèles open weight : leurs poids sont accessibles publiquement, mais les données d'entraînement et le code complet ne sont pas toujours publiés. Seuls quelques projets (CroissantLLM, Lucie) satisfont aux critères stricts de l'open source.
25 modèles comparés · juillet 2026 MMLU · SWE-bench · GPQA · MATH Apache 2.0 · MIT · Meta License

1. Pourquoi les modèles open weight sont incontournables en 2026

En 2023, GPT-4 distançait les meilleurs modèles ouverts de plusieurs générations. En juillet 2026, l'écart s'est fortement réduit — et sur certains benchmarks spécifiques, des modèles open weight se hissent au niveau ou au-dessus des modèles propriétaires. Les modèles propriétaires conservent cependant des avantages sur la robustesse agentique, la multimodalité avancée et la disponibilité d'API.

Trois facteurs expliquent la progression des modèles ouverts :

1. MoE omniprésent
Le Mixture of Experts permet de créer des modèles avec des centaines de milliards de paramètres tout en n'activant qu'une fraction (10–20%) par token. Résultat : des performances de modèles très grands, avec une inférence proche des modèles denses de taille réduite.
2. Labs chinois très actifs
Alibaba (Qwen), DeepSeek, Zhipu AI (GLM), Moonshot AI (Kimi) et MiniMax ont publié en open weight des modèles qui rivalisent — ou surpassent — GPT-4o et Claude Opus sur plusieurs benchmarks.
3. Licences permissives
Apache 2.0 et MIT sont devenues très courantes parmi les nouveaux modèles ouverts : usage commercial libre, fine-tuning, redistribution sans restriction. C'est un changement majeur par rapport à 2023, où les licences restrictives (non-commerciales, usage limité) dominaient.

Ce comparatif couvre 25 modèles open weight publiés jusqu'en juillet 2026, sélectionnés à partir de leurs fiches techniques officielles, de benchmarks publics et de résultats publiés par les éditeurs ou des plateformes indépendantes (LMSYS Arena, Papers with Code, SWE-bench.com). Certains modèles ont été testés directement par notre équipe (Qwen3-8B, Qwen3-32B, DeepSeek R1 32B, Phi-4 14B, Mistral Small 3.1), d'autres sont présentés sur la base des données officielles. Les caractéristiques des modèles uniquement disponibles via API (et non téléchargeables) ne sont pas incluses dans ce classement.

2. Les benchmarks expliqués

Avant de plonger dans le classement, voici les benchmarks utilisés et ce qu'ils mesurent réellement :

Benchmark Ce qu'il mesure Fiabilité / limites
MMLUCulture générale — 57 domaines (droit, médecine, sciences, histoire…)Largement saturé, forte contamination possible
MMLU-Pro / GPQA DiamondCulture générale avancée · Questions doctorat (chimie, physique, bio)Plus fiables que MMLU classique
MATH-500 / AIMERaisonnement mathématique — problèmes niveau lycée à compétition olympiadeFiable pour les modèles de raisonnement
SWE-bench VerifiedRésolution de vrais bugs GitHub — 500 issues validées par des humainsParmi les plus fiables pour le code. Les scores avec agent ≠ modèle seul
HumanEvalGénération de code Python — résolution de fonctions à partir de docstringsSaturé (~90%+ pour les grands modèles). Préférer SWE-bench
Arena ELO (LMSYS)Préférences humaines — votes blind sur des millions de comparaisonsLe plus fiable pour l'usage général, indépendant des éditeurs
Important : les benchmarks peuvent être saturés ou ne pas refléter les performances en production. De plus, certains scores sont publiés directement par les éditeurs des modèles et n'ont pas nécessairement été reproduits indépendamment — ils doivent être interprétés comme des indications. Les protocoles, prompts, outils utilisés et budgets de calcul peuvent différer d'un modèle à l'autre. Un score SWE-bench obtenu via un agent logiciel n'est pas directement comparable à un score obtenu par le modèle seul.

3. Tableau comparatif des 25 modèles

Ce tableau présente les 25 modèles du classement avec leurs caractéristiques techniques clés. Les tailles VRAM sont indiquées pour une quantization Q4_K_M (sauf mention contraire).

# Modèle Lab Params Actifs VRAM min Contexte Licence Force
▶ TIER S — FRONTIER (multi-GPU / datacenter · VRAM Q4 ≥ 120 GB)
1Qwen3-235B-A22BAlibaba235B MoE22B~120 GB256KApache 2.0Polyvalent, parmi les meilleurs
2GLM-5.2Zhipu AI744B MoE~40B~370 GB1MMITGPQA très élevé, HumanEval fort
3DeepSeek V4 ProDeepSeek1,6T MoE49B~800 GB1MMITCode + raisonnement
4Kimi K2.7 CodeMoonshot AI1T MoE32B~500 GB256KMod. MITCoding fort, restr. commerciales
5MiniMax M3MiniMax428B MoE~23B~215 GB1M⚠️ MiniMax Lic.Multimodal + 1M ctx
6Llama 4 MaverickMeta400B MoE17B~200 GB1MLlama 4 Lic.Multimodal, MMLU fort
7Qwen3-Coder-480BAlibaba480B MoE35B~240 GB256KApache 2.0SWE-bench Verified 69,6%
▶ TIER A — MULTI-GPU / SERVEUR LOCAL (50–350 GB VRAM)
8DeepSeek R1DeepSeek671B MoE37B~336 GB128KMITMATH-500 97,3%
9Mistral Large 3Mistral AI675B MoE41B~338 GB256KApache 2.0Très bon français frontier
10DeepSeek V4 FlashDeepSeek284B MoE13B~142 GB1MMITV4 efficace, 1M contexte
11Mistral Small 4Mistral AI119B MoE6,5B~60 GB256KApache 2.0Inférence rapide (6,5B actifs)
12Llama 4 ScoutMeta109B MoE17B~55 GB†10MLlama 4 Lic.Contexte 10M tokens unique
13Llama 3.3 70BMeta70B70B~35 GB128KLlama 3 Lic.Référence éprouvée
▶ TIER B — GPU 16–24 GB / WORKSTATION (8–24 GB VRAM)
14Qwen3-32BAlibaba32B32B~16 GB256KApache 2.0MMLU ~87%, dense, polyvalent
15Gemma 4 31BGoogle31B31B~16 GB256KApache 2.0Multimodal, 256K
16DeepSeek R1 32BDeepSeek32B32B~16 GB64KMITRaisonnement local fort
17Gemma 4 26B MoEGoogle26B MoE~4B~13 GB256KApache 2.0MoE léger multimodal
18Phi-4 14BMicrosoft14,7B14,7B~7 GB16KMITMMLU ~84,8%, STEM fort
19Qwen3-14BAlibaba14B14B~7 GB256KApache 2.0Polyvalent mid-range
▶ TIER C — GPU 8–16 GB (grand public) et EDGE (< 8 GB)
20Qwen3-30B-A3BAlibaba30B MoE3B~15 GB256KApache 2.0Très bon rapport qualité/taille
21Mistral Small 3.1Mistral AI24B24B~12 GB128KApache 2.0Très bon français local
22Qwen3-8BAlibaba8B8B~4 GB256KApache 2.0Excellent 8B 2026
23DeepSeek R1 7BDeepSeek7B7B~4 GB64KMITRaisonnement entry-level
24Phi-4-Mini 3.8BMicrosoft3,8B3,8B~2 GB16KMITSmartphone / edge
25Gemma 4 E4BGoogle~4,5B~4,5B~2 GB128KApache 2.0Edge, on-device
Note VRAM : les valeurs indiquées sont approximatives pour une quantification 4 bits (GGUF Q4), hors KV cache (qui dépend du contexte utilisé). Pour les modèles MoE, l'ensemble des poids doit être chargé en mémoire — seul le calcul est allégé (paramètres actifs). La consommation réelle dépend du moteur d'inférence, du niveau de quantification, du contexte, d'un éventuel offloading CPU/RAM et du matériel. "Serveur" = infrastructure multi-GPU ou cloud, les poids ne tiennent pas sur un GPU grand public. Vérifiez toujours dans la documentation du moteur (Ollama, llama.cpp, vLLM) avant d'acheter du matériel. Les performances des modèles quantifiés peuvent être inférieures aux scores officiels, généralement mesurés en BF16 ou FP16.

"Actifs" = paramètres calculés par token (MoE). Tous les poids restent en VRAM. Les commandes Ollama listées sont indicatives — vérifiez le tag exact sur ollama.com/library.

4. Tier S — Frontier (serveur requis)

Ces modèles nécessitent une infrastructure cloud ou multi-GPU pour tourner. Ils rivalisent directement avec GPT-5 et Claude Opus sur la plupart des benchmarks.

1. Qwen3-235B-A22B — parmi les meilleurs modèles généralistes

Alibaba · Apache 2.0 · 235B MoE (22B actifs) · 256K tokens

Qwen3-235B-A22B est parmi les modèles open weight les plus équilibrés de 2026. Ses résultats le placent régulièrement dans le top 3 des benchmarks publics disponibles au moment de la rédaction (raisonnement, code, langues asiatiques, suivi d'instructions). Son architecture MoE (22B paramètres actifs sur 235B) lui permet d'être inféré efficacement sur un cluster A100/H100.

Sa licence Apache 2.0 complète — sans restriction d'utilisation commerciale — en fait le choix par défaut pour les entreprises qui veulent auto-héberger un modèle frontier. Disponible via Ollama (ollama pull qwen3:235b, puis ollama run qwen3:235b) sur des configurations multi-GPU.

Cas d'usage idéal : assistant enterprise auto-hébergé, agent IA complexe, traitement multilingue, tâches nécessitant du raisonnement avancé avec conformité RGPD.

2. GLM-5.2 — très performant sur GPQA et HumanEval

Zhipu AI · MIT · 744B MoE (~40B actifs) · 1M tokens · juin 2026

GLM-5.2, sorti le 13 juin 2026, affiche des résultats très élevés sur les benchmarks scientifiques — GPQA Diamond et HumanEval parmi les meilleurs scores open weight publiés. Son contexte d'1 million de tokens en fait un outil de choix pour analyser de larges corpus. Les poids sont disponibles sur Hugging Face (zai-org/GLM-5.2).

Avec 744B paramètres totaux (~370 GB en Q4 — nécessite un cluster GPU), c'est un des plus grands modèles de cette liste. La licence MIT, extrêmement permissive, est un avantage majeur pour les applications commerciales.

Cas d'usage idéal : recherche scientifique, analyse de longs documents, génération de code complexe, applications nécessitant une précision maximale.

3. DeepSeek V4 Pro — MIT et 1M de contexte

DeepSeek · MIT · 1,6T MoE (49B actifs) · 1M tokens

Sorti le 24 avril 2026, DeepSeek V4 Pro pousse les limites avec 1,6 trillion de paramètres totaux (49B actifs par token) et un contexte d'1 million de tokens sous licence MIT. Très bon rapport performances/coût pour les déploiements self-hosted à grande échelle, selon les benchmarks publiés par DeepSeek.

Sa version Flash (DeepSeek V4 Flash, #10) offre 284B paramètres avec seulement 13B actifs — beaucoup plus accessible en termes de VRAM.

Cas d'usage idéal : pipelines RAG sur de très longs documents, agents IA avec mémoire longue, applications de code à grande échelle.

4. Kimi K2.7 Code — spécialiste agentic coding

Moonshot AI · Modified MIT · 1T MoE (32B actifs) · 256K tokens

Kimi K2.7 Code, sorti le 12 juin 2026, affiche une amélioration significative sur les benchmarks de coding par rapport à son prédécesseur K2.6 (selon les chiffres officiels Moonshot AI). Son architecture 1T/32B actifs le positionne parmi les meilleurs modèles open weight pour les tâches agentic de développement logiciel — à condition de vérifier la licence avant usage commercial.

Attention : la licence "Modified MIT" contient des restrictions commerciales à vérifier soigneusement avant déploiement en production.

5. MiniMax M3 — multimodal natif + 1M contexte

MiniMax · ⚠️ MiniMax Community License · 428B MoE (~23B actifs) · 1M tokens · juin 2026

MiniMax M3, lancé le 1er juin 2026, combine performances très élevées en coding, contexte d'1 million de tokens et multimodalité native (~215 GB en Q4). Très bien positionné sur les benchmarks de génération de code. Attention à la licence : la MiniMax Community License exige une attribution explicite et, pour les entreprises dépassant 20 M$/an de revenus, un accord commercial séparé — à vérifier avant tout usage commercial (licence sur HF).

6. Llama 4 Maverick — multimodal de Meta

Meta · Meta Llama License · 400B MoE (17B actifs) · 1M tokens · ~200 GB VRAM (Q4)

Llama 4 Maverick est l'offre phare de Meta : 400B paramètres MoE avec 1M de contexte et des capacités multimodales (texte + images). Il affiche 85,5% sur MMLU, parmi les meilleurs scores des modèles open source, et de très bons résultats sur les tâches multimodales (ChartQA 90,0%, DocVQA 94,4% selon les chiffres officiels Meta). Avec ~200 GB de VRAM nécessaires en Q4 (400B × 0,5 bytes), il requiert une infrastructure multi-GPU — datacenter ou cluster H100/A100.

7. Qwen3-Coder-480B — très performant sur le code

Alibaba · Apache 2.0 · 480B MoE (35B actifs) · 256K tokens · ~240 GB Q4

Qwen3-Coder-480B atteint 69,6% sur SWE-bench Verified — un des scores les plus élevés jamais publiés par un modèle open weight sur ce benchmark de résolution de vrais bugs GitHub (selon les chiffres officiels Alibaba au moment de la publication). Très bon choix pour les applications de développement logiciel assisté par IA à grande échelle.

5. Tier A — Workstation haute gamme (50–350 GB VRAM)

Ces modèles nécessitent des GPU professionnels (A10, A40, L40S, H100) ou des configurations multi-GPU grand public (2× RTX 3090 / 2× RTX 4090). Certains peuvent tourner avec de l'offloading CPU/RAM sur des workstations puissantes.

8. DeepSeek R1 — référence raisonnement mathématique

DeepSeek · MIT · 671B MoE (37B actifs) · 128K tokens

DeepSeek R1 reste en 2026 une référence majeure pour le raisonnement mathématique : 97,3% sur MATH-500, équivalent à o1 d'OpenAI sur les compétitions AIME. Sa phase de post-entraînement par apprentissage par renforcement dédié au raisonnement (sans imitation de teacher model) lui permet de produire des étapes intermédiaires utiles à examiner — celles-ci ne garantissent pas la fidélité du raisonnement interne, mais peuvent aider à identifier des erreurs.

Les versions distillées (32B, 14B, 7B) permettent d'accéder à une grande partie de ces capacités sur du matériel grand public — voir la section Tier B et C.

Cas d'usage idéal : mathématiques, sciences formelles, vérification de preuves, tout problème nécessitant un raisonnement pas-à-pas fiable et explicable.

9. Mistral Large 3 — le français au plus haut niveau

Mistral AI · Apache 2.0 · 675B MoE (41B actifs) · 256K tokens · décembre 2025

Mistral Large 3 (sorti en décembre 2025) est parmi les meilleurs modèles open weight pour le français et les langues européennes — entraîné sur un corpus incluant des textes juridiques, administratifs et littéraires français. Son architecture 675B/41B actifs (inference légère comparée aux 675B totaux) offre d'excellentes performances, et la licence Apache 2.0 simplifie le déploiement commercial. Disponible sur Ollama : ollama pull mistral-large-3.

10. DeepSeek V4 Flash — 1M de contexte accessible

DeepSeek · MIT · 284B MoE (13B actifs) · 1M tokens

Version plus légère du V4 Pro, DeepSeek V4 Flash combine les bénéfices du V4 (raisonnement RL, 1M contexte) avec une empreinte plus raisonnable : 284B totaux / 13B actifs (~142 GB en Q4, nécessite du multi-GPU). Bon choix pour accéder à 1M de contexte avec une infrastructure multi-GPU modérée.

11. Mistral Small 4 — inférence rapide, 256K contexte

Mistral AI · Apache 2.0 · 119B MoE (6,5B actifs) · 256K tokens · ~60 GB VRAM (Q4)

Mistral Small 4 est remarquable sur le rapport inférence/performance : 119B paramètres totaux, seulement 6,5B actifs par token — ce qui le rend très rapide à l'inférence. La VRAM requise est d'environ ~60 GB en Q4 pour charger tous les poids (multi-GPU requis, ou offloading CPU/RAM). Excellent sur le français, les langues européennes et les tâches enterprise (extraction, classification, summarisation longue). Disponible via NVIDIA NIM et en téléchargement direct sur Hugging Face.

12. Llama 4 Scout — 109B MoE, contexte 10M tokens

Meta · Meta Llama License · 109B MoE (17B actifs) · 10M tokens · ~55 GB VRAM (Q4)

Llama 4 Scout est la surprise technique de 2026 : 109B paramètres totaux, 10 millions de tokens de contexte, et une inférence allégée grâce à ses 17B paramètres actifs (MoE). Le contexte 10M — soit environ 7,5 millions de mots — ouvre des cas d'usage inédits : analyser une base de code entière, traiter des corpus documentaires massifs, maintenir une mémoire de conversation extrêmement longue. En termes de VRAM : ~55 GB en Q4 pour charger tous les poids, ou possibilité d'offloading CPU/RAM si votre GPU est plus limité (avec une baisse de vitesse significative).

Important VRAM : Llama 4 Scout nécessite ~55 GB de VRAM pour un chargement GPU complet en Q4 (109B × 0,5 bytes). Avec 12 GB de GPU, il fonctionne via offloading CPU/RAM (2–5 tok/s). Pour de l'inférence GPU pure à vitesse correcte, comptez un A40, A6000 ou équivalent. Tags Ollama : ollama pull llama4:scout.

13. Llama 3.3 70B — la référence éprouvée

Meta · Meta Llama License · 70B · 128K tokens · ~35 GB VRAM (Q4)

Llama 3.3 70B n'est plus le dernier modèle de Meta, mais il reste une valeur sûre : 87% MMLU, 82% HumanEval, support tool use mature, intégration native dans tous les frameworks (LangChain, LlamaIndex, LangGraph). Idéal si vous avez déjà une infrastructure taillée pour lui et que vous ne voulez pas changer.

6. Tier B — Grand public (8–24 GB VRAM)

La catégorie la plus intéressante pour les développeurs : ces modèles tournent sur une RTX 3090, RTX 4090 ou Apple M4 Pro. Ils couvrent 80% des cas d'usage professionnels.

14. Qwen3-32B — référence 24 GB polyvalent

Alibaba · Apache 2.0 · 32B dense · 256K tokens · ~20 GB VRAM

Sur une RTX 4090 (24 GB) ou deux RTX 3090, le Qwen3-32B est le choix optimal : 87% MMLU, 86,5% HumanEval, thinking mode activable, contexte 256K. Dense et stable — pas les complexités de routing MoE. Il rivalise sérieusement avec des API cloud pour les tâches de raisonnement et de code complexes. À 20-28 tok/s, c'est parfaitement utilisable en interactif.

Pour l'utiliser avec Ollama : ollama pull qwen3:32b

15. Gemma 4 31B — multimodal Google

Google DeepMind · Apache 2.0 · 31B dense · 256K tokens · ~16 GB VRAM (Q4)

Sorti le 31 mars 2026, Gemma 4 31B est le fleuron de la famille Gemma : modèle dense multimodal (texte + images) avec une génération de texte remarquablement fluide. Il affiche de meilleurs résultats que Llama 3.3 70B sur plusieurs benchmarks publiés, tout en tenant dans deux fois moins de VRAM. Intégration native dans Ollama, LM Studio et Hugging Face.

16. DeepSeek R1 32B — raisonnement local accessible

DeepSeek · MIT · 32B distillé · 64K tokens · ~20 GB VRAM

Version distillée du grand R1 (671B), DeepSeek R1 32B conserve environ 90% des capacités de raisonnement mathématique du modèle complet. Très performant pour résoudre des problèmes de maths, de logique et de code step-by-step — avec des chaînes de raisonnement intermédiaires explicites dans la réponse.

17. Gemma 4 26B MoE — la surprise légère

Google DeepMind · Apache 2.0 · 26B MoE (3,8B actifs) · 256K tokens · ~13 GB VRAM (Q4)

La version MoE de Gemma 4 26B requiert ~13 GB de VRAM en Q4 (26B × 0,5 bytes) — l'ensemble des poids est chargé en mémoire, comme pour tout modèle MoE. En revanche, ses 3,8B paramètres actifs par token le rendent aussi rapide à l'inférence qu'un modèle dense 4B. Multimodal comme le 31B, c'est un excellent choix pour les GPU 16 GB qui veulent les capacités vision de Gemma avec une inférence rapide.

18. Phi-4 14B — très bon STEM dans sa catégorie

Microsoft · MIT · 14,7B · 16K tokens · ~7 GB VRAM (Q4)

Phi-4 14B est très performant sur les tâches STEM (~84,8% MMLU selon les benchmarks officiels Microsoft). Sa force réside dans son entraînement sur des données synthétiques ultra-qualitatives (textbooks, exercices STEM, raisonnement formel) plutôt que sur du web brut. Ses 14,7B paramètres lui permettent d'atteindre 50–70 tok/s sur RTX 4090 avec seulement ~7 GB de VRAM en Q4.

Sa version Phi-4 Reasoning Vision ajoute la compréhension d'images. Limite importante : fenêtre de contexte de 16K tokens seulement selon la version standard, contre 256K pour Qwen3-14B. Vérifiez la version exacte dans la fiche officielle Hugging Face.

19. Qwen3-14B — polyvalent mid-range

Alibaba · Apache 2.0 · 14B dense · 256K tokens · ~7 GB VRAM (Q4)

Qwen3-14B est le modèle de référence pour les GPU 12–16 GB : bon sur le code, le raisonnement, le multilingue, avec un contexte 256K. Il tient sur une RTX 3080 10 GB en Q4_K_M et offre un rapport qualité/vitesse excellent (55–70 tok/s sur RTX 4090).

7. Tier C — Grand public (8–16 GB VRAM) et edge (< 8 GB)

Pour les GPU 8–16 GB, les Macs avec 8–24 GB de RAM unifiée, les laptops, ou les déploiements edge. Ces modèles ont progressé spectaculairement en 2026. Note : pour les MoE, la VRAM indiquée correspond au chargement de tous les poids, pas seulement des paramètres actifs.

20. Qwen3-30B-A3B — excellent rapport qualité/taille

Alibaba · Apache 2.0 · 30B MoE (3B actifs) · 256K tokens · ~15 GB VRAM (Q4)

Qwen3-30B-A3B illustre bien la puissance du MoE : 30B paramètres totaux, seulement 3B activés par token — ce qui le rend aussi rapide à l'inférence qu'un modèle 3B dense. En Q4, il faut compter environ 15 GB de VRAM (30B × 0,5 bytes) pour charger tous les poids, avec des performances nettement supérieures aux modèles 7B. À 25 tok/s sur RTX 4090 en inférence GPU complète, c'est un excellent choix pour un GPU 16 GB.

Commande Ollama : ollama pull qwen3:30b-a3b (vérifiez le tag exact sur ollama.com/library)

Recommandation forte : si vous avez un GPU 16 GB et cherchez un modèle puissant, le Qwen3-30B-A3B offre d'excellentes performances pour sa taille. Avec 8 GB uniquement, préférez Qwen3-8B ou Qwen3-14B en Q4.

21. Mistral Small 3.1 — très bon français en local

Mistral AI · Apache 2.0 · 24B · 128K tokens · ~12 GB VRAM (Q4)

Pour les applications en français sur GPU 12–16 GB, Mistral Small 3.1 (24B, sorti en mars 2025) est parmi les meilleurs choix. Entraîné sur un corpus européen conséquent, il gère les nuances juridiques, administratives et techniques du français mieux que la plupart des modèles dans cette gamme de taille. Disponible sur Ollama : ollama pull mistral-small3.1.

22. Qwen3-8B — excellent modèle 8B en 2026

Alibaba · Apache 2.0 · 8B · 256K tokens · ~5 GB VRAM

Qwen3-8B figure parmi les meilleurs modèles 8B de 2026 sur les benchmarks de raisonnement et de code. Contexte de 256K tokens (contre 128K pour Llama 3.1 8B), thinking mode activable, support 100+ langues. Il tient dans 5 GB de VRAM et atteint 80–95 tok/s sur RTX 4090 — parfait pour les applications interactives.

Pour débuter avec Ollama : ollama pull qwen3:8b — c'est le modèle à essayer en premier si vous démarrez l'IA locale.

23. DeepSeek R1 7B — raisonnement entry-level

DeepSeek · MIT · 7B distillé · 64K tokens · ~5 GB VRAM

Version la plus légère de la famille R1, le 7B distillé conserve les chaînes de raisonnement explicites et surpasse les modèles 7B classiques sur les tâches mathématiques. MIT license, 5 GB de VRAM. Préférez le Qwen3-8B pour un usage général, mais le R1 7B est très fort pour les tâches de raisonnement formel dans cette gamme de taille.

24. Phi-4-Mini 3.8B — smartphone et edge

Microsoft · MIT · 3,8B · 16K tokens · ~2 GB VRAM (Q4)

Phi-4-Mini est conçu pour les environnements contraints : smartphones Android haut de gamme, iOS via Core ML, Raspberry Pi 5, applications on-device. Avec seulement 3,8B paramètres, il tient dans ~2 GB de VRAM en Q4 et offre des performances remarquables sur les tâches STEM grâce à la méthode d'entraînement sur données synthétiques de qualité de Microsoft.

25. Gemma 4 E4B — on-device Google

Google DeepMind · Apache 2.0 · ~4,5B · 128K tokens · ~2 GB VRAM (Q4)

Gemma 4 E4B (Edge 4B) est optimisé pour le déploiement on-device : iPhone, appareils Android, ARM. Ses ~4,5B paramètres offrent de bonnes performances pour un modèle de cette taille — meilleur que Phi-4-Mini sur la génération de texte créatif et le raisonnement général, légèrement moins bon sur les tâches STEM. Idéal pour les applications mobiles nécessitant confidentialité totale et fonctionnement hors ligne.

8. Modèles pour le français

Le français est bien supporté par les grands modèles généralistes (Qwen3, Llama 4, DeepSeek). Mais pour des applications spécifiquement françaises — juridique, médical, administratif — certains modèles se distinguent.

Modèle Taille Atout français Licence
Mistral Large 3675B MoEMeilleur français frontier, textes juridiques FRApache 2.0
Mistral Small 4119B MoE / 6B actifsFrançais enterprise, 256K, légerApache 2.0
Mistral Small 3.124BTrès bon français local, ~14 GB VRAMApache 2.0
CroissantLLM1,3B100% français, souveraineté totaleApache 2.0
Lucie-7B7BFrançais souverain, données FR vérifiéesApache 2.0
CroissantLLM et Lucie-7B sont les seuls modèles réellement français — entraînés sur des données françaises vérifiées, sans données tierces non-contrôlées. Ils sont moins performants que Mistral sur les benchmarks généraux, mais offrent une traçabilité totale des données d'entraînement — essentiel pour les applications soumises à des contraintes de souveraineté numérique.

9. Guide de sélection par profil

💻 Développeur solo — GPU 8–16 GB

→ Qwen3-30B-A3B (raisonnement + code) · Qwen3-8B (polyvalent rapide) · DeepSeek R1 7B (maths/logique)

🖥️ Workstation — GPU 24 GB (RTX 4090 / 3090)

→ Qwen3-32B (polyvalent) · DeepSeek R1 32B (raisonnement) · Gemma 4 31B (multimodal)

🍎 Apple Silicon (M4 Pro/Max 24–48 GB)

→ Qwen3-32B (M4 Pro 48 GB) · Qwen3-14B (M4 Pro 24 GB) · Mistral Small 3.1 (M4 Pro 24 GB, français)

🏢 Entreprise — self-hosted, RGPD

→ Qwen3-235B-A22B (Apache 2.0, polyvalent) · Mistral Large 3 (Apache 2.0, français) · DeepSeek V4 Pro (MIT, performance maximale)

🔢 Maths et raisonnement formel

→ DeepSeek R1 (671B, MATH-500 97,3%) · GLM-5.2 (GPQA Diamond 91,2%) · DeepSeek R1 32B (local accessible)

💡 Développement logiciel / agents coding

→ Qwen3-Coder-480B (SWE-bench 69,6%) · Kimi K2.7 (agentic coding) · Qwen3-32B (local, très bon code)

📱 Mobile / edge / on-device

→ Phi-4-Mini 3.8B (STEM, MIT) · Gemma 4 E4B (polyvalent, Apache 2.0) · Qwen3-8B (si 6+ GB RAM)

🇫🇷 Applications en français

→ Mistral Small 3.1 (local, excellent) · Mistral Small 4 (enterprise, 256K) · Lucie-7B (souverain, données FR traçables)

10. Licences — ce qu'il faut savoir

Le choix de la licence est critique pour les applications commerciales. Voici ce que chaque licence autorise réellement :

Licence Usage commercial Fine-tuning Redistribution Modèles
Apache 2.0✓ Libre✓ Libre✓ LibreQwen3, Gemma 4, Mistral (tous)
MIT✓ Libre✓ Libre✓ LibreDeepSeek (tous), GLM-5.2, Phi-4
Meta Llama License✓ jusqu'à 700M MAUEncadréeLlama 4 (Scout, Maverick), Llama 3.3
Modified MIT (Kimi)⚠️ À vérifier⚠️⚠️Kimi K2.7
MiniMax Community⚠️ Attribution req.⚠️✗ >20M$/anMiniMax M3
Règle pratique : pour tout projet commercial, privilégiez Apache 2.0 ou MIT. Ces deux licences autorisent l'utilisation commerciale, le fine-tuning et la redistribution sans restriction de taille ou de chiffre d'affaires. La Meta Llama License est commercialement viable pour la quasi-totalité des startups (700M MAU est un seuil très élevé), mais la redistribution des poids fine-tunés est encadrée.

Lire aussi : Fine-tuning LoRA & QLoRA en Python pour adapter ces modèles à vos données, et guide Unsloth pour le fine-tuning 2× plus rapide.

11. FAQ

Quel est le meilleur LLM open source en 2026 ?

En juillet 2026, Qwen3-235B-A22B (Alibaba, Apache 2.0) est parmi les meilleurs modèles généralistes open weight. Pour le code, Qwen3-Coder-480B publie 69,6% sur SWE-bench Verified. Pour le raisonnement scientifique, GLM-5.2 affiche 91,2% sur GPQA Diamond (chiffres officiels des éditeurs). Sur GPU grand public, Qwen3-32B est un excellent choix sur RTX 4090 ou Mac M4.

Quel LLM open source avec 8 GB de VRAM ?

Avec 8 GB de VRAM : Qwen3-8B (~4–5 GB, excellent rapport qualité/taille, 256K contexte, 80–95 tok/s sur RTX 4090) et DeepSeek R1 7B (~4–5 GB, raisonnement formel fort). Pour un GPU 16 GB, le Qwen3-30B-A3B (~15 GB en Q4) offre des performances bien supérieures aux 7B denses, à 25 tok/s.

Quelle licence pour un usage commercial ?

Préférez Apache 2.0 (Qwen3, Gemma 4, Mistral) ou MIT (DeepSeek, GLM-5.2, Phi-4) — usage commercial libre, fine-tuning, redistribution sans restriction. La Meta Llama License est commerciale jusqu'à 700M MAU actifs. La "Modified MIT" de Kimi K2.7 contient des restrictions à vérifier avant production.

DeepSeek R1 vs Qwen3 : lequel choisir ?

DeepSeek R1 (MIT) excelle en maths et raisonnement formel — MATH-500 à 97,3% (source : paper R1), chaînes de raisonnement intermédiaires explicites. Qwen3-235B (Apache 2.0) est plus polyvalent : très performant en code, suivi d'instructions, langues multiples. Pour les maths/sciences : R1. Pour un assistant général ou des agents complexes : Qwen3.

Qu'est-ce qu'un modèle MoE et pourquoi ça change tout ?

MoE (Mixture of Experts) divise le modèle en plusieurs "experts" spécialisés. Pour chaque token, seul un sous-ensemble est activé. Exemple : Qwen3-235B-A22B a 235B paramètres au total mais seulement 22B actifs par token — le calcul est ~10× plus léger. Important : en VRAM, tous les poids doivent quand même être chargés (pas seulement les paramètres actifs). Exemple : Llama 4 Scout (109B total, 17B actifs) requiert ~55 GB en Q4 — pas 12 GB. Le gain MoE est sur la vitesse d'inférence, pas sur la VRAM nécessaire.

12. Méthodologie

Ce classement repose sur plusieurs critères pondérés :

Modèles testés directement : Qwen3-8B, Qwen3-32B, DeepSeek R1 32B, Mistral Small 3.1, Phi-4 14B via Ollama sur RTX 4090. Les autres modèles sont évalués sur la base des papers et benchmarks officiels des éditeurs, non vérifiés indépendamment. Les données de ce comparatif ont été collectées en juillet 2026 — les classements évoluent rapidement.

13. Sources

Conclusion

Le paysage des LLM open source a radicalement changé en 2026. L'écart avec les modèles propriétaires s'est quasi comblé, et sur certains benchmarks critiques (GPQA, SWE-bench, MATH), les meilleurs modèles open weight sont en tête.

Trois takeaways pratiques :

Pour commencer : installez Ollama, puis lancez ollama pull qwen3:8b (~4 GB) ou ollama pull qwen3:32b (~16 GB) selon votre GPU. En quelques minutes vous avez un modèle local performant, sans envoyer vos données dans le cloud. Vérifiez les tags exacts sur ollama.com/library.
Pour aller plus loin : benchmark tokens/s par GPU, RAG local en Python, et agents IA avec ces modèles.

Articles liés

OLLAMA
Ollama 2026 : guide complet
Installer et utiliser Llama, Qwen, Mistral en local. API Python, zéro cloud.
BENCHMARK
Benchmark LLM local par GPU
Vitesse tokens/s, VRAM, qualité — guide complet par GPU (RTX 3060→5090).
COMPARATIF
GPT vs Claude vs Gemini 2026
Les modèles propriétaires face aux meilleurs open source — quel écart reste-t-il ?