- Les petits modèles (moins de 15 milliards de paramètres) font aussi bien que les géants sur les tâches bornées : classification, extraction, résumé, reformulation.
- Ils coûtent dix à cinquante fois moins cher par appel, répondent en une fraction de seconde et peuvent tourner sur vos serveurs.
- Ils restent en retrait pour le raisonnement long, la synthèse de sources contradictoires et les instructions complexes.
- L'architecture gagnante en 2026 est un routeur : petit modèle par défaut, grand modèle sur exception.
Ce qui a changé en dix-huit mois
La course à la taille a produit des modèles remarquables, et une facture que beaucoup d'entreprises n'arrivent plus à justifier. Dans le même temps, les modèles compacts ont progressé plus vite que prévu : mieux entraînés, mieux distillés, souvent spécialisés. Sur nos évaluations internes, un modèle de 7 à 12 milliards de paramètres atteint aujourd'hui le niveau qu'un modèle vingt fois plus gros affichait il y a deux ans, sur les tâches que les entreprises automatisent réellement.
Or ces tâches ne sont pas des dissertations. Ce sont des classifications de tickets, des extractions de champs dans des factures, des résumés de comptes rendus, des reformulations de réponses. Des tâches courtes, répétitives, avec un format de sortie stable. Exactement le terrain des petits modèles.
Quand le petit modèle suffit
Trois conditions, et si elles sont réunies, ne cherchez pas plus loin. La tâche est bornée : une entrée, un format de sortie connu. Le contexte est court : quelques pages au plus. Et vous pouvez l'évaluer : un jeu de test de deux cents exemples avec la bonne réponse. Dans ce cadre, un petit modèle, éventuellement affiné sur vos données, égale ou dépasse un géant, pour une fraction du coût et avec des données qui ne quittent pas votre infrastructure.
Les cas où nous les avons adoptés
Tri de courriers entrants dans une mutuelle, extraction de données de bons de commande dans l'industrie, détection de langue et routage dans un centre d'appels, anonymisation de documents avant archivage, résumé de réunions pour un cabinet de conseil. Dans chaque cas, l'ancienne solution reposait sur un modèle de pointe facturé à l'usage. Le remplacement a réduit le coût de 80 à 95 % sans baisse mesurable de qualité.
Quand il ne suffit pas
Le raisonnement en plusieurs étapes, la synthèse de sources qui se contredisent, le respect d'instructions longues et conditionnelles, la génération de code complexe : sur ces tâches, l'écart avec les grands modèles reste net et se paie en erreurs subtiles, plus difficiles à détecter que des erreurs grossières. Un petit modèle qui se trompe le fait avec assurance.
Évaluer un petit modèle sur dix exemples choisis, constater qu'il « marche », et découvrir en production un taux d'erreur de 12 % sur les cas limites. Deux cents exemples représentatifs, dont les cas difficiles, sont le minimum.
L'architecture qui s'impose : le routeur
Plutôt que de choisir un modèle, choisissez une règle de routage. Le petit modèle traite tout par défaut. Un score de confiance, une longueur de contexte ou une catégorie de demande déclenche l'appel au grand modèle. Sur nos déploiements, 80 à 90 % du volume reste sur le petit modèle, et la facture suit. Le grand modèle devient un spécialiste que l'on consulte, pas un généraliste que l'on paie à chaque phrase.
| Tâche | Petit modèle | Grand modèle |
|---|---|---|
| Classer, étiqueter, router | Oui, par défaut | Inutile |
| Extraire des champs structurés | Oui, souvent après affinage | Sur documents atypiques |
| Résumer un document court | Oui | Inutile |
| Raisonner sur plusieurs sources | Non | Oui |
| Rédiger avec un ton précis et long | Parfois | Oui |
| Agir comme agent multi-étapes | Pour les étapes simples | Pour la planification |
« La question n'est plus quel modèle est le meilleur. C'est quel modèle est suffisant, et pour quelle tâche. »
Conclusion
Les petits modèles ne remplacent pas les grands ; ils remettent chacun à sa place. Pour une entreprise, cela signifie des coûts prévisibles, des temps de réponse acceptables pour les utilisateurs et une maîtrise de ses données. La méthode tient en trois mots : évaluer, router, mesurer.
FAQ
Quel matériel pour héberger un petit modèle ?
Un serveur avec une carte graphique de 24 Go de mémoire suffit pour un modèle de 7 à 12 milliards de paramètres en usage professionnel courant. Pour des volumes importants, deux cartes et un serveur d'inférence dédié.
Faut-il affiner le modèle sur nos données ?
Pour les tâches de classification et d'extraction, l'affinage apporte souvent 5 à 15 points de précision avec un millier d'exemples. Pour le résumé ou la reformulation, un bon prompt suffit généralement.
Comment mesurer que la qualité ne baisse pas ?
Avec un jeu de test figé, relancé à chaque changement de modèle ou de prompt, et un tableau de bord de précision consulté chaque semaine. Sans cela, vous ne saurez pas que la qualité a baissé avant qu'un client vous le dise.
Les petits modèles sont-ils plus sûrs pour les données sensibles ?
Hébergés chez vous, oui : les données ne sortent pas. C'est souvent l'argument décisif dans la santé, la finance et le juridique.