SWE-bench est un benchmark qui teste si les systèmes IA peuvent résoudre de vraies issues d'ingénierie logicielle. Il prend des milliers d'issues GitHub réelles et leurs correctifs correspondants issus de projets open source, remet au modèle l'issue et le dépôt, et vérifie si le correctif proposé par le modèle fait passer les tests existants du projet. En bref : il mesure si une IA peut corriger de vrais bugs dans du vrai code, pas si elle réussit un quiz. Cela en fait ce qui se rapproche le plus, dans ce domaine, d'un examen significatif pour un ingénieur logiciel IA.
Ce guide explique ce que mesure SWE-bench, ce qu'est SWE-bench Verified et pourquoi il existe, comment lire les scores sans être induit en erreur, et - tout aussi important - ce que le benchmark ne capture pas. C'est une entrée fondatrice de notre glossaire et la base conceptuelle d'une future page benchmarks.
Ce que SWE-bench mesure réellement
Les anciens benchmarks de codage IA testaient des fonctions isolées : « écris une fonction qui fait X ». L'ingénierie réelle ne fonctionne pas ainsi. L'ingénierie réelle, c'est « voici un rapport de bug et une grande base de code existante - trouve où est le problème et corrige-le sans rien casser d'autre ».
SWE-bench a été construit pour tester exactement cette chose plus difficile. Chaque tâche donne au modèle :
- Une vraie issue GitHub décrivant un problème.
- Le dépôt complet au commit précédant le correctif.
- La suite de tests existante du projet.
Le modèle doit produire un correctif. Le correctif est ensuite évalué en exécutant les tests : une tâche ne compte comme résolue que si le changement du modèle fait passer les tests pertinents sans casser le reste. C'est pourquoi SWE-bench est respecté - le succès est vérifié par une exécution de tests réelle, pas par un humain devinant si la réponse a l'air plausible. C'est l'analogue en benchmark de la vraie boucle issue-to-PR : lire l'issue, changer le code, le prouver avec des tests.
SWE-bench Verified : le sous-ensemble plus propre
Le SWE-bench original avait un problème. Certaines de ses tâches étaient ambiguës, sous-spécifiées, ou effectivement impossibles - le test ne passerait jamais peu importe la qualité du correctif, ou l'issue ne contenait pas assez d'information pour la résoudre. Cela rendait les scores bruts trompeurs, car un modèle pouvait être pénalisé pour des tâches que personne ne pouvait résoudre.
SWE-bench Verified a été créé pour corriger cela. C'est un sous-ensemble organisé et validé par des humains - quelques centaines de tâches - où des ingénieurs ont confirmé que chaque problème est bien spécifié et véritablement résoluble. En juin 2026, SWE-bench Verified est le chiffre que la plupart des éditeurs et chercheurs rapportent, précisément parce que c'est la mesure la plus équitable et la plus propre. Quand vous voyez un pourcentage « SWE-bench » cité aujourd'hui, cela signifie presque toujours SWE-bench Verified - et si ce n'est pas précisé, c'est une raison de demander.
Il existe aussi des benchmarks apparentés et étendus dans l'écosystème (variantes multimodales et multilingues, et d'autres benchmarks d'agents comme Terminal-Bench), reflétant à quel point cet espace d'évaluation évolue vite. Le principe est le même : tester les agents sur des tâches réalistes et vérifiables.
Comment lire les scores SWE-bench sans être induit en erreur
C'est la partie qui compte le plus, parce que les chiffres de benchmark sont faciles à mal utiliser.
- Les scores deviennent obsolètes vite. Les capacités ont fortement augmenté et continuent d'augmenter. Tout pourcentage précis dans n'importe quel article - y compris celui-ci - est un instantané. Traitez les chiffres publiés comme des indications et vérifiez le site de l'éditeur pour les chiffres actuels.
- Le scaffold compte autant que le modèle. Un score dépend non seulement du modèle sous-jacent mais du « scaffold » d'agent qui l'entoure - comment il rassemble le contexte, planifie, et itère. Deux produits utilisant le même modèle peuvent scorer très différemment. Un chiffre SWE-bench décrit donc un système, pas seulement un modèle.
- Les conditions varient. Pass@1 contre tentatives multiples, quel sous-ensemble, quelle date, quel outillage - tout cela change le chiffre. Comparez des choses comparables, ou ne comparez pas.
- Un score élevé est nécessaire, pas suffisant. Il vous dit qu'un agent peut faire de vrais correctifs. Il ne vous dit pas qu'il sera fiable, sûr, ou auditable sur votre base de code.
À cause de tout cela, nous évitons délibérément de citer des pourcentages SWE-bench précis de concurrents dans notre contenu. L'approche honnête est de vous orienter vers les chiffres actuels et datés de chaque éditeur plutôt que de figer un chiffre qui sera faux le mois prochain. C'est le même principe d'honnêteté que nous appliquons à travers notre classement 15 meilleurs agents de codage IA.
Ce que SWE-bench ne mesure pas
Un benchmark est une lampe de poche, pas un projecteur. SWE-bench Verified éclaire une chose importante - l'agent peut-il corriger de vraies issues - et laisse beaucoup dans l'ombre. Ce qu'il ne capture pas est souvent ce qui détermine si un agent est utilisable en production :
- Isolation et sécurité. L'agent tourne-t-il dans une sandbox de code jetable, ou contre vos systèmes en production ? SWE-bench ne dit rien à ce sujet.
- Échouer en toute sécurité. Quand l'agent ne peut pas résoudre une tâche, escalade-t-il honnêtement ou fusionne-t-il avec assurance quelque chose de faux ? Cette propriété de fiabilité est invisible à un score de réussite/échec mais critique en production.
- Auditabilité. Un humain peut-il voir ce que l'agent a fait et pourquoi ? Un classement s'en moque ; une équipe non.
- Adéquation au workflow. Prise en charge pilotée par les tickets, portes de relecture, analytique, intégration avec votre tracker et votre CI - rien de tout cela n'est mesuré par le benchmark, et pourtant tout cela détermine la valeur réelle.
- Votre base de code. SWE-bench utilise des projets open source spécifiques. Votre dépôt désordonné, privé, idiosyncratique est le seul benchmark qui compte vraiment pour vous.
C'est pourquoi un excellent score SWE-bench avec une mauvaise isolation et sans piste d'audit n'est pas un agent prêt pour la production. Le score est une entrée ; la fiabilité, la sécurité et l'adéquation sont le reste. La conception de CodeCourier s'appuie fortement sur les parties que les benchmarks ratent : chaque run est isolé dans une sandbox, l'agent échoue en toute sécurité et escalade, et le travail est auditable via les Issue Sessions et l'analytique.
Comment CodeCourier envisage les benchmarks
Notre position est simple et, pensons-nous, honnête. Des benchmarks comme SWE-bench Verified sont un signal utile et réel de capacité, et nous les prenons au sérieux comme une entrée. Mais nous n'en ferons pas un trophée marketing. Là où nous rapportons des chiffres, nous indiquerons la méthodologie exacte, la date et le scaffold pour qu'ils soient reproductibles - et nous ne publierons pas de chiffres que nous n'avons pas mesurés nous-mêmes ou que nous ne pouvons pas assumer. Une page benchmarks dédiée et rapportée de façon transparente est sur notre feuille de route, construite sur ce principe.
Le point plus profond : ce qui devrait compter pour vous, ce n'est pas la place d'un agent dans un classement, mais s'il ferme de façon fiable et sûre les tickets que vous lui donnez sur votre base de code. C'est la barre à laquelle nous nous tenons nous-mêmes.
Pour aller plus loin, voyez comment fonctionne la boucle dans Qu'est-ce qu'un ingénieur logiciel IA, la couche de sécurité dans Qu'est-ce qu'une sandbox de code, et le paysage complet dans notre classement 15 meilleurs agents de codage IA. Pour comparer les options, visitez le hub de comparaison ; quand vous serez prêt, voyez les tarifs.
FAQ : qu'est-ce que SWE-bench
Qu'est-ce que SWE-bench ?
SWE-bench est un benchmark qui teste si les systèmes IA peuvent résoudre de vraies issues d'ingénierie logicielle. Il puise dans des milliers d'issues GitHub réelles et leurs correctifs correspondants issus de projets Python open source, donne au modèle l'issue et le dépôt, et vérifie si le correctif du modèle fait passer les tests du projet. Il mesure une vraie capacité à corriger des bugs, pas des questions à choix multiples.
Qu'est-ce que SWE-bench Verified ?
SWE-bench Verified est un sous-ensemble organisé et validé par des humains de SWE-bench (quelques centaines de tâches) où des ingénieurs ont confirmé que chaque problème est bien spécifié et résoluble. Il a été créé parce que l'ensemble complet original contenait des tâches ambiguës ou impossibles qui rendaient les scores trompeurs. En juin 2026, SWE-bench Verified est le chiffre que la plupart des éditeurs rapportent, car c'est la mesure la plus propre et la plus équitable.
Qu'est-ce qu'un bon score SWE-bench en 2026 ?
Les scores ont augmenté rapidement et varient selon le modèle, le scaffold et la date, donc tout chiffre précis devient vite obsolète. La réponse honnête est de traiter les pourcentages publiés comme des indications et de vérifier les chiffres actuels sur le site de chaque éditeur plutôt que de faire confiance à un chiffre dans un article. Plus important que le pourcentage phare, c'est comment le score a été produit et s'il reflète la vraie fiabilité de l'agent.
Les scores SWE-bench sont-ils fiables pour choisir un agent de codage IA ?
Partiellement. Un score SWE-bench Verified plus élevé est un signal positif qu'un agent peut faire de vrais correctifs, mais le benchmark ne dit rien sur l'isolation, la sécurité, l'auditabilité, le workflow d'équipe, ou la fiabilité sur votre propre base de code. Utilisez-le comme une entrée parmi plusieurs, et pesez-le face à la façon dont l'agent se comporte sur votre dépôt réel et désordonné. Consultez notre classement 15 meilleurs agents de codage IA pour des critères plus complets.
Que ne mesure pas SWE-bench ?
Beaucoup de choses. Il ne mesure pas si l'agent tourne dans une sandbox isolée, s'il échoue en toute sécurité quand il ne peut pas résoudre une tâche, si son travail est auditable, comment il gère les tickets ambigus, ou comment il s'intègre au workflow d'une équipe. Il se concentre aussi sur un langage et une forme de tâche spécifiques. Un excellent score de benchmark avec une mauvaise isolation et sans piste d'audit n'est pas un agent prêt pour la production.
CodeCourier publie-t-il des scores SWE-bench ?
Nous traitons les benchmarks comme une entrée honnête, pas un trophée marketing. Là où nous rapportons des chiffres, nous indiquerons la méthodologie exacte, la date et le scaffold pour qu'ils soient reproductibles, et nous ne publierons pas de chiffres que nous ne pouvons pas assumer ou que nous n'avons pas mesurés nous-mêmes. Notre position est que la fiabilité et la sécurité sur votre vraie base de code comptent plus qu'un pourcentage de classement. Une page benchmarks dédiée est sur notre feuille de route.