Des repères, honnêtement

Benchmarks des agents de codage IA

Les benchmarks sont un véritable signal de capacité – et faciles à utiliser à mauvais escient. Cette page explique comment nous mesurons les agents de codage autonomes, ce que les tests standards capturent et ne capturent pas, et comment CodeCourier rapporte les résultats : seuls des chiffres que nous pouvons reproduire et soutenir.

La méthodologie d’abord, pas de scores de vanitéReproductible ou non publié
Comment nous évaluons

Ce que nous mesurons et ce que cela signifie

Nous évaluons par rapport à deux références publiques et respectées. Chacun teste quelque chose de réel sur la capacité d'un agent à effectuer un travail d'ingénierie, et chacun a des limites qu'il convient de comprendre avant de lire un score.

SWE-bench Verified

Un ensemble de problèmes réels GitHub validés par l'homme et issus de projets open source. Un agent reçoit le problème et le référentiel et doit produire un correctif ; la tâche est considérée comme résolue uniquement si le changement fait réussir les propres tests du projet. Il mesure si un agent peut corriger de vrais bugs dans du code réel, et non s'il peut réussir un quiz - ce qui se rapproche le plus d'un examen significatif pour un ingénieur logiciel en IA.

Banc de terminal

Une référence pour les agents qui travaillent via un terminal - exécutant des commandes, inspectant les résultats et itérant vers un objectif dans un environnement shell réel. Il complète SWE-bench en testant les compétences opérationnelles et d'utilisation des outils plutôt que la seule génération de correctifs, ce qui est important pour un agent qui doit configurer, construire et vérifier son propre travail.

Reproductible ou il n'est pas expédié

Tout chiffre que nous publions est accompagné de la méthodologie exacte, de la date et de l’échafaudage utilisé pour le produire. Si un résultat n'est pas reproductible, il ne figure pas sur cette page.

L'échafaudage compte autant que le modèle

Un score reflète l’ensemble d’un système – la façon dont l’agent rassemble le contexte, planifie et itère – et pas seulement le modèle sous-jacent. Deux produits sur le même modèle peuvent avoir des scores très différents, donc un nombre décrit un système et non un modèle.

À l'identique, ou pas du tout

Pass@1 contre plusieurs tentatives, quel sous-ensemble, quelle date, quel outillage – tout change le nombre. Nous comparons ce qui est comparable et étiquetons les conditions, ou nous ne comparons pas.

Résultats de CodeCourier

Ce que nous signalons et quand

Nous réfléchissons sur les critères de référence. Plutôt que de donner un pourcentage global, nous publions ici des résultats vérifiés et reproductibles au fur et à mesure que nos analyses se terminent - chacune avec sa méthodologie complète, sa date et son échafaudage afin que tout le monde puisse les vérifier. Cette section répertorie les catégories pour lesquelles nous faisons rapport ; les chiffres arrivent ici car ils sont mesurés et vérifiables de manière indépendante.

Nous avons choisi de ne pas imprimer de score de référence que nous ne pouvons pas encore reproduire et vérifier de manière indépendante. Publier un numéro non vérifié relèverait du marketing et non de la mesure. Le tableau ci-dessous montre les catégories que nous signalerons : chaque statut est en attente de vérification, et rien ici n'est un résultat mesuré. Lorsqu'une figure est reproductible, elle apparaît ici avec sa méthodologie complète.

Référence
Ce qu'il mesure
Statut
SWE-bench Verified
Résoudre les problèmes réels de GitHub afin que les propres tests du projet réussissent
En attente de vérification indépendante
Banc de terminal
Compétence opérationnelle et d'utilisation d'outils dans un environnement shell réel
En attente de vérification indépendante
Fiabilité de la base de code réelle
Clôturer des tickets en toute sécurité sur des référentiels privés et désordonnés : la référence qui compte le plus pour vous
En attente de vérification indépendante

Ce tableau est une méthodologie et non des résultats mesurés. Les lignes sont les catégories pour lesquelles nous faisons rapport ; aucune ligne ne contient de score. Les chiffres vérifiés sont ajoutés ici au fur et à mesure que les analyses sont terminées et peuvent être reproduites indépendamment.

Le paysage plus large

Où en est le domaine aujourd’hui

Les capacités évoluent chaque semaine et les scores deviennent rapidement obsolètes, nous ne figeons donc pas les pourcentages des concurrents sur cette page. Pour connaître le classement actuel, accédez à la source : le classement officiel et les chiffres publiés et datés de chaque fournisseur.

Le classement officiel de SWE-bench

Le classement public canonique des agents sur SWE-bench et SWE-bench Verified, maintenu par les auteurs du benchmark. C'est le bon endroit pour voir les classements actuels en direct plutôt qu'un numéro copié dans un article qui sera erroné le mois prochain.

Ouvrir le classement de SWE-bench

Résultats publiés par chaque fournisseur

Pour tout agent spécifique - Devin, Claude Code, OpenAI Codex, Cursor, GitHub Copilot, OpenHands et autres - vérifiez le site du fournisseur pour connaître ses chiffres et sa méthodologie les plus récents et datés. Nous nommons nos concurrents uniquement à des fins de comparaison équitable et nous ne citons pas de pourcentages que nous ne pouvons pas vérifier.

À compter de juin 2026. Traitez n'importe quel chiffre de référence - ici ou ailleurs - comme un instantané daté et consultez le classement en direct et le site de chaque fournisseur pour connaître les chiffres actuels.

FAQ

Questions sur les benchmarks des agents

Pourquoi cette page n'affiche-t-elle pas de score de benchmark CodeCourier ?
Parce que nous ne publierons pas un chiffre que nous ne pouvons pas encore reproduire et vérifier de façon indépendante. Un chiffre de benchmark sans méthodologie divulguée, sans date et sans scaffold figé relève du marketing, pas de la mesure. Nous publions ici des résultats vérifiés et reproductibles à mesure que nos exécutions se terminent - chacun accompagné de la méthodologie complète pour que quiconque puisse le vérifier. La fiabilité et la sûreté sur votre codebase réelle comptent davantage pour nous qu'un pourcentage de classement.
Qu'est-ce que SWE-bench Verified et pourquoi l'utiliser ?
SWE-bench Verified est un sous-ensemble de SWE-bench validé par des humains, où des ingénieurs ont confirmé que chaque tâche est bien spécifiée et résoluble. Il existe parce que l'ensemble complet d'origine contenait des tâches ambiguës ou impossibles qui rendaient les scores bruts trompeurs. En date de juin 2026, c'est le chiffre que la plupart des fournisseurs rapportent, car c'est la mesure la plus propre et la plus équitable. Lisez notre explication complète sur la page What Is SWE-bench.
Pourquoi ne citez-vous pas les scores SWE-bench des concurrents ?
Parce qu'ils évoluent vite et que tout pourcentage précis dans un article devient rapidement obsolète. L'approche honnête est de vous renvoyer vers les chiffres actuels et datés de chaque fournisseur et vers le classement officiel, plutôt que de figer un chiffre qui sera faux le mois prochain. Nous ne nommons les concurrents que pour comparer équitablement, jamais pour laisser entendre une approbation.
Un score de benchmark élevé signifie-t-il qu'un agent est prêt pour la production ?
Non. Un score élevé est nécessaire mais pas suffisant. SWE-bench ne dit rien sur l'isolation, l'échec en toute sûreté, l'auditabilité ou l'adéquation au workflow de votre équipe. Un excellent score avec une mauvaise isolation et aucune piste d'audit n'est pas un agent prêt pour la production. Traitez le chiffre comme une donnée parmi d'autres et pesez-le au regard du comportement de l'agent sur votre propre dépôt en désordre.
Comment les résultats publiés de CodeCourier seront-ils reproductibles ?
Chaque chiffre que nous publions indiquera le benchmark et le sous-ensemble exacts, la date, le modèle et le scaffold utilisé pour le produire, afin qu'un lecteur indépendant puisse le réexécuter dans les mêmes conditions. Si un résultat ne peut pas être reproduit de cette façon, nous ne le publions pas.
Au-delà du classement

Découvrez comment CodeCourier ferme les tickets sur votre base de code

Gratuit pendant 14 jours · pas de carte de crédit

Embauchez votre premier ingénieur IA.
Expédier avant l'heure du déjeuner.

5 minutes pour embarquer. Premier PR dans l'heure. Annulez à tout moment.