Benchmark, onestamente

Benchmark degli agenti di codifica AI

I benchmark sono un vero segnale di capacità e sono facili da abusare. Questa pagina spiega come misuriamo gli agenti di codifica autonomi, cosa fanno e cosa non catturano i benchmark standard e come CodeCourier riporta i risultati: solo i numeri che possiamo riprodurre e sostenere.

Innanzitutto la metodologia, nessun punteggio di vanitàRiproducibile o non pubblicato
Come eseguiamo i benchmark

Cosa misuriamo e cosa significa

Valutiamo rispetto a due benchmark pubblici e rispettati. Ognuno mette alla prova qualcosa di reale sulla capacità di un agente di svolgere un lavoro di ingegneria e ognuno ha dei limiti che vale la pena comprendere prima di leggere qualsiasi punteggio.

SWE-bench Verified

Un insieme di problemi reali GitHub convalidati dall'uomo provenienti da progetti open source. Un agente riceve il problema e il repository e deve produrre una patch; l'attività viene considerata risolta solo se la modifica fa superare i test del progetto. Misura se un agente può correggere veri bug nel codice reale, non se può superare un quiz: la cosa più vicina a un esame significativo per un ingegnere del software AI.

Terminale-Panchina

Un punto di riferimento per gli agenti che funzionano tramite un terminale: eseguono comandi, ispezionano l'output e eseguono iterazioni verso un obiettivo in un ambiente shell reale. Si integra con SWE-bench testando le competenze operative e di utilizzo degli strumenti piuttosto che solo la generazione di patch, il che è importante per un agente che deve impostare, creare e verificare il proprio lavoro.

Riproducibile o non spedito

Qualsiasi figura che pubblichiamo viene fornita con la metodologia esatta, la data e l'impalcatura utilizzata per produrla. Se un risultato non è riproducibile, non è in questa pagina.

L’impalcatura conta tanto quanto il modello

Un punteggio riflette un intero sistema (il modo in cui l'agente raccoglie il contesto, pianifica e itera) e non solo il modello sottostante. Due prodotti sullo stesso modello possono ottenere punteggi molto diversi, quindi un numero descrive un sistema, non un modello.

Allo stesso modo, o per niente

Pass@1 rispetto a tentativi multipli, quale sottoinsieme, quale data, quale strumento: tutto cambia il numero. Confrontiamo il simile con il simile ed etichettiamo le condizioni, oppure non confrontiamo.

I risultati di CodeCourier

Cosa riportiamo e quando

Siamo attenti ai benchmark. Invece di indicare una percentuale principale, pubblichiamo qui risultati verificati e riproducibili una volta completate le nostre analisi, ciascuno con la sua metodologia, data e impalcatura completi in modo che chiunque possa verificarlo. Questa sezione elenca le categorie in base alle quali segnaliamo; i numeri arrivano qui poiché sono misurati e verificabili in modo indipendente.

Abbiamo scelto di non stampare un punteggio di riferimento che non possiamo ancora riprodurre e verificare in modo indipendente. Pubblicare un numero non verificato sarebbe marketing, non misurazione. La tabella seguente mostra le categorie che segnaleremo: ogni stato viene letto in attesa di verifica e nulla qui è un risultato misurato. Quando una figura è riproducibile, appare qui con tutta la sua metodologia.

Punto di riferimento
Cosa misura
Stato
SWE-bench Verified
Risolvere problemi reali GitHub in modo che i test del progetto superino
In attesa di verifica indipendente
Terminale-Panchina
Competenza operativa e di utilizzo degli strumenti in un ambiente shell reale
In attesa di verifica indipendente
Affidabilità della base di codice reale
Chiudere i ticket in modo sicuro su repository privati e disordinati: il punto di riferimento che conta di più per te
In attesa di verifica indipendente

Questa tabella rappresenta la metodologia, non i risultati misurati. Le righe sono le categorie in base alle quali riportiamo; nessuna riga contiene un punteggio. Le cifre verificate vengono aggiunte qui una volta completate le analisi e possono essere riprodotte in modo indipendente.

Il panorama più ampio

Dove si trova il campo oggi

Le capacità cambiano settimanalmente e i punteggi diventano obsoleti rapidamente, quindi non congeliamo le percentuali dei concorrenti in questa pagina. Per la classifica attuale, vai alla fonte: la classifica ufficiale e i dati pubblicati e datati di ciascun fornitore.

La classifica ufficiale di SWE-bench

La classifica pubblica canonica degli agenti su SWE-bench e SWE-bench Verified, mantenuta dagli autori del benchmark. È il posto giusto per vedere la classifica attuale dal vivo piuttosto che un numero copiato in un articolo che sarà sbagliato il mese prossimo.

Apri la classifica di SWE-bench

I risultati pubblicati da ciascun fornitore

Per qualsiasi agente specifico - Devin, Claude Code, OpenAI Codex, Cursor, GitHub Copilot, OpenHands e altri - controlla il sito del fornitore per i dati e la metodologia più recenti e datati. Nominiamo i concorrenti solo per effettuare confronti equi e non citiamo percentuali che non possiamo verificare.

A partire da giugno 2026. Considera qualsiasi cifra di riferimento, qui o ovunque, come un'istantanea datata e controlla la classifica in tempo reale e il sito di ciascun fornitore per i numeri attuali.

FAQ

Domande sui benchmark degli agenti

Perché questa pagina non mostra un punteggio benchmark di CodeCourier?
Perché non pubblicheremo un numero che non possiamo ancora riprodurre e verificare in modo indipendente. Una cifra di benchmark senza metodologia divulgata, senza data e senza uno scaffold fisso è marketing, non misurazione. Qui pubblichiamo risultati verificati e riproducibili man mano che le nostre esecuzioni si completano - ciascuno con la metodologia completa così chiunque può controllarlo. L'affidabilità e la sicurezza sulla tua codebase reale contano per noi più di una percentuale in classifica.
Cos'è SWE-bench Verified e perché usarlo?
SWE-bench Verified è un sottoinsieme di SWE-bench validato da esseri umani, in cui degli ingegneri hanno confermato che ogni compito è ben specificato e risolvibile. Esiste perché l'insieme completo originale conteneva compiti ambigui o impossibili che rendevano fuorvianti i punteggi grezzi. A giugno 2026 è la cifra che la maggior parte dei fornitori riporta, perché è la misura più pulita ed equa. Leggi la nostra spiegazione completa sulla pagina What Is SWE-bench.
Perché non citate i punteggi SWE-bench dei concorrenti?
Perché si muovono in fretta e qualsiasi percentuale specifica in un articolo diventa rapidamente obsoleta. L'approccio onesto è rimandarti alle cifre attuali e datate di ciascun fornitore e alla classifica ufficiale, invece di fossilizzare un numero che il mese prossimo sarà sbagliato. Nominiamo i concorrenti solo per confrontare in modo equo, mai per lasciar intendere un'approvazione.
Un punteggio benchmark alto significa che un agente è pronto per la produzione?
No. Un punteggio alto è necessario ma non sufficiente. SWE-bench non dice nulla sull'isolamento, sul fallire in sicurezza, sulla verificabilità o sull'adeguatezza al workflow del tuo team. Un punteggio eccellente con uno scarso isolamento e senza traccia di audit non è un agente pronto per la produzione. Tratta il numero come uno dei tanti dati e valutalo alla luce di come l'agente si comporta sul tuo repository disordinato.
Come saranno riproducibili i risultati pubblicati di CodeCourier?
Ogni cifra che pubblichiamo indicherà il benchmark e il sottoinsieme esatti, la data, il modello e lo scaffold usato per produrla, così un lettore indipendente potrà rieseguirla nelle stesse condizioni. Se un risultato non può essere riprodotto in questo modo, non lo pubblichiamo.
Oltre la classifica

Scopri come CodeCourier chiude i ticket sulla tua codebase

Gratuito per 14 giorni · nessuna carta di credito

Assumi il tuo primo ingegnere AI.
Spedizione entro l'ora di pranzo.

5 minuti per l'imbarco. Il primo PR entro un'ora. Annulla in qualsiasi momento.