SWE-bench è un benchmark che testa se i sistemi IA possono risolvere issue reali di ingegneria del software. Prende migliaia di issue GitHub reali e i relativi fix da progetti open source, consegna al modello la issue e il repository, e verifica se la patch proposta dal modello fa passare i test esistenti del progetto. In breve: misura se un'IA può correggere bug reali in codice reale, non se supera un quiz. Questo lo rende la cosa più vicina che il settore abbia a un esame significativo per un ingegnere software IA.
Questa guida spiega cosa misura SWE-bench, cos'è SWE-bench Verified e perché esiste, come leggere i punteggi senza essere fuorviati, e - altrettanto importante - cosa il benchmark non cattura. È una voce fondamentale nel nostro glossario e la base concettuale per una futura pagina benchmark.
Cosa misura davvero SWE-bench
I vecchi benchmark di coding IA testavano funzioni isolate: "scrivi una funzione che fa X." L'ingegneria reale non è così. L'ingegneria reale è "ecco un bug report e una grande codebase esistente - scopri dov'è il problema e correggilo senza rompere nient'altro."
SWE-bench è stato costruito per testare esattamente quella cosa più difficile. Ogni task dà al modello:
- Una vera issue GitHub che descrive un problema.
- L'intero repository al commit precedente il fix.
- La suite di test esistente del progetto.
Il modello deve produrre una patch. La patch viene poi valutata eseguendo i test: un task conta come risolto solo se la modifica del modello fa passare i test rilevanti senza rompere il resto. Ecco perché SWE-bench è rispettato - il successo è verificato dall'esecuzione effettiva dei test, non da un umano che indovina se la risposta sembra plausibile. È l'analogo da benchmark del vero ciclo issue-to-PR: leggere la issue, modificare il codice, dimostrarlo con i test.
SWE-bench Verified: il sottoinsieme più pulito
Il SWE-bench originale aveva un problema. Alcuni dei suoi task erano ambigui, poco specificati, o effettivamente impossibili - il test non sarebbe mai passato per quanto buono fosse il fix, oppure la issue non conteneva abbastanza informazioni per risolverla. Questo rendeva i punteggi grezzi fuorvianti, perché un modello poteva essere penalizzato per task che nessuno poteva risolvere.
SWE-bench Verified è stato creato per correggere questo. È un sottoinsieme curato e validato da umani - alcune centinaia di task - dove degli ingegneri hanno confermato che ogni problema è ben specificato e genuinamente risolvibile. A giugno 2026, SWE-bench Verified è la cifra che la maggior parte dei fornitori e ricercatori riporta, proprio perché è la misura più equa e pulita. Quando vedi oggi citata una percentuale "SWE-bench", quasi sempre significa SWE-bench Verified - e se non specifica quale, è un motivo per chiedere.
Esistono anche benchmark correlati ed estesi nell'ecosistema (varianti multimodali e multilingue, e altri benchmark di agenti come Terminal-Bench), a riflettere quanto velocemente si sta evolvendo questo spazio di valutazione. Il principio è lo stesso: testare gli agenti su task realistici e verificabili.
Come leggere i punteggi SWE-bench senza essere fuorviati
Questa è la parte che conta di più, perché i numeri dei benchmark sono facili da usare male.
- I punteggi diventano obsoleti in fretta. Le capacità sono cresciute bruscamente e continuano a crescere. Qualsiasi percentuale specifica in qualsiasi articolo - incluso questo - è un'istantanea. Tratta i numeri pubblicati come indicativi e controlla il sito del fornitore per le cifre aggiornate.
- Lo scaffold conta quanto il modello. Un punteggio dipende non solo dal modello sottostante ma dallo "scaffold" dell'agente attorno ad esso - come raccoglie contesto, pianifica e itera. Due prodotti che usano lo stesso modello possono ottenere punteggi molto diversi. Quindi un numero SWE-bench descrive un sistema, non solo un modello.
- Le condizioni variano. Pass@1 contro tentativi multipli, quale sottoinsieme, quale data, quale tooling - tutto cambia il numero. Confronta cose comparabili, o non confrontare.
- Un punteggio alto è necessario, non sufficiente. Ti dice che un agente può fare fix reali. Non ti dice che sarà affidabile, sicuro, o auditabile sulla tua codebase.
Per tutto questo, nel nostro contenuto evitiamo deliberatamente di citare percentuali SWE-bench specifiche dei concorrenti. L'approccio onesto è indirizzarti alle cifre attuali e datate di ogni fornitore invece di fossilizzare un numero che sarà sbagliato il mese prossimo. È lo stesso principio di onestà che applichiamo nella nostra classifica 15 migliori agenti di coding IA.
Cosa non misura SWE-bench
Un benchmark è una torcia, non un riflettore. SWE-bench Verified illumina una cosa importante - l'agente può correggere issue reali - e lascia molto al buio. Le cose che non cattura sono spesso ciò che determina se un agente è utilizzabile in produzione:
- Isolamento e sicurezza. L'agente gira in una sandbox di codice usa e getta, o contro i tuoi sistemi live? SWE-bench non dice nulla su questo.
- Fallire in modo sicuro. Quando l'agente non può risolvere un task, fa escalation onestamente o merga con sicurezza qualcosa di sbagliato? Questa proprietà di affidabilità è invisibile a un punteggio di successo/fallimento ma critica in produzione.
- Auditabilità. Un umano può vedere cosa ha fatto l'agente e perché? A una classifica non importa; a un team sì.
- Adattamento al workflow. Ingresso guidato dai ticket, gate di revisione, analytics, integrazione con il tuo tracker e la tua CI - niente di tutto ciò viene misurato nel benchmark, eppure tutto ciò determina il valore reale.
- La tua codebase. SWE-bench usa progetti open source specifici. Il tuo repository disordinato, privato, idiosincratico è l'unico benchmark che conta davvero per te.
Ecco perché un ottimo punteggio SWE-bench con scarso isolamento e senza traccia di audit non è un agente pronto per la produzione. Il punteggio è un input; affidabilità, sicurezza e adattamento sono il resto. Il design di CodeCourier si appoggia molto sulle parti che i benchmark non colgono: ogni run è isolato in una sandbox, l'agente fallisce in modo sicuro e fa escalation, e il lavoro è auditabile tramite le Issue Session e l'analytics.
Come CodeCourier pensa ai benchmark
La nostra posizione è semplice e, pensiamo, quella onesta. Benchmark come SWE-bench Verified sono un segnale utile e reale di capacità, e li prendiamo sul serio come un input. Ma non li trasformeremo in un trofeo di marketing. Dove riportiamo cifre, dichiareremo la metodologia esatta, la data e lo scaffold così che siano riproducibili - e non pubblicheremo numeri che non abbiamo misurato noi stessi o che non possiamo sostenere. Una pagina benchmark dedicata e riportata in modo trasparente è nella nostra roadmap, costruita su questo principio.
Il punto più profondo: ciò che dovrebbe contare per te non è dove si colloca un agente in una classifica, ma se chiude in modo affidabile e sicuro i ticket che gli dai sulla tua codebase. Questa è la barra a cui teniamo noi stessi.
Per approfondire, guarda come funziona il ciclo in Che cos'è un ingegnere software IA, lo strato di sicurezza in Che cos'è una sandbox di codice, e il quadro completo nella nostra classifica 15 migliori agenti di coding IA. Per confrontare le opzioni, visita l'hub di confronto; quando sei pronto, guarda i prezzi.
FAQ: che cos'è SWE-bench
Che cos'è SWE-bench?
SWE-bench è un benchmark che testa se i sistemi IA possono risolvere issue reali di ingegneria del software. Attinge a migliaia di issue GitHub reali e ai relativi fix da progetti Python open source, dà al modello la issue e il repository, e verifica se la patch del modello fa passare i test del progetto. Misura la vera capacità di risolvere bug, non quiz a scelta multipla.
Che cos'è SWE-bench Verified?
SWE-bench Verified è un sottoinsieme curato e validato da umani di SWE-bench (alcune centinaia di task) dove degli ingegneri hanno confermato che ogni problema è ben specificato e risolvibile. È stato creato perché l'insieme completo originale conteneva alcuni task ambigui o impossibili che rendevano i punteggi fuorvianti. A giugno 2026, SWE-bench Verified è la cifra che la maggior parte dei fornitori riporta, perché è la misura più pulita ed equa.
Cos'è un buon punteggio SWE-bench nel 2026?
I punteggi sono saliti rapidamente e variano per modello, scaffold e data, quindi qualsiasi numero specifico diventa presto obsoleto. La risposta onesta è trattare le percentuali pubblicate come indicative e controllare le cifre aggiornate sul sito di ogni fornitore invece di fidarsi di un numero in un articolo. Più importante della percentuale in prima pagina è come è stato prodotto il punteggio e se riflette la vera affidabilità dell'agente.
I punteggi SWE-bench sono affidabili per scegliere un agente di coding IA?
Parzialmente. Un punteggio SWE-bench Verified più alto è un segnale positivo che un agente può fare fix reali, ma il benchmark non dice nulla su isolamento, sicurezza, auditabilità, workflow di team, o affidabilità sulla tua codebase. Usalo come uno degli input tra diversi, e pesalo rispetto a come si comporta l'agente sul tuo repository reale e disordinato. Guarda la nostra classifica 15 migliori agenti di coding IA per criteri più completi.
Cosa non misura SWE-bench?
Molto. Non misura se l'agente gira in una sandbox isolata, se fallisce in modo sicuro quando non può risolvere un task, se il suo lavoro è auditabile, come gestisce i ticket ambigui, o come si adatta al workflow di un team. Si concentra anche su un linguaggio e una forma di task specifici. Un ottimo punteggio di benchmark con scarso isolamento e senza traccia di audit non è un agente pronto per la produzione.
CodeCourier pubblica punteggi SWE-bench?
Trattiamo i benchmark come un input onesto, non un trofeo di marketing. Dove riportiamo cifre, dichiareremo la metodologia esatta, la data e lo scaffold così che siano riproducibili, e non pubblicheremo numeri che non possiamo sostenere o che non abbiamo misurato noi stessi. La nostra posizione è che affidabilità e sicurezza sulla tua codebase reale contano più di una percentuale in classifica. Una pagina benchmark dedicata è nella nostra roadmap.