Benchmarks de SWE-2: resultados, límites y cómo probarlo
Por CodeAgentSwarm · Actualizado el 11 de septiembre de 2026
Resultados publicados por Cognition
Cognition publicó esta comparación el 10 de septiembre de 2026. Son cifras del fabricante, no pruebas ejecutadas por CodeAgentSwarm.
| Benchmark | SWE-2 | Fable 5.1 | GPT-6 Astra |
|---|---|---|---|
| FrontierCode 1.1 Main | 50,0% | 50,9% | 53,3% |
| DeepSWE 1.1 | 73,0% | 67,4% | 74,1% |
| Terminal-Bench 2.1 | 92,8% | 91,4% | 89,9% |
| Terminal-Bench 4 | 27,3% | 55,8% | 57,9% |
SWE-2 destaca en Terminal-Bench 2.1, pero queda bastante por detrás en Terminal-Bench 4. La elección depende del tipo de tarea.
Cómo leer esta comparación
El apéndice metodológico combina resultados públicos y evaluaciones internas, utiliza distintos agentes y elige el mejor nivel de esfuerzo por modelo. No es una prueba con configuración idéntica.
FrontierCode 1.1 Main contiene las 100 tareas más difíciles de Extended. Cognition desarrolla tanto este benchmark como SWE-2. Ten en cuenta esa relación al interpretar los resultados.
Conserva el nombre y la versión de cada prueba al comparar cifras. Tampoco conviertas una puntuación agregada en la probabilidad de que el agente resuelva tu siguiente bug: tu proyecto puede usar otras herramientas, lenguajes y restricciones.
Elige un nivel de esfuerzo concreto
La documentación de modelos enumera SWE-2 Medium, High y Max. Anota cuál pruebas para poder repetir la comparación.

Empieza con el esfuerzo que usarías habitualmente y repite solo los fallos que merezcan más tiempo. Si cambias de nivel, registra también esa ejecución fallida: descartarla haría que la comparación pareciera mejor de lo que fue.
Una prueba pequeña en tu repositorio
Esta es nuestra propuesta de evaluación local; no hemos ejecutado este protocolo como benchmark de SWE-2. Elige un bug reproducible, un cambio de interfaz y una tarea de mantenimiento que conozcas bien.
- Prepara el mismo commit inicial, dependencias y pruebas para cada intento.
- Entrega la misma petición y permite las mismas herramientas. Mantén separados los cambios de cada modelo.
- Registra tiempo total, intervención humana y consumo real, incluidos los reintentos.
- Revisa el diff y ejecuta las pruebas antes de puntuar la solución.
Tarea | Modelo + esfuerzo | Pruebas superadas | Correcciones de revisión | Tiempo total | Consumo
Corrección de bug | SWE-2 High | ... | ... | ... | ...Un resultado útil es una solución que aceptarías en el proyecto. Cuenta los arreglos que hiciste tú y el tiempo de revisión; una respuesta rápida puede resultar cara si necesita correcciones.
Valora el coste después de comprobar la calidad
Para el precio de Pro, la promoción temporal y sus fechas, consulta la guía de modelos y cuotas de Devin. Guarda las condiciones que tenía tu cuenta el día de la prueba para que el resultado siga siendo interpretable cuando cambie la oferta.
Si aún no has instalado el agente, empieza por instalación y login de Devin CLI.
Preguntas frecuentes
No. La tabla recoge resultados publicados por Cognition. La prueba local propuesta es una forma de evaluar el modelo en tu propio proyecto.
La tabla no permite afirmarlo. Prueba tareas representativas y valora corrección, revisión humana, tiempo y consumo antes de elegir.
Sí, pero estarás comparando el modelo junto con su entorno de ejecución. Anota las herramientas, permisos y configuración de cada entorno.
El Chat de Devin, su instalación y el historial están en pruebas beta para un próximo release de CodeAgentSwarm. El botón descarga la app pública actual; consulta sus notas para comprobar la disponibilidad de Devin.