Benchmarks de SWE-2: resultados, límites y cómo probarlo

Por CodeAgentSwarm · Actualizado el 11 de septiembre de 2026

Para elegir un modelo de programación conviene mirar qué tareas resuelve, cuánto tarda y cuánto trabajo deja al revisor. Esta guía reúne resultados publicados y un método sencillo para comprobar si SWE-2 encaja en tu proyecto.

Resultados publicados por Cognition

Devin CLI

Cognition publicó esta comparación el 10 de septiembre de 2026. Son cifras del fabricante, no pruebas ejecutadas por CodeAgentSwarm.

BenchmarkSWE-2Fable 5.1GPT-6 Astra
FrontierCode 1.1 Main50,0%50,9%53,3%
DeepSWE 1.173,0%67,4%74,1%
Terminal-Bench 2.192,8%91,4%89,9%
Terminal-Bench 427,3%55,8%57,9%

SWE-2 destaca en Terminal-Bench 2.1, pero queda bastante por detrás en Terminal-Bench 4. La elección depende del tipo de tarea.

Cómo leer esta comparación

El apéndice metodológico combina resultados públicos y evaluaciones internas, utiliza distintos agentes y elige el mejor nivel de esfuerzo por modelo. No es una prueba con configuración idéntica.

FrontierCode 1.1 Main contiene las 100 tareas más difíciles de Extended. Cognition desarrolla tanto este benchmark como SWE-2. Ten en cuenta esa relación al interpretar los resultados.

Conserva el nombre y la versión de cada prueba al comparar cifras. Tampoco conviertas una puntuación agregada en la probabilidad de que el agente resuelva tu siguiente bug: tu proyecto puede usar otras herramientas, lenguajes y restricciones.

Elige un nivel de esfuerzo concreto

La documentación de modelos enumera SWE-2 Medium, High y Max. Anota cuál pruebas para poder repetir la comparación.

Selector de modelos de Devin en CodeAgentSwarm beta
Captura real de la beta. Documenta el selector; no representa una ejecución de los benchmarks.

Empieza con el esfuerzo que usarías habitualmente y repite solo los fallos que merezcan más tiempo. Si cambias de nivel, registra también esa ejecución fallida: descartarla haría que la comparación pareciera mejor de lo que fue.

Una prueba pequeña en tu repositorio

Esta es nuestra propuesta de evaluación local; no hemos ejecutado este protocolo como benchmark de SWE-2. Elige un bug reproducible, un cambio de interfaz y una tarea de mantenimiento que conozcas bien.

  • Prepara el mismo commit inicial, dependencias y pruebas para cada intento.
  • Entrega la misma petición y permite las mismas herramientas. Mantén separados los cambios de cada modelo.
  • Registra tiempo total, intervención humana y consumo real, incluidos los reintentos.
  • Revisa el diff y ejecuta las pruebas antes de puntuar la solución.
text
Tarea | Modelo + esfuerzo | Pruebas superadas | Correcciones de revisión | Tiempo total | Consumo
Corrección de bug | SWE-2 High | ... | ... | ... | ...

Un resultado útil es una solución que aceptarías en el proyecto. Cuenta los arreglos que hiciste tú y el tiempo de revisión; una respuesta rápida puede resultar cara si necesita correcciones.

Valora el coste después de comprobar la calidad

Para el precio de Pro, la promoción temporal y sus fechas, consulta la guía de modelos y cuotas de Devin. Guarda las condiciones que tenía tu cuenta el día de la prueba para que el resultado siga siendo interpretable cuando cambie la oferta.

Si aún no has instalado el agente, empieza por instalación y login de Devin CLI.

Preguntas frecuentes

No. La tabla recoge resultados publicados por Cognition. La prueba local propuesta es una forma de evaluar el modelo en tu propio proyecto.

La tabla no permite afirmarlo. Prueba tareas representativas y valora corrección, revisión humana, tiempo y consumo antes de elegir.

Sí, pero estarás comparando el modelo junto con su entorno de ejecución. Anota las herramientas, permisos y configuración de cada entorno.

El Chat de Devin, su instalación y el historial están en pruebas beta para un próximo release de CodeAgentSwarm. El botón descarga la app pública actual; consulta sus notas para comprobar la disponibilidad de Devin.

Descargar beta gratismacOS y Windows