El mercado de la IA ofensiva ha pasado de capturas de pantalla a números validables. Esta página reúne cómo evaluamos RedArrow: los targets de referencia, los benchmarks académicos que citan los papers, la comparativa de vendors y las métricas estándar. Y nuestra validación tipo XBOW, con sus límites honestos.
El ecosistema pasó de wrappers de prompts a pipelines reproducibles y contenerizados. Un benchmark creíble ya no enseña una captura: publica métricas que otro puede reproducir.
Los vendors publican números validados externamente, no screenshots de un panel.
Una flota especializada supera al agente único hasta 4,3× en encadenado (benchmark HPTSA).
Tool-grounding y MCP como objetivo de diseño de primera clase, no un añadido.
Explotar un CVE con su advisory delante no es explotarlo a ciegas. El salto se documenta.
Hitos citados en la literatura y en las comparativas de vendors. Son el marco contra el que se lee cualquier resultado nuevo, el nuestro incluido.
Ejecutamos RedArrow contra la suite de validación pública tipo XBOW, el estándar de facto para comparar agentes web ofensivos. Resultado completo, con el contexto que hace que un 100% signifique algo, y lo que no significa.
Cada reto se resolvió con cadena de explotación completa, no con detección de firma: petición y respuesta guardadas, flag capturado y paso reproducible. Las categorías cubren el núcleo del OWASP web y de API.
El 100% es un suelo, no un techo. Una suite estilo CTF está gamificada: no hay autenticación real de producción, ni tráfico de red activo, ni defensas en línea. Por eso lo cruzamos con targets realistas y benchmarks académicos, abajo.
Un solo benchmark no demuestra nada. Combinamos targets vulnerables que controlamos, benchmarks académicos que cita el mercado y plataformas online con scores reproducibles públicamente.
estándar de DAST / API
ground truth validado
API REST moderna de microservicios. OWASP API Security Top 10 completo: BOLA, BFLA, mass assignment, SSRF.
SPA Node/Express/Angular con 100+ challenges. La app vulnerable más citada en las comparativas de vendors.
PHP/MySQL con 3 niveles por vuln (Low/Medium/High). SQLi, XSS, CSRF, file upload, command injection, IDOR.
Java/Spring guiado por lecciones (WebGoat) y APIs Flask/Node puras (VAmPI) para aislar capacidad de API testing.
los que citan los papers
credibilidad técnica
40 tasks de 4 CTF reales (ICLR 2025 Oral). Web, cripto, reversing, forense.
CVEs reales contenerizados (ICML 2025 Spotlight). Separa "conocer el CVE" de "explotarlo a ciegas".
33 contenedores Docker, in-vitro y real-world. Métricas Success Rate + Progress Rate.
Infra enterprise real (HTB), CTF large-scale (NYU, NeurIPS 2024) y escenarios con WAF/IDS/IPS activos.
demos y validación externa
scores reproducibles
Labs por categoría (SQLi, XSS, SSRF, XXE, IDOR, OAuth, JWT, WebSockets). El curriculum de referencia de Burp.
Las cajas "Easy" son el floor de comparación de agentes IA en 2026. THM, más guiado, sirve de subtasks.
Framework open source para benchmarkear LLMs en HTB, PortSwigger, CyBench, picoCTF y la suite XBOW a la vez.
Mismo target, misma versión, mismas métricas. Un resultado solo cuenta si otro lo puede repetir.
Un número suelto no dice nada. Estas son las métricas que publican los papers y los benchmarks de vendors, y las que reportamos en cada engagement.
| Métrica | Qué mide | Referencia |
|---|---|---|
| Success Rate (SR) | % de flags capturados u objetivos comprometidos | AutoPenBench |
| Progress Rate (PR) | % de milestones intermedios alcanzados en la cadena | AutoPenBench |
| Subtask Completion | % de subtareas completadas en un pipeline multi-etapa | PentestEval |
| False Positive Rate | % de hallazgos no confirmados como reales | Doyensec / Escape |
| Time-to-Report | tiempo desde el inicio hasta la entrega de hallazgos | Doyensec |
| Cost-per-Run | coste en tokens/API por engagement completo | Excalibur 28,50 $ · RapidPen 0,30–0,60 $ |
| pass@k | probabilidad de éxito en k intentos independientes | BoxPwnr · CyBench |
Referencia de mercado, no ranking nuestro. Lo que importa de esta tabla es la columna de la derecha: quién publica validación independiente y quién se autoevalúa.
| Vendor | Categoría | Benchmark público | Validación independiente |
|---|---|---|---|
| Escape Cascade | API/Web · multi-agente | Doyensec, mar–abr 2026 | ✓ 96–97% precisión |
| Aikido | SAST + DAST + reachability | Doyensec, mar–abr 2026 | ✓ 96–97% precisión |
| XBOW | Web ofensivo autónomo | Self-reported + Doyensec | ⚠ setup >1 semana en algún test |
| Horizon3.ai NodeZero | Network / infra | Programa NSA CAPT | ⚠ self-reported |
| Pentera | Network continuo | SOC 2 auditado | ✓ enterprise |
| Penligent | Autónomo full-stack | Self-reported | ⚠ sin validación externa |
| Hadrian Nova | External attack surface | Self-reported | ⚠ |
Dato del benchmark Escape/Doyensec (abril 2026): Escape y Aikido montan en minutos y reportan en horas; XBOW requirió más de una semana, con crashes en un target. La velocidad operacional es parte del benchmark, no una nota al pie.
Es el dato más citado del sector, y el que separa un claim de marketing de uno defendible. Lo ponemos delante, no al final.
Mismo modelo (GPT-4), mismo benchmark (CVE-Bench, ICML 2025). Con el aviso de seguridad delante, explota casi todo. A ciegas, uno de cada ocho. Por eso en RedArrow el criterio de un analista senior entra antes de que un hallazgo salga como real, y por eso ningún hallazgo se reporta sin PoC reproducible.
Para que un claim de RedArrow se sostenga fuera de casa, cada resultado se publica con estos cinco elementos. Sin uno, no es un benchmark: es una captura.
Nombre y versión exacta del entorno (crAPI v1.0, Juice Shop v16.x).
SR, PR, False Positive Rate, Time-to-Report y Cost-per-Run.
Hallazgos re-severitizados por un revisor independiente.
Score frente al mismo target con el modelo base sin harness.
Docker compose o instrucciones públicas de setup.
Te enseñamos una ejecución real de RedArrow sobre un entorno tuyo, con las métricas de arriba y la revisión senior incluida.
Benchmarks, papers y comparativas de los que procede esta página.