Services
À propos
Se connecter

Yaga Benchmark

En Pentest par IA, un même modèle rend bien davantage
avec le harness de Yaga que seul.

Résultats de Yaga

En combinant le harness de Yaga avec plusieurs modèles, les résultats sont bien supérieurs à ceux de tout modèle isolé.

Résultats de Yaga Graphique en courbes comparant le pourcentage de scénarios résolus par Yaga (modèles combinés) et par GPT-5.6, Opus 5, Grok 4.6 et Sonnet 5 seuls, dans les modes black box, gray box et white box. Yaga se situe bien au-dessus de tous les modèles isolés dans tous les modes. 0 20 40 60 80 100 Black box Gray box White box 96.2 97.0 98.8 Yaga Opus 5 GPT-5.6 Grok 4.6 Sonnet 5
Opus 5 GPT-5.6 Grok 4.6 Sonnet 5 Yaga · 4 modèles combinés

Pourcentage de l'ensemble fixe de scénarios résolu par mode de test. Passez la souris sur les points pour voir la valeur exacte.

Yaga vs. chaque modèle isolé

Avec Yaga, votre Pentest devient bien supérieur à celui de tout modèle fonctionnant isolément.

Modèle Black box Gray box White box
Yaga · 4 modèles combinés 96.2% 97.0% 98.8%
Opus 5 40.0% 48.9% 61.0%
GPT-5.6 39.5% 48.5% 60.9%
Grok 4.6 39.0% 47.5% 58.7%
Sonnet 5 27.4% 36.5% 49.6%

Benchmark interne de HackerSec sur un ensemble fixe de scénarios, mesurant les vulnérabilités confirmées et exploitables. Chaque modèle est évalué seul, sans le harness de Yaga ; la ligne combinée correspond à la Yaga de production, avec les quatre modèles dans une exécution orchestrée.

Yaga v2.7 · Dernière mise à jour · 18 août 2026

Comment nous mesurons

La règle est la même pour tous

Chaque modèle exécute le même ensemble de scénarios, dans les mêmes conditions. La règle est identique pour tous, et l'écart de résultats reflète uniquement la méthode appliquée par chaque modèle.

Validé par un expert humain

Dans YagaBench, une vulnérabilité n'est comptabilisée que lorsqu'elle a réellement été exploitée et confirmée par un expert de HackerSec. Seul ce qui a été prouvé entre dans le décompte.

Le modèle répond. Yaga opère.

Seul, un modèle se contente de répondre. Au sein du harness de Yaga, il reconnaît la cible, exploite des failles réelles et démontre l'impact, comme le ferait un pentester. Orchestrée, la même IA rend bien davantage.

Mesuré avec les limites activées

Yaga a exécuté le benchmark avec les mêmes guardrails que ceux appliqués dans l'environnement client. Les chiffres ci-dessus proviennent de l'opération réelle, et non d'un mode plus permissif créé pour le test.

Scénarios alignés sur OWASP PTES MITRE CWE NIST

Voyez Yaga opérer sur votre cible

Mettez ce même harness au travail sur votre périmètre, avec la supervision humaine de HackerSec.