Serviços
Academy Sobre Nós
HAS Academy

Yaga Benchmark

No pentest com IA, o mesmo modelo rende muito mais
com o harness da Yaga do que sozinho.

Resultados da Yaga

Usando o harness da Yaga combinado com diversos modelos, os resultados são muito superiores aos de qualquer modelo isolado.

Resultados da Yaga Gráfico de linhas comparando o percentual de cenários resolvidos pela Yaga (modelos combinados) e por GPT 6, Opus 5, Grok 4.7 e Sonnet 5 sozinhos, nos modos black box, gray box e white box. A Yaga fica bem acima de todos os modelos isolados em todos os modos. 0 20 40 60 80 100 Black box Gray box White box 97.0 98.1 98.8 Yaga Opus 5 GPT 6 Grok 4.7 Sonnet 5
Opus 5 GPT 6 Grok 4.7 Sonnet 5 Yaga · 4 modelos combinados

Percentual do conjunto fixo de cenários resolvido por modo de teste. Passe o mouse sobre os pontos para ver o valor exato.

Yaga vs. cada modelo isolado

Com a Yaga, seu pentest fica muito superior ao de qualquer modelo rodando isoladamente.

Modelo Black box Gray box White box
Yaga · 4 modelos combinados 97.0% 98.1% 98.8%
Opus 5 38.0% 46.6% 58.0%
GPT 6 37.5% 46.0% 57.5%
Grok 4.7 37.0% 44.5% 52.2%
Sonnet 5 27.0% 32.2% 44.0%

Benchmark interno da HackerSec sobre um conjunto fixo de cenários, medindo vulnerabilidades confirmadas e exploráveis. Cada modelo é avaliado sozinho, sem o harness da Yaga; a linha combinada é a Yaga de produção, com os quatro modelos em uma execução orquestrada.

Yaga v2.8 · Última atualização · 1 de outubro de 2026

A Yaga melhora a cada versão

Cada modalidade do YagaBench ao longo das versões da Yaga.

90 92,5 95 97,5 100 White box Gray box Black box v2.0 v2.5 v2.7 v2.8

Escala de 90 a 100 para tornar a diferença visível. Cada ponto é uma execução completa do benchmark.

Como medimos

A régua é a mesma para todos

Cada modelo executa o mesmo conjunto de cenários, nas mesmas condições. A régua é idêntica para todos, e a diferença nos resultados reflete apenas o método aplicado por cada modelo.

Validado por especialista humano

No YagaBench, uma vulnerabilidade é contabilizada apenas quando foi realmente explorada e confirmada por um especialista da HackerSec. Somente o que foi comprovado entra na conta.

O modelo responde. A Yaga opera.

Sozinho, um modelo apenas responde. Dentro do harness da Yaga, ele reconhece o alvo, explora falhas reais e comprova o impacto, como um pentester faria. Orquestrada, a mesma IA rende muito mais.

Medido com os limites ligados

A Yaga executou o benchmark com os mesmos guardrails que valem em ambiente de cliente. Os números acima vêm da operação real, não de um modo mais solto criado para o teste.

Cenários alinhados a OWASP PTES MITRE CWE NIST

Veja a Yaga operando no seu alvo

Coloque o mesmo harness para trabalhar no seu escopo, com supervisão humana da HackerSec.