Defense lattice
O Defense lattice cruza classes de defesa com mutações de ataque para mostrar se um controle depende da redação. Os exemplos numéricos desta página pertencem a um registro histórico e versionado de pesquisa; eles não medem o motor atual nem um tenant.
Pontos-chave
- O registro histórico 57f15b67 cruzou quatro alvos sintéticos de defesa com 17 originais congelados e 85 variantes geradas pelo Gemini, em cinco categorias OWASP LLM.
- Nesse registro histórico, defesas de recusa baseadas em palavras perderam eficácia sob paráfrase; os controles estruturais foram avaliados separadamente.
- O escopo atual do produto tem 32 testes de ataque nas dez categorias (17 do corpus-base congelado + 15 da expansão; commit 8752ede); a robustez a variações de redação do candidato atual permanece N/A sem uma avaliação pareada.
- O registro arquivado inclui um pequeno recorte literal/variante de LLM07; nenhuma taxa desse recorte é reaproveitada como resultado de tenant ou do motor atual.
01
Eixos do Defense lattice
- Classe de defesa (linhas): baseada em palavras / em nível de controle / estrutural.
- Mutação de ataque (colunas): L1 original / L1 parafraseada.
- Valor da célula: taxa de bloqueio (% de testes de ataque recusados).
- Fragilidade: paráfrases − literais (negativo = frágil).
02
Como ler o Defense lattice
- Uma linha plana entre as duas colunas = defesa robusta.
- Uma queda acentuada entre o original e a paráfrase = defesa frágil, dependente de palavras específicas.
- Resultados de tenant valem por sua própria evidência persistida e não são comparáveis ao registro 57f15b67 sem repetir deliberadamente o mesmo corpus, os mesmos alvos, a mesma configuração e o mesmo ambiente.