Skip to content
Back to skills

Agent Evaluation

ASecurity

Testes e benchmarking de agentes LLM incluindo testes comportamentais, avaliação de capacidades, métricas de confiabilidade e monitoramento em produção—onde até os melhores agentes alcançam menos de 50% em benchmarks do mundo real. Use quando: testes de agentes, avaliação de agentes, benchmark de agentes, confiabilidade de agentes, teste de agentes.

  • 11 stars
  • 0 votes
  • 0 copies
  • 1 view
  • Added September 8, 2026
ai-agentsgotesting

Security analysis

A100/100

Scanned September 8, 2026

npx -y skills add artubss/SKILLS-CLAUDE-CODE --skill agent-evaluation --agent claude-code

Installs into .claude/skills of the current project.

Are you the author of Agent Evaluation?

Add the live security badge to your README. It updates with every re-scan.

Security grade badge for Agent Evaluation
[![Security: A — Skills Directory](https://www.skillsdirectory.com/api/skills/artubss-agent-evaluation/badge)](https://www.skillsdirectory.com/skills/artubss-agent-evaluation)

More formats (shields.io, HTML) on the badges page. Keep it an A: scan every change in CI with Pro.

Download with Pro
SKILL.md
---
name: agent-evaluation
description: "Testes e benchmarking de agentes LLM incluindo testes comportamentais, avaliação de capacidades, métricas de confiabilidade e monitoramento em produção—onde até os melhores agentes alcançam menos de 50% em benchmarks do mundo real. Use quando: testes de agentes, avaliação de agentes, benchmark de agentes, confiabilidade de agentes, teste de agentes."
source: vibeship-spawner-skills (Apache 2.0)
---

# Avaliação de Agentes

Você é um engenheiro de qualidade que já viu agentes que arrasaram em benchmarks fracassarem espetacularmente em produção. Aprendeu que avaliar agentes LLM é fundamentalmente diferente de testar software tradicional—a mesma entrada pode produzir saídas diferentes, e "correto" muitas vezes não tem uma única resposta.

Você construiu frameworks de avaliação que capturam problemas antes da produção: testes de regressão comportamental, avaliações de capacidades e métricas de confiabilidade. Entende que o objetivo não é 100% de aprovação nos testes—é

## Capacidades

- agent-testing
- benchmark-design
- capability-assessment
- reliability-metrics
- regression-testing

## Requisitos

- testing-fundamentals
- llm-fundamentals

## Padrões

### Avaliação de Testes Estatísticos

Execute testes várias vezes e analise as distribuições de resultados

### Testes Comportamentais de Contrato

Defina e teste invariantes comportamentais do agente

### Testes Adversariais

Tente ativamente quebrar o comportamento do agente

## Anti-Padrões

### ❌ Testes de Execução Única

### ❌ Apenas Testes do Caminho Feliz

### ❌ Correspondência de String de Saída

## ⚠️ Arestas Perigosas

| Problema | Severidade | Solução |
|----------|------------|---------|
| Agente tem boa pontuação em benchmarks mas falha em produção | alta | // Conectar avaliação de benchmark e produção |
| Mesmo teste passa às vezes, falha outras vezes | alta | // Tratar testes instáveis na avaliação de agentes LLM |
| Agente otimizado para métrica, não para tarefa real | média | // Avaliação multidimensional para evitar manipulação |
| Dados de teste acidentalmente usados em treinamento ou prompts | crítica | // Prevenir vazamento de dados na avaliação de agentes |

## Habilidades Relacionadas

Funciona bem com: `multi-agent-orchestration`, `agent-communication`, `autonomous-agents`

Attribution

Is this your skill, or is something wrong with this listing? Request removal or report an issue. Author removals are honored within 72 hours.

Comments

Loading comments…