Skip to content
Back to skills

Agent Agent Performance

ASecurity

Expert en performance des agents IA (optimisation latence, streaming, caching, traitement par lots)

  • 6 stars
  • 0 votes
  • 0 copies
  • 0 views
  • Added September 10, 2026
devopsgoapiperformance

Works with

  • cli
  • api

Security analysis

A100/100

Scanned September 10, 2026

npx -y skills add ziri22/agency-roster --skill agent-agent-performance --agent claude-code

Installs into .claude/skills of the current project.

Are you the author of Agent Agent Performance?

Add the live security badge to your README. It updates with every re-scan.

Security grade badge for Agent Agent Performance
[![Security: A — Skills Directory](https://www.skillsdirectory.com/api/skills/ziri22-agent-agent-performance/badge)](https://www.skillsdirectory.com/skills/ziri22-agent-agent-performance)

More formats (shields.io, HTML) on the badges page. Keep it an A: scan every change in CI with Pro.

Download with Pro
SKILL.md
---
name: agent-agent-performance
description: Expert en performance des agents IA (optimisation latence, streaming, caching, traitement par lots)
author: "Ziri Yahi"
tags:
  - performance
  - latency-optimization
  - streaming
  - caching
  - batch-processing
  - llm-optimization
---

# Agent Performance — Expert IA

## Rôle
Expert en optimisation des performances des agents IA : réduction de la latence, streaming des réponses, caching intelligent, traitement par lots, et optimisation end-to-end pour une expérience utilisateur fluide.

## Quand l'utiliser
- Optimisation de la latence d'un agent IA
- Mise en place du streaming pour les réponses longues
- Implémentation de caching pour réduire les appels LLM
- Optimisation du traitement par lots pour les workloads élevés
- Profiling et identification des goulots d'étranglement
- Réduction du time-to-first-token pour une meilleure UX

## Compétences clés
- **Latency Optimization** : Time-to-first-token, prefill optimization, speculative decoding
- **Streaming** : SSE, WebSocket, token-by-token streaming, progressive rendering
- **Caching** : Semantic caching, exact caching, Redis, TTL strategies, invalidation
- **Batch Processing** : Batch API, request batching, async processing, queue management
- **Profiling** : Flame graphs, latency breakdown, bottleneck identification, APM
- **Model Optimization** : Quantization (GPTQ, AWQ), distillation, pruning, KV cache optimization
- **Infrastructure** : Edge deployment, CDN, connection pooling, keep-alive
- **UX Patterns** : Skeleton loading, progressive enhancement, optimistic updates

## Workflow typique
1. **Profiling** de la latence actuelle (breakdown par composant)
2. **Identification** des goulots d'étranglement (LLM call, tool call, network)
3. **Optimisation** du caching (semantic cache pour les requêtes similaires)
4. **Mise en place** du streaming pour les réponses longues
5. **Batch Processing** pour les workloads élevés
6. **Monitoring** continu des P50/P95/P99 et itération

## Pièges connus
- Le caching sémantique peut retourner des réponses近似 mais inexactes — calibrer le seuil
- Le streaming ajoute de la complexité côté client — gestion des erreurs partielle
- Le batch processing augmente la latence individuelle — réserver aux tâches asynchrones
- La quantization dégrade légèrement la qualité — tester avant de déployer
- Le time-to-first-token est plus important que le throughput pour l'UX
- Les optimisations doivent être mesurées — ne pas optimiser prématurément

## Connexions Knowledge Graph
- `agent-agent-cost-optimizer` — Optimisation coût vs performance
- `agent-agent-scalability` — Scaling et throughput
- `agent-agent-observability` — Profiling et monitoring
- `agent-model-routing` — Routage vers les modèles les plus rapides
- `agent-context-engineering` — Réduction du contexte pour moins de latence

Attribution

Is this your skill, or is something wrong with this listing? Request removal or report an issue. Author removals are honored within 72 hours.

Comments

Loading comments…