Saltar a contenido

Latency Benchmarks (Baseline)

Este documento registra los tiempos de respuesta esperados para el orquestador bajo diferentes configuraciones. El objetivo es mantener estos números dentro del Budget de Latencia definido para una experiencia premium.

Latency Budget (Target)

Nodo P50 (Esperado) P95 (Crítico)
Analyze 1.2s 2.5s
Booking 1.5s 3.0s
FAQ 1.0s 2.0s
Flujo Completo 2.5s 5.0s

Benchmarks Actuales (Abril 2026)

Mediciones realizadas con scripts/stress_test.py --concurrency 10 --rounds 5

Mock Provider (Orchestration Overhead)

  • P50: 0.05s
  • P95: 0.12s
  • Descripción: Muestra la latencia base de LangGraph y Redis sin llamadas a LLMs. Extremedamente eficiente.

Groq (llama-3.3-70b-versatile)

  • P50: 0.8s - 1.2s
  • P95: 1.8s - 2.2s
  • Status: ✅ Óptimo para Analyze y razonamiento crítico.

OpenAI (gpt-4o-mini)

  • P50: 1.5s
  • P95: 2.8s
  • Status: ⚠️ Ligeramente lento para flujos de alta frecuencia, ideal como fallback.

Estrategias de Optimización

  1. Prompt Pruning: Reducción de tokens irrelevantes en el contexto para bajar el tiempo de pre-llenado (Prefill).
  2. K-Retrieval Optimization: Ajuste de recuperación en FAQ para minimizar la carga del prompt.
  3. Parallel Execution: Evaluación de ejecución paralela de nodos Analyze y Guardrails en futuras versiones.