Evaluación y LLMOps

Arneses de evaluación, trazabilidad, observabilidad, guardarraíles y gestión de prompts.

Herramientas de esta categoría

Open Code Review

Revisión de código híbrida que prioriza las reglas determinísticas y coloca el LLM en segundo lugar — el único orden que supera una revisión de segur…

Equipos que necesitan una revisión de código de IA para aprobar una revisión de seguridad, no solo para impresionar en una demostración Leer más →

Guardrails AI

Valida la salida del modelo contra un esquema en lugar de confiar en la suerte — y vuelve a preguntar cuando la validación falla.

Salida estructurada que debe parsearse de manera fiable, y comprobaciones de información personal o políticas antes de que el contenido llegue a un usuario Leer más →

OpenLLMetry

Rastreos de LLM como trazas estándar de OpenTelemetry — por lo que llegan a la pila de observabilidad que ya pagas.

Organizaciones con una pila de OpenTelemetry existente que no desean un segundo silo de observabilidad Leer más →

Langfuse

Rastreo autohospedado, evaluaciones y gestión de prompts — la capa de observabilidad que la mayoría de los equipos olvidan construir.

Rastreo, versionado de prompts y evaluaciones de producción Leer más →

Ragas

Conjunto de métricas para RAG: fidelidad, precisión de contexto, recuerdo — los números que necesitas antes de una revisión previa a la publicación.

Pruebas de regresión de RAG y métricas previas a la publicación Leer más →

Helicone

Proxy integrado que registra cada solicitud y muestra el costo por usuario, por función y por día.

Atribución de costos rápida y registro de solicitudes Leer más →

Notas de esta categoría