La oportunidad
Convierte «parece que funciona» en evidencia.
Buscamos un perfil de AI Evals & Reliability Engineer para diseñar la capa de pruebas de agentes y aplicaciones generativas. Queremos medir comportamiento, calidad, seguridad, coste y latencia con casos representativos antes de confiar en una demo o en una impresión subjetiva.
- Área
- Calidad y fiabilidad
- Experiencia
- 3+ años
- Modalidad
- Remoto
- Colaboración
- Por proyecto o recurrente
¿Qué buscamos?
- Experiencia creando datasets de prueba, criterios de aceptación y suites de regresión.
- Conocimiento de evaluación determinista, similitud, clasificación, graders basados en modelos y revisión humana.
- Capacidad para analizar trazas, tool calls, recuperaciones y resultados finales.
- Experiencia con Python, análisis de datos y automatización de pruebas.
- Criterio para distinguir métricas útiles de puntuaciones que no reflejan el proceso real.
- Capacidad para comunicar fallos y trade-offs de manera comprensible.
¿Qué harás?
- Convertir requisitos de negocio y riesgos en casos de prueba.
- Construir bancos de ejemplos correctos, incorrectos, ambiguos y adversarials.
- Diseñar evals de respuesta, retrieval, tool uso, handoffs y cumplimiento de límites.
- Analizar regresiones cuando cambian el modelo, el prompt, las fuentes o las herramientas.
- Medir coste, latencia, tasa de escalado, falsos positivos y esfuerzo de revisión humana.
- Preparar dashboards e informes para decidir si un piloto avanza, se corrige o se para.
- Coordinar pruebas con especialistas de dominio y responsables del proceso.
Nos impresionará especialmente
- Una suite que haya descubierto un error importante antes de producción.
- Experiencia con red teaming, observabilidad de LLM, evaluación de RAG o pruebas de agentes con herramientas.
- Saber cuándo una métrica automática necesita una muestra humana bien diseñada.
¿Qué encontrarás?
La evaluación no será una fase final: participará desde el blueprint y acompañará cada cambio relevante. Tendrás autoridad para demostrar que una mejora aparente no supera el conjunto de pruebas.
Cómo presentarte
Adjunta tu CV y, si quieres, un único enlace a un GitHub, un framework de evaluación, un test plan o un dashboard anonimizado.




