KarminaAI StudioAgentes · Servicios · Formación

JOBS · Colaboración por proyecto

AI Evals & Reliability Engineer

Diseña pruebas para entender cuándo un agente es fiable, cuando falla y cómo tiene que mejorar.

La oportunidad

Convierte «parece que funciona» en evidencia.

Buscamos un perfil de AI Evals & Reliability Engineer para diseñar la capa de pruebas de agentes y aplicaciones generativas. Queremos medir comportamiento, calidad, seguridad, coste y latencia con casos representativos antes de confiar en una demo o en una impresión subjetiva.

Área
Calidad y fiabilidad
Experiencia
3+ años
Modalidad
Remoto
Colaboración
Por proyecto o recurrente

¿Qué buscamos?

  • Experiencia creando datasets de prueba, criterios de aceptación y suites de regresión.
  • Conocimiento de evaluación determinista, similitud, clasificación, graders basados en modelos y revisión humana.
  • Capacidad para analizar trazas, tool calls, recuperaciones y resultados finales.
  • Experiencia con Python, análisis de datos y automatización de pruebas.
  • Criterio para distinguir métricas útiles de puntuaciones que no reflejan el proceso real.
  • Capacidad para comunicar fallos y trade-offs de manera comprensible.

¿Qué harás?

  • Convertir requisitos de negocio y riesgos en casos de prueba.
  • Construir bancos de ejemplos correctos, incorrectos, ambiguos y adversarials.
  • Diseñar evals de respuesta, retrieval, tool uso, handoffs y cumplimiento de límites.
  • Analizar regresiones cuando cambian el modelo, el prompt, las fuentes o las herramientas.
  • Medir coste, latencia, tasa de escalado, falsos positivos y esfuerzo de revisión humana.
  • Preparar dashboards e informes para decidir si un piloto avanza, se corrige o se para.
  • Coordinar pruebas con especialistas de dominio y responsables del proceso.

Nos impresionará especialmente

  • Una suite que haya descubierto un error importante antes de producción.
  • Experiencia con red teaming, observabilidad de LLM, evaluación de RAG o pruebas de agentes con herramientas.
  • Saber cuándo una métrica automática necesita una muestra humana bien diseñada.

¿Qué encontrarás?

La evaluación no será una fase final: participará desde el blueprint y acompañará cada cambio relevante. Tendrás autoridad para demostrar que una mejora aparente no supera el conjunto de pruebas.

Cómo presentarte

Adjunta tu CV y, si quieres, un único enlace a un GitHub, un framework de evaluación, un test plan o un dashboard anonimizado.

Talento

AI Evals & Reliability Engineer

Esta es la vía para presentar una candidatura o proponer una colaboración profesional. Todos los campos son opcionales. Las consultas de proyectos y servicios se gestionan a hello@karmina.ai.

jobs@agenciakarmina.com