02 sep
|
heydiga
|
Barcelona
Sobre HeyDiga En HeyDiga construimos agentes de IA conversacional que atienden el teléfono y el WhatsApp de negocios de servicios en España, Italia y Francia. Nuestro producto se llama SONIA y no lo vendemos como software: es una empleada virtual que coge las llamadas, gestiona las citas, resuelve dudas y no deja ninguna llamada sin responder. Trabajamos con peluquerías, centros de estética, talleres mecánicos, restaurantes y clínicas.
Cada día SONIA mantiene miles de conversaciones reales con clientes reales. Detrás de cada llamada hay un pipeline completo de machine learning: reconocimiento de voz (ASR), un LLM que razona y decide, y síntesis de voz (TTS). Esta posición existe porque queremos medir, entender y mejorar sistemáticamente cómo se comporta ese pipeline en producción.
El rol
Trabajarás dentro del equipo de ML en la evaluación de un sistema de voz conversacional en producción. No es un rol de escuchar llamadas al azar: es convertir el comportamiento real del agente en datos, métricas y mejoras medibles del modelo.
En concreto
- Análisis de errores del pipeline de voz.
Nuestros sistemas marcan automáticamente las llamadas con incidencias: conversaciones caídas, citas que no se registran, transferencias fallidas, respuestas fuera de contexto. Tu trabajo es diagnosticar en qué capa falló (ASR, razonamiento del LLM, gestión de herramientas, TTS) y documentarlo de forma que el error sea reproducible y accionable.
- Construcción de datasets de evaluación.
Anotarás y clasificarás conversaciones reales para crear conjuntos de evaluación (goldens) que usamos para medir regresiones cada vez que cambiamos un prompt, un modelo o una voz. La calidad de estos datasets determina la calidad de todo lo demás.
- Métricas de calidad conversacional.
Ayudarás a definir y calcular métricas:
tasa de éxito de tarea (¿se registró la cita?), WER en nombres propios y entidades críticas, latencia percibida, interrupciones, tasa de transferencia a humano. Trabajarás con nuestros dashboards y contribuirás a mejorarlos.
- Red-teaming lingüístico del agente.
Hablarás directamente con SONIA en tu idioma para encontrar los puntos de ruptura que un test automático no reproduce: acentos, ruido, prisa, cambios de tema, correcciones a media frase. Cada fallo que encuentres se convierte en un caso de test del pipeline de evaluación.
- Evaluación de pronunciación y léxico (TTS).
Nombres propios, marcas, servicios, direcciones, números, precios y horarios. Detectarás errores de pronunciación y ayudarás a mantener los diccionarios fonéticos y las reglas de normalización de texto que alimentan la síntesis de voz.
- LLM-as-judge y evaluación automática.
Colaborarás en el diseño y calibración de evaluadores automáticos basados en LLM que puntúan conversaciones a escala, contrastando sus juicios con tu anotación humana para medir su fiabilidad.
- Feedback loop con el equipo de ML.
Tus hallazgos van directos a quienes ajustan prompts, modelos y voces. Clasificarás lo detectado, lo priorizarás por impacto real y harás seguimiento hasta verificar que la corrección funciona en producción.
A quién buscamos
Requisitos
- Español nativo o nivel C1 real (el trabajo del día a día es en español)
- Al menos una segunda lengua a nivel nativo entre italiano, francés y portugués
- Comprensión básica de cómo funciona un sistema basado en LLMs (prompting, contexto, limitaciones) y curiosidad genuina por los sistemas de voz (ASR/TTS)
- Nociones de Python y capacidad de trabajar con datos (pandas, notebooks, SQL básico se valoran)
- Oído fino y capacidad de detectar matices: distinguir entre "está mal" y "está bien pero no suena natural"
- Rigor a la hora de anotar y documentar. Un error mal descrito no se puede corregir, y un dataset mal anotado contamina todas las métricas que salen de él
- Disponibilidad para trabajar de forma presencial en Barcelona
Abrimos entre 2 y 3 plazas. El objetivo es cubrir los cuatro idiomas (español, italiano, francés y portugués) a nivel nativo entre el conjunto del equipo, con al menos una persona de español nativo. Por eso son especialmente bienvenidos los perfiles con combinaciones como español + francés, italiano + portugués o portugués + francés. Si hablas otra combinación de esas cuatro lenguas, preséntate igualmente.
Se valora
- Experiencia (académica o personal) con evaluación de LLMs, anotación de datos o benchmarks
- Proyectos propios con APIs de LLMs, Whisper, herramientas de TTS o similares
- Estudios de lingüística, traducción o filología como complemento al perfil técnico
- Experiencia previa en atención telefónica o conocimiento del mundo de los servicios locales
Qué te llevas
- Experiencia real de ML en producción: no un proyecto de juguete, sino un sistema que atiende miles de llamadas al día
- Contacto directo con el stack completo de voice AI: ASR, LLMs, TTS, telefonía
- Mentoría del equipo técnico y visibilidad completa del ciclo: de la llamada real al ajuste del modelo y de vuelta a producción
📌 Voice AI Evaluation Trainee (Italiano o francés o portugués) (Barcelona)
🏢 heydiga
📍 Barcelona