13 sep
|
Shakers
|
Madrid
Una compañía con equipos de IA avanzada incorpora un/a AI Runtime & Evaluation Engineer para el diseño, implementación y evaluación de arquitecturas de agentes de IA a escala productiva.
Por favor, lea detenidamente la información de esta oferta de empleo para entender exactamente qué se espera de los posibles candidatos.
Rol clave en la creación de sistemas robustos de evaluación y benchmarking de LLMs, gestión del runtime de agentes y observabilidad avanzada.
Rol fundamental en el ciclo de vida de sistemas de agentes IA en producción real — no POCs, no research aislado.Sobre el ro lSerás responsable de construir, optimizar y validar rigurosamente sistemas de agentes de IA.
Diseñarás las arquitecturas, gestionarás su runtime end-to-end, y — muy relevante — establecerás la metodología de evaluación que asegura calidad, rendimiento y reproducibilidad.Impacto tangible en la fiabilidad de soluciones IA a escala.
?? Lo que har ás Arquitecturas de agent
* es: Diseñar sistemas de agentes: planning, tool calling, function calling, memory, context engineering, semantic routi
* ng.
Distinguir y diseñar workflows vs agentes según caso de u
* so.
Trabajar con MCP (Model Context Protocol) y, idealmente, A
* 2A.Orquestar sistemas multi-agen te.
Runtime de agen
* tes: Gestionar execution loop, state management, orchestration, retries, checkpoint
* ing.Implementar streaming, human-in-the-loop, gestión de conte
* xto.Observabilidad avanzada, tracing, tool execution, concurre ncy.
Evaluación (crít
* ico):Diseñar evals offline y on
* line.Construir benchmarks robustos + golden datasets + synthetic data
* sets.Aplicar LLM-as-a-judge, pairwise compar
* ison.Regression testing + experiment tracking + reproducibilidad (MLf low)
*.
RAG:Chunking, embeddings, reranking, vector databases, retrieval quality, context wi ndows.
LLM Engin
* eering: Prompting,
structured outputs, JSON schema, function c
* alling.Optimización de tokenización, coste, latencia, c
* aching.Reasoning models + context window mana gement.
Backend + Observabilidad +
* Testing: Python backend con FastAPI, Docker, Kub
* ernetes.OpenTelemetry + Grafana + Pro
* metheus.Unit testing, integration testing, eval testing, regression suites, CI/CD para IA.
Impres
* cindiblesExperiencia sólida diseñando arquitecturas de a gentes IA en producción (planning, tool/function calling, memory, context engineering, semantic routi
* ng, MCP).Experiencia práctica con runtime d e agentes end-to-end (execution loop, state, retries, checkpointing, streaming, HITL, conc
* urrency).Experiencia crítica en evaluación d e modelos: offline + online evals, benchmark design, golden + synthetic datasets, LLM-as-a-judge, regression testing, experiment
* tracking.Dominio avanzado de Python para backend
* robusto.Conocimiento exper to de RAG (chunking, embeddings, reranking, vector DBs, retrieval
* quality).LLM En gineering avanzado (prompting, structured outputs, function calling, tokenización, coste, latencia, caching, reasoning
* models).Experiencia c on MLflow para experiment
* tracking.Inglés avanzado Muy
* valorableFrameworks de agentes: LangGraph, OpenAI A
* gents SDK.A2A (Agent-to-Agent
* Protocol).Infraestructura: FastAPI, Docker, Kubernetes, Redis, Kafka, P
* ostgreSQL.Observabilidad: OpenTelemetry, Grafana, P
* rometheus.Testing: unit + integration + eval + regression suites + CI/C
* D para IA.Cloud AI: Azure OpenAI, AWS Bedrock + AgentCore, GCP Vertex AI.
* CondicionesModalidad: freelance v
* ía Shakers.Duración: 12 meses con alta probabilidad de
* extensión.Ubicación: 100% remoto de sde España.
En Shakers nos ocupamos de la gestión del proyecto, la facturación y el acompañamiento. xqziphu
Tú te centras en construir agentes IA fiables y evaluables a escala productiva.
📌 Ingeniero De Software (Madrid)
🏢 Shakers
📍 Madrid