Una compañía con equipos de IA avanzada incorpora un/a AI Runtime & Evaluation Engineer para el diseño, implementación y evaluación de arquitecturas de agentes de IA a escala productiva. Rol clave en la creación de sistemas robustos de evaluación y benchmarking de LLMs, gestión del runtime de agentes y observabilidad avanzada.Solicitar este puesto es simple. Desplácese hacia abajo y haga clic en "Solicitar" para ser considerado para esta posición.Rol fundamental en el ciclo de vida de sistemas de agentes IA en producción real — no POCs, no research aislado.
Sobre el rolSerás responsable de construir, optimizar y validar rigurosamente sistemas de agentes de IA. Diseñarás las arquitecturas, gestionarás su runtime end-to-end, y — muy importante — establecerás la metodología de evaluación que asegura calidad, rendimiento y reproducibilidad. Impacto tangible en la fiabilidad de soluciones IA a escala
.?? Lo que har
ásArquitecturas de agent~ es: Diseñar sistemas de agentes: planning, tool calling, function calling, memory, context engineering, semantic routi~ ng. Distinguir y diseñar workflows vs agentes según caso de u~ so. Trabajar con MCP (Model Context Protocol) y, idealmente, A~2A.Orquestar sistemas multi-agen
te.Runtime de agentes: Gestionar execution loop, state management, orchestration, retries, checkpointing. Implementar streaming, human-in-the-loop, gestión de contexto. Observabilidad avanzada, tracing, tool execution, concurre
ncy.Evaluación (crítico):Diseñar evals offline y online. Construir benchmarks robustos + golden datasets + synthetic datasets. Aplicar LLM-as-a-judge, pairwise comparison. Regression testing + experiment tracking + reproducibilidad (MLf
low)~ . RAG:Chunking, embeddings, reranking, vector databases, retrieval quality, context wi
ndows.LLM Engineering: Prompting, structured outputs,
JSON schema, function calling. Optimización de tokenización, coste, latencia, caching. Reasoning models + context window mana
gement.Backend + Observabilidad +Testing: Python backend con FastAPI, Docker, Kubernetes. OpenTelemetry + Grafana + Prometheus. Unit testing, integration testing, eval testing, regression suites, CI/CD
pa ra IA.ImprescindiblesExperiencia sólida d iseñando arquitecturas de a gentes IA en producción (planning, tool/function calling, memory, context engineering, semantic routing, MCP).Experiencia prác tica con runtime d e agentes end-to-end (execution loop, state, retries, checkpointing, streaming, HITL, concurrency).Experiencia cr ítica en evaluación d e modelos: offline + online evals, benchmark design, golden + synthetic datasets, LLM-as-a-judge, regression testing, experimenttracking. Dominio ava nzado de Python para backendrobusto. Conocimiento ex per to de RAG (chunking, embeddings, reranking, vector DBs, retrievalquality).LLM En gineering avanzado (prompting, structured outputs, function calling, tokenización, coste, latencia, caching, reasoningmodels).Experie ncia c on MLflow para experimenttracking. Inglés
av anzadoMuyvalorableFrameworks de agentes: LangGraph, OpenAI Agents SDK.A2A (Agent-to-AgentProtocol).Infraes tructura: FastAPI, Docker, Kubernetes, Redis, Kafka, PostgreSQL.Observ abilidad: OpenTelemetry, Grafana, Prometheus. Testing: unit + integration + eval + regression suites + CI/CD para IA. Cloud AI: Azure OpenAI, AWS Bedrock + AgentCore, GCP
Ver tex AI.
CondicionesModalidad: freelance vía Shakers. Duración: 12 meses con alta probabilidad deextensión. Ubicación: 100% remoto de
sde España.En Shakers nos ocupamos de la gestión del proyecto, la facturación y el acompañamiento. xkdbapo Tú te centras en construir agentes IA fiables y evaluables a escala
productiva.
📌 Ingeniero/a de Software Senior (Arbo)
🏢 Shakers
📍 Arbo