24 ago
|
Shakers
|
España
Una compañía con equipos de IA avanzada incorpora un/a AI Runtime & Evaluation Engineer para el diseño, implementación y evaluación de arquitecturas de agentes de IA a escala productiva. Rol clave en la creación de sistemas robustos de evaluación y benchmarking de LLMs, gestión del runtime de agentes y observabilidad avanzada.
Rol fundamental en el ciclo de vida de sistemas de agentes IA en producción real — no POCs, no research aislado.
? Sobre el ro lSerás responsable de construir, optimizar y validar rigurosamente sistemas de agentes de IA. Diseñarás las arquitecturas, gestionarás su runtime end-to-end, y — muy significativo — establecerás la metodología de evaluación que asegura calidad, rendimiento y reproducibilidad. Impacto tangible en la fiabilidad de soluciones IA a escala
.
? ? Lo que har
**ás
Arquitecturas de agent**
- es:Diseñar sistemas de agentes: planning, tool calling, function calling, memory, context engineering, semantic routi
- ng.Distinguir y diseñar workflows vs agentes según caso de u
- so.Trabajar con MCP (Model Context Protocol) y, idealmente, A
- 2A.Orquestar sistemas multi-agen
**te.
Runtime de agen**
- tes:Gestionar execution loop, state management, orchestration, retries, checkpoint
- ing.Implementar streaming, human-in-the-loop, gestión de conte
- xto.Observabilidad avanzada, tracing, tool execution, concurre
**ncy.
Evaluación (crít**
- ico):Diseñar evals offline y on
- line.Construir benchmarks robustos + golden datasets + synthetic data
- sets.Aplicar LLM-as-a-judge, pairwise compar
- ison.Regression testing + experiment tracking + reproducibilidad (MLf
low)
- . RAG:Chunking, embeddings, reranking, vector databases, retrieval quality, context wi
**ndows.
LLM Engin**
- eering:Prompting, structured outputs, JSON schema, function c
- alling.Optimización de tokenización,
coste, latencia, c
- aching.Reasoning models + context window mana
**gement.
Backend + Observabilidad +**
- Testing:Python backend con FastAPI, Docker, Kub
- ernetes.OpenTelemetry + Grafana + Pro
- metheus.Unit testing, integration testing, eval testing, regression suites, CI/CD
pa **ra IA. ✅ Impres**
- cindiblesExperiencia sólida d iseñando arquitecturas de a gentes IA en producción (planning, tool/function calling, memory, context engineering, semantic routi
- ng, MCP).Experiencia prác tica con runtime d e agentes end-to-end (execution loop, state, retries, checkpointing, streaming, HITL, conc
- urrency).Experiencia cr ítica en evaluación d e modelos: offline + online evals, benchmark design, golden + synthetic datasets, LLM-as-a-judge, regression testing, experiment
- tracking.Dominio ava nzado de Python para backend
- robusto.Conocimiento ex per to de RAG (chunking, embeddings, reranking, vector DBs, retrieval
- quality).LLM En gineering avanzado (prompting, structured outputs, function calling, tokenización, coste, latencia, caching, reasoning
- models).Experie ncia c on MLflow para experiment
- tracking.Inglés
av **anzado ? Muy**
- valorableFrameworks de agentes: LangGraph, OpenAI A
- gents SDK.A2A (Agent-to-Agent
- Protocol).Infraes tructura: FastAPI, Docker, Kubernetes, Redis, Kafka, P
- ostgreSQL.Observ abilidad: OpenTelemetry, Grafana, P
- rometheus.Testing: unit + integration + eval + regression suites + CI/C
- D para IA. Cloud AI: Azure OpenAI, AWS Bedrock + AgentCore, GCP
Ver **tex AI. ?**
- CondicionesModalidad: freelance v
- ía Shakers.Duración: 12 meses con alta probabilidad de
- extensión.Ubicación: 100% remoto de
sde España. En Shakers nos ocupamos de la gestión del proyecto, la facturación y el acompañamiento. Tú te centras en construir agentes IA fiables y evaluables a escala productiva.
📌 Ingeniero de software (España)
🏢 Shakers
📍 España