15 ago
|
Shakers
|
La Coruña
Una compañía con equipos de IA avanzada incorpora un/a AI Runtime & Evaluation Engineer para el diseño, implementación y evaluación de arquitecturas de agentes de IA a escala productiva. Rol clave en la creación de sistemas robustos de evaluación y benchmarking de LLMs, gestión del runtime de agentes y observabilidad avanzada.
Rol fundamental en el ciclo de vida de sistemas de agentes IA en producción real — no POCs, no research aislado.
Sobre el ro
lSerás responsable de construir, optimizar y validar rigurosamente sistemas de agentes de IA. Diseñarás las arquitecturas, gestionarás su runtime end-to-end, y — muy importante — establecerás la metodología de evaluación que asegura calidad, rendimiento y reproducibilidad.
Impacto tangible en la fiabilidad de soluciones IA a escala
Envíe su solicitud a continuación después de leer todos los detalles y la información de apoyo sobre esta posibilidad de trabajo.
- Lo que har
ás
Arquitecturas de agent
es: Diseñar sistemas de agentes: planning, tool calling, function calling, memory, context engineering, semantic routi
ng. Distinguir y diseñar workflows vs agentes según caso de u
so. Trabajar con MCP (Model Context Protocol) y, idealmente, A
2A. Orquestar sistemas multi-agen
te.
Runtime de agen
tes: Gestionar execution loop, state management, orchestration, retries, checkpoint
ing. Implementar streaming, human-in-the-loop, gestión de conte
xto. Observabilidad avanzada, tracing, tool execution, concurre
ncy.
Evaluación (crít
ico):Diseñar evals offline y on
line. Construir benchmarks robustos + golden datasets + synthetic data
sets. Aplicar LLM-as-a-judge, pairwise compar
ison. Regression testing + experiment tracking + reproducibilidad (MLf
low)
- RAG:Chunking, embeddings, reranking, vector databases, retrieval quality, context wi
ndows.
LLM Engin
eering: Prompting, structured outputs,
JSON schema, function c
alling. Optimización de tokenización, coste, latencia, c
aching. Reasoning models + context window mana
gement.
Backend + Observabilidad +
Testing: Python backend con FastAPI, Docker, Kub
ernetes. Open Telemetry + Grafana + Pro
metheus. Unit testing, integration testing, eval testing, regression suites, CI/CD
para IA.
Impres
cindibles Experiencia sólida diseñando arquitecturas de agentes IA en producción (planning, tool/function calling, memory, context engineering, semantic routi
ng, MCP). Experiencia práctica con runtime de agentes end-to-end (execution loop, state, retries, checkpointing, streaming, HITL, conc
urrency). Experiencia crítica en evaluación de modelos: offline + online evals, benchmark design, golden + synthetic datasets, LLM-as-a-judge, regression testing, experiment
tracking. Dominio avanzado de Python para backend
robusto. Conocimiento experto de RAG (chunking, embeddings, reranking, vector DBs, retrieval
quality).LLM Engineering avanzado (prompting, structured outputs, function calling, tokenización, coste, latencia, caching, reasoning
models). Experiencia con MLflow para experiment
tracking. Inglés
avanzado
Muy
valorable Frameworks de agentes: Lang Graph, OpenAI A
gents SDK.A2A (Agent-to-Agent
Protocol). Infraestructura: FastAPI, Docker, Kubernetes, Redis, Kafka, P
ostgreSQL. Observabilidad: Open Telemetry, Grafana, P
rometheus. Testing: unit + integration + eval + regression suites + CI/C
D para IA. Cloud AI: Azure OpenAI, AWS Bedrock + Agent Core, GCP
Vertex AI.
Condiciones Modalidad: freelance v
ía Shakers. Duración: 12 meses con alta probabilidad de
extensión. Ubicación: 100% remoto de
sde España.
En Shakers nos ocupamos de la gestión del proyecto, la facturación y el acompañamiento. xiphteb Tú te centras en construir agentes IA fiables y evaluables a escala
productiva.
📌 Ingeniero de software (La Coruña)
🏢 Shakers
📍 La Coruña