19 ago
|
The BIG Jobsite
|
Marzán
19 ago
The BIG Jobsite
Marzán
Una compañía con equipos de IA avanzada incorpora un/a AI Runtime & Evaluation Engineer para el diseño, implementación y evaluación de arquitecturas de agentes de IA a escala productiva. Rol fundamental en la creación de sistemas robustos de evaluación y benchmarking de LLMs, gestión del runtime de agentes y observabilidad avanzada.
Asegúrese de que toda la información de su solicitud está actualizada y en orden antes de inscribirse en esta oportunidad.
Rol fundamental en el ciclo de vida de sistemas de agentes IA en producción real — no POCs, no research aislado.
Sobre el ro lSerás responsable de construir, optimizar y validar rigurosamente sistemas de agentes de IA. Diseñarás las arquitecturas, gestionarás su runtime end-to-end, y — muy importante — establecerás la metodología de evaluación que asegura calidad, rendimiento y reproducibilidad. Impacto tangible en la fiabilidad de soluciones IA a escala
.
? ? Lo que har ás
Arquitecturas de agent es:Diseñar sistemas de agentes: planning, tool calling, function calling, memory, context engineering, semantic routi ng.Distinguir y diseñar workflows vs agentes según caso de u so.Trabajar con MCP (Model Context Protocol) y, idealmente, A
2A.Orquestar sistemas multi-agen te.
Runtime de agen tes:Gestionar execution loop, state management, orchestration, retries, checkpoint ing.Implementar streaming, human-in-the-loop, gestión de conte xto.Observabilidad avanzada, tracing, tool execution, concurre ncy.
Evaluación (crít ico):Diseñar evals offline y on line.Construir benchmarks robustos + golden datasets + synthetic data sets.Aplicar LLM-as-a-judge, pairwise compar ison.Regression testing + experiment tracking + reproducibilidad (MLf low)
.
RAG:Chunking, embeddings, reranking, vector databases, retrieval quality, context wi ndows.
LLM Engin eering:Prompting, structured outputs,
JSON schema, function c alling.Optimización de tokenización, coste, latencia, c aching.Reasoning models + context window mana gement.
Backend + Observabilidad +
Testing:Python backend con FastAPI, Docker, Kub ernetes.OpenTelemetry + Grafana + Pro metheus.Unit testing, integration testing, eval testing, regression suites, CI/CD pa ra IA.
Impres cindiblesExperiencia sólida d iseñando arquitecturas de a gentes IA en producción (planning, tool/function calling, memory, context engineering, semantic routi ng, MCP).Experiencia prác tica con runtime d e agentes end-to-end (execution loop, state, retries, checkpointing, streaming, HITL, conc urrency).Experiencia cr ítica en evaluación d e modelos: offline + online evals, benchmark design, golden + synthetic datasets, LLM-as-a-judge, regression testing, experiment tracking.Dominio ava nzado de Python para backend robusto.Conocimiento ex per to de RAG (chunking, embeddings, reranking, vector DBs, retrieval quality).LLM En gineering avanzado (prompting, structured outputs, function calling, tokenización, coste, latencia, caching, reasoning models).Experie ncia c on MLflow para experiment tracking.Inglés av anzado
Muy valorableFrameworks de agentes: LangGraph, OpenAI A gents SDK.A2A (Agent-to-Agent
Protocol).Infraes tructura: FastAPI, Docker, Kubernetes, Redis, Kafka, P ostgreSQL.Observ abilidad: OpenTelemetry, Grafana, P rometheus.Testing: unit + integration + eval + regression suites + CI/C
D para IA. Cloud AI: Azure OpenAI, AWS Bedrock + AgentCore, GCP
Ver tex AI.
CondicionesModalidad: freelance v ía Shakers.Duración: 12 meses con alta probabilidad de extensión.Ubicación: 100% remoto de sde España.
En Shakers nos ocupamos de la gestión del proyecto, la facturación y el acompañamiento. xugodme Tú te centras en construir agentes IA fiables y evaluables a escala productiva.
📌 Ingeniero de software (Marzán)
🏢 The BIG Jobsite
📍 Marzán