Ingeniero De Software Shakers paradela, galicia, Spain
Descripción del trabajo
Una compañía con equipos de IA avanzada incorpora un/a AI Runtime & Evaluation Engineer para el diseño, implementación y evaluación de arquitecturas de agentes de IA a escala productiva. Aúnquiera la experiencia competente y las cualificaciones son clave para este puesto, asegúrese de comprobar si posee las habilidades interpersonales preferibles antes de solicitar, si se requieren. Rol clave en la creación de sistemas robustos de evaluación y benchmarking de LLMs, gestión del runtime de agentes y observabilidad avanzada. Rol fundamental en el ciclo de vida de sistemas de agentes IA en producción real - no POCs, - no research aislado.
Sobre el rol
Serás responsable de construir, optimizar y validar rigurosamente sistemas de agentes de IA. Diseñarás las arquitecturas, gestionarás su runtime end-to-end, y - muy importante - establecerás la metodología de evaluación que asegura calidad, rendimiento y reproducibilidad. Impacto tangible en la fiabilidad de soluciones IA a escala.
Lo que harás
- Arquitecturas de agentes: Diseñar sistemas de agentes: planning, tool calling, function calling, memory, context engineering, semantic routing. Distinguir y diseñar workflows vs agentes según caso de uso. Trabajar con MCP (Model Context Protocol) y, idealmente, A2A.
- Orquestar sistemas multi-agente. Runtime de agentes: Gestionar execution loop, state management, orchestration, retries, checkpointing. Implementar streaming, human-in-the-loop, gestión de contexto.
- Observabilidad avanzada, tracing, tool execution, concurrency.
- Evaluación (crítico): Diseñar evals offline y online. Construir benchmarks robustos + golden datasets + synthetic LLM-as-a-judge, pairwise comparison. Regression testing + experiment tracking + reproducibilidad (MLflow).
- RAG: Chunking, embeddings, reranking, vector databases, retrieval quality,
context windows.
- LLM Engineering: Prompting, structured outputs, JSON schema, function calling. Optimización de tokenización, coste, latencia, caching. Reasoning models + context window management.
- Backend + Observabilidad + Testing: Python backend con FastAPI, Docker, Kubernetes. OpenTelemetry + Grafana + Prometheus. Unit testing, integration testing, eval testing, regression suites, CI/CDpara IA.
Imprescindibles
- Experiencia sólida diseñando arquitecturas de agentes IA en producción (planning, tool/function calling, memory, context engineering, semantic routing, MCP).
- Experiencia práctica con runtime de agentes end-to-end (execution loop, state, retries, checkpointing, streaming, HITL, concurrency).
- Experiencia crítica en evaluación de modelos: offline + online evals, benchmark design, golden + synthetic datasets, LLM-as-a-judge, regression testing, experimenttracking.
- Dominio avanzado de Python para backendrobusto.
- Conocimiento experto de RAG (chunking, embeddings, reranking, vector DBs, retrievalquality).
- LLM Engineering avanzado (prompting, structured outputs, function calling, tokenización, coste, latencia, caching, reasoningmodels).
- Experiencia con MLflow para experimenttracking.
- Inglésavanzado.
- Muy valorable: Frameworks de agentes: LangGraph, OpenAI Agents SDK. A2A (Agent-to-Agent Protocol).
- Infraestructura: FastAPI, Docker, Kubernetes, Redis, Kafka, PostgreSQL.
- Observabilidad: OpenTelemetry, Grafana, Prometheus.
- Testing: unit + integration + eval + regression suites + CI/CD para IA.
- Cloud AI: Azure OpenAI, AWS Bedrock + AgentCore, GCP Vertex AI.
Condiciones
- Modalidad: freelance vía Shakers.
- Duración: 12 meses con alta probabilidad de extensión.
- Ubicación: 100% remoto desde España.
En Shakers nos ocupamos de la gestión del proyecto, la facturación y el acompañamiento. Tú te centras en construir agentes IA fiables y evaluables a escala productiva.
#J-18808-Ljbffr
📌 Ingeniero De Software (Meis)
🏢 Shakers
📍 Meis