Mindrift in Barcelona is assembling a dataset to evaluate AI coding agents by creating realistic developer environments, including a codebase, infrastructure, and contextual artifacts. You will craft tasks from evolving environments, define success criteria, and write tests that accept diverse correct solutions.
The role focuses on evaluation of agent solutions, with iteration based on QA feedback. English proficiency (B2+) is required.