- Build and maintain agent skills and the infrastructure to validate, evaluate, publish, and maintain them
- Design evaluation datasets and workflows that compare agent behavior against a baseline
- Build agent metrics and observability including success/failure outcomes and latency
- Design safety and quality gates for agent-authored content
- Create CLIs, libraries, and MCP integrations for local and CI environments
- Integrate tooling into GitHub Actions and other CI workflows
- Build code-generation quality checks and linting for AI-generated code
- Investigate and remediate failures such as nondeterministic results and unsafe generated guidance