New evaluation

Launch an eval run

Pick a seeded dataset, a workflow-compatible prompt version, and a model configuration. The API runs the evaluation synchronously and returns completed metrics.

Back to runs

Loading evaluation options…