Skip to content
Everruns Cloud is open in early access. Run agents without operating the platform.

Create a new eval.

POST
/v1/evals
curl --request POST \
--url https://app.everruns.com/api/v1/evals \
--header 'Content-Type: application/json' \
--data '{ "description": "Regression suite for the support agent", "model_override": "gpt-5.1", "name": "Support agent regression", "tags": [ "regression", "nightly" ], "target": { "agent_id": "example", "harness_id": "example", "harness_name": "example", "max_iterations": 1, "model_id": "example", "system_prompt": "example", "type": "session" } }'
Media typeapplication/json

Request to create a new eval

object
description

Human-readable description. Safe to render in user-facing messages.

string | null
Example
Regression suite for the support agent
model_override

Default model override applied to runs of this eval.

string | null
Example
gpt-5.1
name
required

Human-readable name. Safe to render in user-facing messages.

string
Example
Support agent regression
tags

Free-form tags attached to this resource.

Array<string> | null
Example
[
"regression",
"nightly"
]
target
One of:
One of:

Session creation parameters (mirrors CreateSessionRequest).

object
agent_id

Agent to work in this session.

string | null
harness_id

Harness for the session. If omitted, org default harness is used.

string | null
harness_name

Addressable harness name (alternative to harness_id).

string | null
max_iterations

Max LLM iterations per turn.

integer | null
model_id

LLM model override.

string | null
system_prompt

System prompt override (prepended to agent prompt).

string | null
type
required
string
Allowed values: session

Created

Media typeapplication/json

An eval: a named collection of test cases for an agent.

object
archived_at

When the eval was archived, if archived.

string | null format: date-time
case_count

Number of cases.

integer format: int64
created_at
required

When the eval was created.

string format: date-time
deleted_at

When the eval was deleted, if deleted.

string | null format: date-time
description

Optional description.

string | null
id
required

External identifier (eval_<32-hex>). Shown as “id” in API.

string
last_run
One of:

Last run summary (if any).

object
created_at
required

When the run was created.

string format: date-time
id
required

Eval run identifier.

string
status
required

Run lifecycle status.

string
Allowed values: pending running completed failed cancelled
summary
One of:

Aggregate metrics, if the run has completed.

object
avg_latency_ms
required

Mean case latency in milliseconds.

integer format: int64
avg_score
required

Mean score across cases, 0.0 to 1.0.

number format: double
avg_turns
required

Mean agent turns per case.

number format: double
errored
required

Number of cases that errored.

integer format: int32
failed
required

Number of cases that failed.

integer format: int32
pass_rate
required

Fraction of cases that passed, 0.0 to 1.0.

number format: double
passed
required

Number of cases that passed.

integer format: int32
total
required

Total number of cases in the run.

integer format: int32
total_input_tokens
required

Total input tokens across cases.

integer format: int64
total_output_tokens
required

Total output tokens across cases.

integer format: int64
model_override

Optional default model override for runs.

string | null
name
required

Display name.

string
status
required

Lifecycle status.

string
Allowed values: active archived deleted
tags

Organization tags.

Array<string>
target
One of:
One of:

Session creation parameters (mirrors CreateSessionRequest).

object
agent_id

Agent to work in this session.

string | null
harness_id

Harness for the session. If omitted, org default harness is used.

string | null
harness_name

Addressable harness name (alternative to harness_id).

string | null
max_iterations

Max LLM iterations per turn.

integer | null
model_id

LLM model override.

string | null
system_prompt

System prompt override (prepended to agent prompt).

string | null
type
required
string
Allowed values: session
updated_at
required

When the eval was last updated.

string format: date-time
Example
{
"archived_at": "2026-01-15T10:30:00Z",
"case_count": 12,
"created_at": "2026-01-15T10:30:00Z",
"deleted_at": "2026-01-15T10:30:00Z",
"description": "Regression suite for the support agent",
"id": "eval_01933b5a000070008000000000000001",
"last_run": {
"created_at": "2026-01-15T10:30:00Z",
"status": "pending",
"summary": {
"avg_latency_ms": 8450,
"avg_score": 0.85,
"avg_turns": 3.2,
"errored": 1,
"failed": 2,
"pass_rate": 0.75,
"passed": 9,
"total": 12,
"total_input_tokens": 14400,
"total_output_tokens": 10200
}
},
"model_override": "gpt-5.1",
"name": "Support agent regression",
"status": "active",
"tags": [
"regression",
"nightly"
],
"target": {
"type": "session"
},
"updated_at": "2026-01-15T10:30:00Z"
}