Skip to main content
GET
Get AI serving deployment metrics

Authorizations

Authorization
string
header
required

Enter "Bearer {token}"

Headers

X-CostGraph-Tenant-ID
string
required

Tenant ID

Path Parameters

id
string
required

AI serving deployment ID

Query Parameters

range
string

Time window (e.g. 1h, 6h, 24h, 7d). Default 1h

step
string

Resolution step (e.g. 30s, 1m, 5m)

signals
string

Serving signals (comma-separated): all,time_to_first_token,inter_token,end_to_end,queue,prefill,decode,request_output_tokens,kv_cache_utilization,batch_size,queue_depth,preemptions,concurrency,tokens_per_second,cost_per_mtok. Default all

quantiles
string

Quantiles between 0 and 1 (comma-separated). Default 0.5,0.95,0.99

model
string

Restrict to one model

replica
string

Restrict to one replica, as namespace/pod

Response

OK

message
string
required
Example:

"some message"

status
string
required
Example:

"success"

data
object