diff --git a/dto/openai_response.go b/dto/openai_response.go index ecda485c5e..2de6014f4d 100644 --- a/dto/openai_response.go +++ b/dto/openai_response.go @@ -270,12 +270,17 @@ type InputTokenDetails struct { // which field the upstream reported it in: Claude-derived conversions populate // CachedCreationTokens while OpenAI reports cache_write_tokens natively. Both // are billed at the cache-creation price; when both are present the larger -// value wins so the same tokens are never double-counted. +// value wins so the same tokens are never double-counted. Negative upstream +// values are clamped to zero so they can never lower a charge. func (d InputTokenDetails) CacheCreationTokensTotal() int { - if d.CacheWriteTokens > d.CachedCreationTokens { - return d.CacheWriteTokens + total := d.CachedCreationTokens + if d.CacheWriteTokens > total { + total = d.CacheWriteTokens } - return d.CachedCreationTokens + if total < 0 { + return 0 + } + return total } type OutputTokenDetails struct { diff --git a/relay/channel/openai/relay_image.go b/relay/channel/openai/relay_image.go index 90fb8794c4..e0f09aae28 100644 --- a/relay/channel/openai/relay_image.go +++ b/relay/channel/openai/relay_image.go @@ -80,6 +80,7 @@ func normalizeOpenAIUsage(usage *dto.Usage) { if usage.InputTokensDetails != nil { usage.PromptTokensDetails.CachedTokens = usage.InputTokensDetails.CachedTokens usage.PromptTokensDetails.CachedCreationTokens = usage.InputTokensDetails.CachedCreationTokens + usage.PromptTokensDetails.CacheWriteTokens = usage.InputTokensDetails.CacheWriteTokens usage.PromptTokensDetails.ImageTokens = usage.InputTokensDetails.ImageTokens usage.PromptTokensDetails.TextTokens = usage.InputTokensDetails.TextTokens usage.PromptTokensDetails.AudioTokens = usage.InputTokensDetails.AudioTokens diff --git a/relay/responses_handler.go b/relay/responses_handler.go index 4503768719..5fa23d0996 100644 --- a/relay/responses_handler.go +++ b/relay/responses_handler.go @@ -40,6 +40,11 @@ func ResponsesHelper(c *gin.Context, info *relaycommon.RelayInfo) (newAPIError * case *dto.OpenAIResponsesRequest: responsesReq = req case *dto.OpenAIResponsesCompactionRequest: + // Only fields documented for POST /v1/responses/compact are forwarded: + // model, input, instructions, previous_response_id, prompt_cache_key, + // prompt_cache_options, prompt_cache_retention, service_tier. + // Undocumented Codex-parity fields (tools, reasoning, text) are parsed + // for client compatibility but intentionally not sent upstream. responsesReq = &dto.OpenAIResponsesRequest{ Model: req.Model, Input: req.Input, @@ -47,6 +52,7 @@ func ResponsesHelper(c *gin.Context, info *relaycommon.RelayInfo) (newAPIError * PreviousResponseID: req.PreviousResponseID, ParallelToolCalls: req.ParallelToolCalls, ServiceTier: req.ServiceTier, + PromptCacheKey: req.PromptCacheKey, PromptCacheOptions: req.PromptCacheOptions, PromptCacheRetention: req.PromptCacheRetention, } diff --git a/service/relayconvert/internal/oai_chat/to_claude_messages_resp.go b/service/relayconvert/internal/oai_chat/to_claude_messages_resp.go index 2add756fa8..7f0c6b8be5 100644 --- a/service/relayconvert/internal/oai_chat/to_claude_messages_resp.go +++ b/service/relayconvert/internal/oai_chat/to_claude_messages_resp.go @@ -44,7 +44,8 @@ func buildClaudeUsageFromOpenAIUsage(oaiUsage *dto.Usage) *dto.ClaudeUsage { if oaiUsage.PromptTokensDetails.CacheWriteTokens > 0 { // OpenAI native cache-write usage counts cached and cache-write tokens // inside prompt_tokens, while Claude semantics reports input_tokens - // excluding both; the uncached remainder clamps at zero. + // excluding both. Both counts are unadjusted prefixes and may overlap, + // so clamp a negative remainder at zero. inputTokens = oaiUsage.PromptTokens - oaiUsage.PromptTokensDetails.CachedTokens - cacheCreationTokens if inputTokens < 0 { inputTokens = 0 diff --git a/service/relayconvert/internal/oai_chat/to_claude_messages_resp_test.go b/service/relayconvert/internal/oai_chat/to_claude_messages_resp_test.go index d3841e5075..facd873e70 100644 --- a/service/relayconvert/internal/oai_chat/to_claude_messages_resp_test.go +++ b/service/relayconvert/internal/oai_chat/to_claude_messages_resp_test.go @@ -92,7 +92,7 @@ func TestBuildClaudeUsageFromOpenAICacheWriteUsage(t *testing.T) { require.NotNil(t, usage) // Claude semantics reports input_tokens excluding cache read/write; the - // remainder 3619-2921-3616 clamps to 0. + // overlapping unadjusted prefixes drive the remainder negative, clamp to 0. assert.Equal(t, 0, usage.InputTokens) assert.Equal(t, 2921, usage.CacheReadInputTokens) assert.Equal(t, 3616, usage.CacheCreationInputTokens) diff --git a/service/text_quota.go b/service/text_quota.go index 66244ec1a7..7da3391206 100644 --- a/service/text_quota.go +++ b/service/text_quota.go @@ -294,9 +294,10 @@ func calculateTextQuotaSummary(ctx *gin.Context, relayInfo *relaycommon.RelayInf } } - // OpenAI cache-write usage can report cached_tokens + cache_write_tokens - // exceeding prompt_tokens; the uncached remainder must clamp at zero so - // billing never subtracts more than the reported input. + // OpenAI cache-write usage reports unadjusted prefix counts, so + // cached_tokens + cache_write_tokens can exceed prompt_tokens and the + // remainder can go negative. Clamp at zero so overlap never turns into + // a negative base charge. if baseTokens.IsNegative() { baseTokens = decimal.Zero } diff --git a/service/text_quota_test.go b/service/text_quota_test.go index d7f04f33ff..9309212500 100644 --- a/service/text_quota_test.go +++ b/service/text_quota_test.go @@ -411,8 +411,8 @@ func TestCalculateTextQuotaSummaryBillsOpenAICacheWriteTokens(t *testing.T) { t.Run("uncached remainder clamps to zero", func(t *testing.T) { // Real OpenAI payload shape: cached_tokens + cache_write_tokens exceeds - // prompt_tokens, so the uncached remainder must clamp to 0 instead of - // producing a negative charge component. + // prompt_tokens because both are unadjusted prefix counts. The negative + // remainder must clamp to zero, never turn into a negative base charge. usage := &dto.Usage{ PromptTokens: 3619, CompletionTokens: 36, diff --git a/service/tiered_settle.go b/service/tiered_settle.go index 00eeeb8eb2..05337bd774 100644 --- a/service/tiered_settle.go +++ b/service/tiered_settle.go @@ -67,6 +67,8 @@ func BuildTieredTokenParams(usage *dto.Usage, isClaudeUsageSemantic bool, usedVa } } + // OpenAI cache-write usage reports unadjusted prefix counts, so cr + cc can + // exceed the prompt and drive the remainder negative. Clamp at zero. if p < 0 { p = 0 }