Sozdai LogoDocs
Docs/LLM

GPT 5.6 Luna

1.05M contextMise en cache des promptsRéflexion
POSThttps://api.foxwire.ai/v1/chat/completions

#Pricing Summary

#Exemple de requête

Execute completions using standard OpenAI SDK formats by pointing base endpoints here.

bash
curl https://api.foxwire.ai/v1/chat/completions \
  -H "Authorization: Bearer $CORRY_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gpt-5.6-luna",
    "messages": [{"role": "user", "content": "Hello"}]
  }'

#Exemple de réponse

Un objet de complétion de chat standard compatible OpenAI. Le champ model est normalisé selon le nom que vous avez demandé.

json
{
  "id": "chatcmpl-abc123",
  "object": "chat.completion",
  "model": "gpt-5.6-luna",
  "choices": [
    {
      "index": 0,
      "message": { "role": "assistant", "content": "Hello! How can I help you today?" },
      "finish_reason": "stop"
    }
  ],
  "usage": { "prompt_tokens": 12, "completion_tokens": 9, "total_tokens": 21, "cost": 0.000234, "currency": "USD" }
}

Cost field

usage.cost is the amount charged for this call (in USD); in streaming it arrives on the final chunk that carries usage. OpenAI SDKs ignore this extra field.

#Mise en cache des prompts

Pour les modèles compatibles avec le cache, placez le contenu statique long (système, base de connaissances) en premier et ajoutez un point de rupture de cache. Les portions mises en cache peuvent coûter aussi peu que 1/10. Les accès au cache sont indiqués dans le champ usage de la réponse.

json
{
  "model": "gpt-5.6-luna",
  "messages": [
    {
      "role": "system",
      "content": [
        { "type": "text", "text": "( long static context ... )", "cache_control": { "type": "ephemeral" } }
      ]
    },
    { "role": "user", "content": "your question" }
  ]
}

Prompt Caching Tip

Prompt caching matches request prefixes exactly. Make sure long contexts (e.g. system instructions, developer tools) appear at the start of your message list.

#Réflexion

Pour les modèles qui le prennent en charge, ajoutez reasoning_effort (low / medium / high). La réflexion est renvoyée dans le champ reasoning_content de la réponse ; les tokens de réflexion sont facturés au tarif de sortie.

json
{
  "model": "gpt-5.6-luna",
  "max_tokens": 2048,
  "reasoning_effort": "high",
  "messages": [{ "role": "user", "content": "your question" }]
}