Overview

Call Any Text Model Through One OpenAI-Compatible Endpoint

Basic conversation#

{
  "model": "gpt-5.2",
  "messages": [
    {"role": "user", "content": "Explain vector databases in one sentence."}
  ]
}

Add a system prompt#

{
  "model": "claude-sonnet-4-5-20250929",
  "messages": [
    {"role": "system", "content": "You are a technical editor. Improve clarity of product copy."},
    {"role": "user", "content": "Rewrite the button text 'Submission failed' to be friendly and actionable."}
  ]
}

Run a multi-turn conversation#

{
  "model": "gemini-3-flash-preview",
  "messages": [
    {"role": "user", "content": "Give me 3 customer support bot names."},
    {"role": "assistant", "content": "1) HelpWave 2) CarePilot 3) SwiftSupport"},
    {"role": "user", "content": "Add one style tag for each name."}
  ]
}

Stream the output#

{
  "model": "gpt-5.2",
  "messages": [
    {"role": "user", "content": "Generate 5 short titles (max 6 words) about AI video generation."}
  ],
  "stream": true
}

Know the request rules#

  • Set stream: true for SSE streaming responses.
  • Different models support different context lengths, output limits, and optional parameters.
  • For OpenAI-compatible workflows that need tools or multimodal structured input, use the Responses API.

See Error Codes for how failed requests are reported, and Authentication for the required Bearer token.

Back to Documentation Index

Updated

Was this page helpful?