DokumentationStreaming-Antworten

Entwickeln

Streaming-Antworten

Die Antwort erscheint, während das Modell sie schreibt. Die Person liest die ersten Wörter, statt auf das Ende zu warten.

Auf dieser Seite
  1. Streaming aktivieren
  2. Das Format
  3. Die Zeitlimits

Streaming aktivieren

Setzen Sie stream auf true. Die Antwort kommt als Server-Sent Events, jedes mit einem Stück des Textes.

stream = client.chat.completions.create(
    model="flash",
    messages=[
        {"role": "user", "content": "Draft a payment reminder."}
    ],
    stream=True,
)
for chunk in stream:
    if chunk.choices and chunk.choices[0].delta.content:
        print(
            chunk.choices[0].delta.content, end="", flush=True
        )
    if chunk.usage:
        print("\n", chunk.usage.total_tokens, "tokens")
Antwort
data: {"id":"chatcmpl-91a7","object":"chat.completion.chunk","choices":[{"index":0,"delta":{"role":"assistant","content":""}}]}

data: {"id":"chatcmpl-91a7","object":"chat.completion.chunk","choices":[{"index":0,"delta":{"content":"Dear Ms Keller,"}}]}

data: {"id":"chatcmpl-91a7","object":"chat.completion.chunk","choices":[{"index":0,"delta":{},"finish_reason":"stop"}]}

data: {"id":"chatcmpl-91a7","object":"chat.completion.chunk","choices":[],"usage":{"prompt_tokens":17,"completion_tokens":96,"total_tokens":113}}

data: [DONE]

Das Format

EventWas es enthält
delta.contentDas nächste Textstück
delta.reasoning_contentDas Schlussfolgern, wenn Sie es angefordert haben
finish_reasonDer Grund für das Ende, im letzten Textstück
usageDie Token-Zählung, in einem letzten Event ohne choices
[DONE]Das Ende des Streams

Die Zeitlimits

  • Ein Stream, der zwei Minuten lang still bleibt, wird mit einem letzten Fehler-Event beendet.
  • Eine Antwort dauert höchstens zehn Minuten.
  • Um eine Antwort abzubrechen, schliessen Sie die Verbindung.