OpenAI · Audio & Music

Hermes Agent x OpenAI Transcription

OpenAI Transcription bietet Speech-to-Text-Modelle für Besprechungsnotizen, Untertitel, durchsuchbare Medien und mehrsprachige Transkripte. Beide Varianten verwenden das OpenAI-kompatible Request-Schema für Audiotranskription.

Öffentliche Versionen und Endpunkte

Modell-IDVersionEndpunkteStartpreisKatalog
gpt-transcribeMehrsprachiges Speech-to-Text mit Stichwort- und Sprachhinweisen
/v1/audio/transcriptions
$0.020Modelldetails
whisper-1Flexible Audiotranskription mit Untertiteln und Zeitstempeln
/v1/audio/transcriptions
$0.020Modelldetails

Konfiguration

Guide-Endpunkt: <endpoint>

Wähle <model-id>, um eine Anfrage mit dem öffentlichen Eingabevertrag des Endpunkts zu erzeugen.

Überprüfen

Wähle <model-id>, um Prüfkommandos zu erzeugen.

So funktioniert es

  1. 1. Modell-ID auswählen

    Wähle eine öffentliche Katalog-Modell-ID und prüfe ihren Endpunkt und aktuellen Startpreis.

  2. 2. RunAPI konfigurieren

    Setze RUNAPI_API_KEY, bevor du die Endpunktanfrage sendest.

  3. 3. Ergebnis überprüfen

    Frage bei asynchronen Endpunkten denselben Endpunkt ab, bis die Task einen Endstatus erreicht.

Häufige Fragen

Welche Modell-ID soll ich verwenden?

Wähle eine öffentliche Modell-ID aus der Versionstabelle. Jede ID stellt die in ihrer Zeile gezeigten Endpunkte bereit.

Konfiguriert diese Anleitung ein Chatmodell?

Nein. Diese Modelllinie verwendet den hier gezeigten Endpunktablauf und wird nicht als Agent-Chatmodell dargestellt.