OpenAI Transcription API
Whisper-1과 GPT Transcribe로 음성을 텍스트로 변환하는 OpenAI 호환 오디오 전사 API입니다.
curl -X POST https://runapi.ai/v1/audio/transcriptions \
-H "Authorization: Bearer $RUNAPI_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "whisper-1",
"audio_url": "https://cdn.runapi.ai/public/samples/voice.mp3"
}'
import { OpenaiTranscriptionClient } from "@runapi.ai/openai-transcription";
const client = new OpenaiTranscriptionClient();
const result = await client.speechToText.run({
model: "whisper-1",
audio_url: "https://cdn.runapi.ai/public/samples/voice.mp3",
});
require "runapi/openai_transcription"
client = RunApi::OpenaiTranscription::Client.new
result = client.speech_to_text.run(
model: "whisper-1",
audio_url: "https://cdn.runapi.ai/public/samples/voice.mp3"
)
npx skills add runapi-ai/openai-transcription -g
# Claude Code
claude mcp add runapi -s user -- npx -y @runapi.ai/mcp
# Codex
codex plugin install runapi-mcp@agents
# Cursor / Windsurf / VS Code
npx @runapi.ai/mcp init cursor
OpenAI Transcription은 동기식 멀티파트 엔드포인트에서 업로드한 오디오 파일을 텍스트로 변환합니다. Whisper-1은 자막과 타임스탬프 출력을 지원하고, GPT Transcribe는 다국어 오디오를 위한 키워드 및 언어 힌트를 지원합니다.
- 품질과 지연 시간 목표에 맞춘 모델 변형
- 통합 API key
- Model skill에 docs, schema, 설정 메모 포함
- 실패한 생성은 과금되지 않습니다
변형
앱 개발을 위해 OpenAI Transcription skill 설치
모델 docs, schema, 가격 메모, 설정 단계를 코딩 워크스페이스로 불러옵니다.
# Install the model skill for app development workflows
npx skills add runapi-ai/openai-transcription -g
Install the OpenAI Transcription skill for this app: 1. Add runapi-ai/openai-transcription with the skills installer. 2. Load SKILL.md in this workspace. 3. Use its docs, schemas, pricing notes, and setup steps when adding model features. 4. Confirm the install path when done.
이 model skill로 구현하는 방법
모델 선택
출력 유형, 품질 기준, 지연 시간 목표에 맞는 모델과 변형을 고릅니다.
한 번 인증
모든 지원 모델에 RunAPI key를 사용합니다.
skill 설치
기능을 구현하기 전에 코딩 워크스페이스에 model skill을 추가합니다.
결과 받기
task ID로 조회하거나 생성 완료 시 callback을 처리합니다.
OpenAI Transcription의 위치
OpenAI Transcription은 회의록, 자막, 검색 가능한 미디어, 다국어 전사를 위한 음성 인식 모델을 제공합니다. 두 모델 모두 OpenAI 호환 오디오 전사 요청 형식을 사용합니다.
RunAPI로 OpenAI Transcription을 쓰는 이유
하나의 API key
모델과 제공사를 넘나들며 같은 인증 정보를 사용합니다.
Skill-ready
model skill에 schema, 설정 메모, 가격 컨텍스트, 모델 ID가 포함됩니다.
예측 가능한 과금
호출 전에 사용량 기반 가격을 확인할 수 있습니다.
자주 묻는 질문
Whisper-1과 GPT Transcribe의 차이점은 무엇인가요?
Whisper-1은 JSON, 일반 텍스트, 자막, 상세 JSON, 타임스탬프 출력을 지원합니다. GPT Transcribe는 JSON 또는 일반 텍스트 출력에 집중하며, 키워드와 여러 언어 힌트를 받을 수 있습니다.
어떤 오디오 파일을 전사할 수 있나요?
FLAC, MP3, MP4, MPEG, MPGA, M4A, OGG, WAV, WebM 형식의 파일을 최대 25 MB까지 업로드할 수 있습니다.
API로 자막과 단어 단위 타임스탬프를 만들 수 있나요?
Whisper-1은 SRT 또는 VTT 자막을 반환하고 상세 JSON을 통해 단어 또는 세그먼트 단위 타임스탬프를 제공할 수 있습니다. GPT Transcribe에서는 이러한 출력 형식을 사용할 수 없습니다.
GPT Transcribe는 다국어 녹음을 지원하나요?
네. 하나의 언어 힌트 또는 가능성이 높은 여러 언어 목록과 함께 이름 및 전문 용어를 위한 키워드 힌트를 제공할 수 있습니다.
오디오 전사는 동기식인가요?
네. 요청이 성공하면 별도의 작업 상태 조회 엔드포인트 없이 완성된 전사 결과를 바로 반환합니다.
이 모델은 어떻게 호출하나요?
model skill을 설치하고 RunAPI key와 함께 설정 메모를 따르세요.
실패한 생성도 비용이 드나요?
실패한 생성은 과금되지 않습니다
애플리케이션에서 호출할 수 있나요?
네. 코딩 워크스페이스에 model skill을 설치하고 모델 기능을 추가할 때 사용하세요.