class

AI::OpenAI::OpenAITranscriptionModel

Inherits AI::Provider::TranscriptionModel::V3 < Reference < Object

OpenAI transcription model implementation.

Implements the TranscriptionModelV3 interface for speech-to-text using OpenAI's audio/transcriptions API.

Supports models:

  • whisper-1 - Whisper transcription model
  • gpt-4o-mini-transcribe - GPT-4o mini transcription model
  • gpt-4o-transcribe - GPT-4o transcription model

Example:

model = OpenAITranscriptionModel.new("whisper-1", config)
result = model.do_generate(
  Provider::TranscriptionModel::CallOptions.new(
    audio: File.read("audio.mp3").to_slice,
    media_type: "audio/mp3"
  )
)
puts result.text

Constructors

new(model_id : OpenAITranscriptionModelId, config : OpenAIConfig)
Source
new(model_id : OpenAITranscriptionModelId, config : OpenAITranscriptionModelConfig)
Source

Instance methods

do_generate(options : Provider::TranscriptionModel::CallOptions) : Provider::TranscriptionModel::Result

Generates a transcript from audio.

Parameters:

  • options: Call options including audio data, media type, and provider options

Returns transcription result with text, segments, and metadata.

Source
model_id

The model ID.

Source
provider

Returns the provider name.

Source
specification_version

Returns the specification version.

Source