VoiceAgentInputTranscription interface

Configuración asíncrona de transcripción de audio de entrada. Extiende las opciones de transcripción en tiempo real de OpenAI con los modelos de transcripción de Azure y MAI, modelos de voz personalizados y consejos de frase.

Propiedades

custom_speech

Configuración opcional de despliegue de voz personalizada por el cliente, codificada por localidad.

delay

Controla cuánto tiempo espera el modelo antes de emitir texto de transcripción. Valores más altos pueden mejorar la precisión de la transcripción a costa de la latencia. Solo soportado en gpt-realtime-whisper sesiones de tiempo real de GA.

keywords

Palabras o frases para guiar la transcripción del audio de entrada. Apoyado por gpt-transcribe y gpt-live-transcribe.

language

Idioma del audio de entrada. Proporcionar el idioma de entrada en formato ISO-639-1 (por ejemplo, en) mejorará la precisión y la latencia.

languages

Posibles idiomas del audio de entrada, en formato ISO-639-1 . Apoyado por gpt-transcribe y gpt-live-transcribe.

model

El identificador del modelo de transcripción. Configurar despliegues de voz personalizados del cliente en custom_speech.

phrase_list

Frase opcional insinúa que el reconocimiento a favor de los términos de dominio.

prompt

Un texto opcional para guiar el estilo del modelo o continuar un segmento de audio anterior. Para whisper-1, el símbolo del sistema es una lista de palabras clave. En gpt-4o-transcribe el caso de los modelos (excepto gpt-4o-transcribe-diarize), la solicitud es una cadena de texto libre, por ejemplo, "esperar palabras relacionadas con la tecnología". El prompt no está compatible con gpt-realtime-whisper sesiones de GA Realtime.

Detalles de las propiedades

custom_speech

Configuración opcional de despliegue de voz personalizada por el cliente, codificada por localidad.

custom_speech?: Record<string, string>

Valor de propiedad

Record<string, string>

delay

Controla cuánto tiempo espera el modelo antes de emitir texto de transcripción. Valores más altos pueden mejorar la precisión de la transcripción a costa de la latencia. Solo soportado en gpt-realtime-whisper sesiones de tiempo real de GA.

delay?: "low" | "medium" | "high" | "minimal" | "xhigh"

Valor de propiedad

"low" | "medium" | "high" | "minimal" | "xhigh"

keywords

Palabras o frases para guiar la transcripción del audio de entrada. Apoyado por gpt-transcribe y gpt-live-transcribe.

keywords?: string[]

Valor de propiedad

string[]

language

Idioma del audio de entrada. Proporcionar el idioma de entrada en formato ISO-639-1 (por ejemplo, en) mejorará la precisión y la latencia.

language?: string

Valor de propiedad

string

languages

Posibles idiomas del audio de entrada, en formato ISO-639-1 . Apoyado por gpt-transcribe y gpt-live-transcribe.

languages?: string[]

Valor de propiedad

string[]

model

El identificador del modelo de transcripción. Configurar despliegues de voz personalizados del cliente en custom_speech.

model: VoiceAgentInputTranscriptionModel

Valor de propiedad

phrase_list

Frase opcional insinúa que el reconocimiento a favor de los términos de dominio.

phrase_list?: string[]

Valor de propiedad

string[]

prompt

Un texto opcional para guiar el estilo del modelo o continuar un segmento de audio anterior. Para whisper-1, el símbolo del sistema es una lista de palabras clave. En gpt-4o-transcribe el caso de los modelos (excepto gpt-4o-transcribe-diarize), la solicitud es una cadena de texto libre, por ejemplo, "esperar palabras relacionadas con la tecnología". El prompt no está compatible con gpt-realtime-whisper sesiones de GA Realtime.

prompt?: string

Valor de propiedad

string