VoiceAgentInputTranscription interface
Configuración asíncrona de transcripción de audio de entrada. Extiende las opciones de transcripción en tiempo real de OpenAI con los modelos de transcripción de Azure y MAI, modelos de voz personalizados y consejos de frase.
Propiedades
| custom_speech | Configuración opcional de despliegue de voz personalizada por el cliente, codificada por localidad. |
| delay | Controla cuánto tiempo espera el modelo antes de emitir texto de transcripción.
Valores más altos pueden mejorar la precisión de la transcripción a costa de la latencia.
Solo soportado en |
| keywords | Palabras o frases para guiar la transcripción del audio de entrada. Apoyado por |
| language | Idioma del audio de entrada. Proporcionar el idioma de entrada en formato ISO-639-1 (por ejemplo, |
| languages | Posibles idiomas del audio de entrada, en formato ISO-639-1 . Apoyado por |
| model | El identificador del modelo de transcripción. Configurar despliegues de voz personalizados del cliente en |
| phrase_list | Frase opcional insinúa que el reconocimiento a favor de los términos de dominio. |
| prompt | Un texto opcional para guiar el estilo del modelo o continuar un segmento de audio anterior.
Para |
Detalles de las propiedades
custom_speech
Configuración opcional de despliegue de voz personalizada por el cliente, codificada por localidad.
custom_speech?: Record<string, string>
Valor de propiedad
Record<string, string>
delay
Controla cuánto tiempo espera el modelo antes de emitir texto de transcripción.
Valores más altos pueden mejorar la precisión de la transcripción a costa de la latencia.
Solo soportado en gpt-realtime-whisper sesiones de tiempo real de GA.
delay?: "low" | "medium" | "high" | "minimal" | "xhigh"
Valor de propiedad
"low" | "medium" | "high" | "minimal" | "xhigh"
keywords
Palabras o frases para guiar la transcripción del audio de entrada. Apoyado por gpt-transcribe y gpt-live-transcribe.
keywords?: string[]
Valor de propiedad
string[]
language
Idioma del audio de entrada. Proporcionar el idioma de entrada en formato ISO-639-1 (por ejemplo, en) mejorará la precisión y la latencia.
language?: string
Valor de propiedad
string
languages
Posibles idiomas del audio de entrada, en formato ISO-639-1 . Apoyado por gpt-transcribe y gpt-live-transcribe.
languages?: string[]
Valor de propiedad
string[]
model
El identificador del modelo de transcripción. Configurar despliegues de voz personalizados del cliente en custom_speech.
model: VoiceAgentInputTranscriptionModel
Valor de propiedad
phrase_list
Frase opcional insinúa que el reconocimiento a favor de los términos de dominio.
phrase_list?: string[]
Valor de propiedad
string[]
prompt
Un texto opcional para guiar el estilo del modelo o continuar un segmento de audio anterior.
Para whisper-1, el símbolo del sistema es una lista de palabras clave.
En gpt-4o-transcribe el caso de los modelos (excepto gpt-4o-transcribe-diarize), la solicitud es una cadena de texto libre, por ejemplo, "esperar palabras relacionadas con la tecnología".
El prompt no está compatible con gpt-realtime-whisper sesiones de GA Realtime.
prompt?: string
Valor de propiedad
string