VoiceAgentInputTranscription interface

Configurazione asincrona di input-trascrizione audio. Amplia le opzioni di trascrizione in tempo reale di OpenAI con i modelli di trascrizione Azure e MAI, modelli di voce personalizzati e suggerimenti per frasi.

Proprietà

custom_speech

Configurazione opzionale di distribuzione vocale personalizzata dal cliente, codificata per località.

delay

Controlla quanto tempo il modello aspetta prima di emettere testo di trascrizione. Valori più alti possono migliorare la precisione della trascrizione a scapito della latenza. Supportato gpt-realtime-whisper solo nelle sessioni in tempo reale di GA.

keywords

Parole o frasi per guidare la trascrizione dell'audio in ingresso. Supportato da gpt-transcribe e gpt-live-transcribe.

language

Lingua dell'audio di input. Specificare il linguaggio di input nel formato ISO-639-1 (ad esempio en) migliorerà l'accuratezza e la latenza.

languages

Possibili linguaggi dell'audio in ingresso, in formato ISO-639-1 . Supportato da gpt-transcribe e gpt-live-transcribe.

model

L'identificatore del modello di trascrizione. Configura le distribuzioni vocali personalizzate del cliente in custom_speech.

phrase_list

La frase opzionale suggerisce che il riconoscimento favorevole ai termini di dominio.

prompt

Un testo opzionale per guidare lo stile del modello o continuare un segmento audio precedente. Per whisper-1, il prompt è un elenco di parole chiave. Per gpt-4o-transcribe i modelli (escluso gpt-4o-transcribe-diarize), il prompt è una stringa di testo libero, ad esempio "aspetta parole correlate alla tecnologia". Il prompt non è supportato gpt-realtime-whisper nelle sessioni GA Realtime.

Dettagli proprietà

custom_speech

Configurazione opzionale di distribuzione vocale personalizzata dal cliente, codificata per località.

custom_speech?: Record<string, string>

Valore della proprietà

Record<string, string>

delay

Controlla quanto tempo il modello aspetta prima di emettere testo di trascrizione. Valori più alti possono migliorare la precisione della trascrizione a scapito della latenza. Supportato gpt-realtime-whisper solo nelle sessioni in tempo reale di GA.

delay?: "low" | "medium" | "high" | "minimal" | "xhigh"

Valore della proprietà

"low" | "medium" | "high" | "minimal" | "xhigh"

keywords

Parole o frasi per guidare la trascrizione dell'audio in ingresso. Supportato da gpt-transcribe e gpt-live-transcribe.

keywords?: string[]

Valore della proprietà

string[]

language

Lingua dell'audio di input. Specificare il linguaggio di input nel formato ISO-639-1 (ad esempio en) migliorerà l'accuratezza e la latenza.

language?: string

Valore della proprietà

string

languages

Possibili linguaggi dell'audio in ingresso, in formato ISO-639-1 . Supportato da gpt-transcribe e gpt-live-transcribe.

languages?: string[]

Valore della proprietà

string[]

model

L'identificatore del modello di trascrizione. Configura le distribuzioni vocali personalizzate del cliente in custom_speech.

model: VoiceAgentInputTranscriptionModel

Valore della proprietà

phrase_list

La frase opzionale suggerisce che il riconoscimento favorevole ai termini di dominio.

phrase_list?: string[]

Valore della proprietà

string[]

prompt

Un testo opzionale per guidare lo stile del modello o continuare un segmento audio precedente. Per whisper-1, il prompt è un elenco di parole chiave. Per gpt-4o-transcribe i modelli (escluso gpt-4o-transcribe-diarize), il prompt è una stringa di testo libero, ad esempio "aspetta parole correlate alla tecnologia". Il prompt non è supportato gpt-realtime-whisper nelle sessioni GA Realtime.

prompt?: string

Valore della proprietà

string