VoiceAgentInputTranscription interface
Configurazione asincrona di input-trascrizione audio. Amplia le opzioni di trascrizione in tempo reale di OpenAI con i modelli di trascrizione Azure e MAI, modelli di voce personalizzati e suggerimenti per frasi.
Proprietà
| custom_speech | Configurazione opzionale di distribuzione vocale personalizzata dal cliente, codificata per località. |
| delay | Controlla quanto tempo il modello aspetta prima di emettere testo di trascrizione.
Valori più alti possono migliorare la precisione della trascrizione a scapito della latenza.
Supportato |
| keywords | Parole o frasi per guidare la trascrizione dell'audio in ingresso. Supportato da |
| language | Lingua dell'audio di input. Specificare il linguaggio di input nel formato ISO-639-1 (ad esempio |
| languages | Possibili linguaggi dell'audio in ingresso, in formato ISO-639-1 . Supportato da |
| model | L'identificatore del modello di trascrizione. Configura le distribuzioni vocali personalizzate del cliente in |
| phrase_list | La frase opzionale suggerisce che il riconoscimento favorevole ai termini di dominio. |
| prompt | Un testo opzionale per guidare lo stile del modello o continuare un segmento audio precedente.
Per |
Dettagli proprietà
custom_speech
Configurazione opzionale di distribuzione vocale personalizzata dal cliente, codificata per località.
custom_speech?: Record<string, string>
Valore della proprietà
Record<string, string>
delay
Controlla quanto tempo il modello aspetta prima di emettere testo di trascrizione.
Valori più alti possono migliorare la precisione della trascrizione a scapito della latenza.
Supportato gpt-realtime-whisper solo nelle sessioni in tempo reale di GA.
delay?: "low" | "medium" | "high" | "minimal" | "xhigh"
Valore della proprietà
"low" | "medium" | "high" | "minimal" | "xhigh"
keywords
Parole o frasi per guidare la trascrizione dell'audio in ingresso. Supportato da gpt-transcribe e gpt-live-transcribe.
keywords?: string[]
Valore della proprietà
string[]
language
Lingua dell'audio di input. Specificare il linguaggio di input nel formato ISO-639-1 (ad esempio en) migliorerà l'accuratezza e la latenza.
language?: string
Valore della proprietà
string
languages
Possibili linguaggi dell'audio in ingresso, in formato ISO-639-1 . Supportato da gpt-transcribe e gpt-live-transcribe.
languages?: string[]
Valore della proprietà
string[]
model
L'identificatore del modello di trascrizione. Configura le distribuzioni vocali personalizzate del cliente in custom_speech.
model: VoiceAgentInputTranscriptionModel
Valore della proprietà
phrase_list
La frase opzionale suggerisce che il riconoscimento favorevole ai termini di dominio.
phrase_list?: string[]
Valore della proprietà
string[]
prompt
Un testo opzionale per guidare lo stile del modello o continuare un segmento audio precedente.
Per whisper-1, il prompt è un elenco di parole chiave.
Per gpt-4o-transcribe i modelli (escluso gpt-4o-transcribe-diarize), il prompt è una stringa di testo libero, ad esempio "aspetta parole correlate alla tecnologia".
Il prompt non è supportato gpt-realtime-whisper nelle sessioni GA Realtime.
prompt?: string
Valore della proprietà
string