Materializzazione dei dataset nelle dashboard di AI/BI

Important

Questa funzionalità è in versione beta. Per utilizzarlo, un amministratore dello spazio di lavoro deve abilitare la Materializzazione della dashboard AI/BI dalla pagina Anteprime. Vedere Gestire le anteprime di Azure Databricks.

I dashboard AI/BI si basano su dataset definiti a livello di dashboard. Per impostazione predefinita, ogni dataset viene valutato in tempo reale, quindi ogni volta che una dashboard si carica o un visualizzatore interagisce con essa, le query sottostanti, i join e le scansioni sorgente si rigenerano sul tuo SQL warehouse. Per le dashboard basate su query di origine costose o con molte join, rieseguire tali query a ogni interazione è lento e costoso.

La materializzazione del set di dati precalcola e memorizza i risultati alla base del set di dati, così l’elaborazione più onerosa viene eseguita una sola volta secondo una pianificazione, anziché a ogni caricamento o interazione della dashboard. Le interazioni vengono poi renderizzate dai risultati memorizzati, rendendo le dashboard pubblicate più veloci.

La materializzazione utilizza la tecnologia di materializzazione delle viste metriche di Unity Catalog. Vedere Materializzazione per le visualizzazioni delle metriche.

Cosa si materializza

La materializzazione pre-calcola e memorizza i dati del dataset. Ciò che viene memorizzato varia tra i due tipi di dataset:

  • Per i dataset SQL, il risultato completo della query viene precalcolato e memorizzato.
  • Per le viste metriche locali, il modello dati a livello riga (dati sorgente, join e campi filtro) viene memorizzato, mentre le misure vengono ancora calcolate in tempo di query rispetto alla base pre-calcolata.

Benefits

La materializzazione del dataset offre i seguenti benefici:

  • Dashboard più veloci senza rimodellare il modello. Le operazioni di join costose e le scansioni delle origini dati vengono eseguite una sola volta in base a una pianificazione, anziché a ogni caricamento, eliminando così l'attesa degli utenti quando un dashboard interroga nuovamente tabelle di grandi dimensioni.
  • Costo del magazzino più basso al momento di lettura. Il pre-calcolo del modello base di dati evita di ripetere la stessa query pesante per ogni visualizzatore e ogni caricamento di pagina, riducendo così l'uso ridondante del warehouse.
  • Nessun sovrappeso operativo. Azure Databricks crea, memorizza e aggiorna i dati materializzati per te. Non c'è pipeline, schema o storage da gestire.

Costs

La materializzazione del dataset comporta costi di archiviazione e calcolo:

Pesa questi costi rispetto ai risparmi derivanti dall'evitare scansioni e join ripetute della sorgente. Scegli un programma di aggiornamento che bilanci la freschezza dei dati con i costi di calcolo.

Quando utilizzare la materializzazione

La materializzazione non è sempre la leva giusta per le prestazioni. Il vantaggio deriva dal sostituire il ricalcolo completo e ripetuto di un dataset (scansione e operazioni di join) con letture da una tabella precalcolata. Materializza un dataset quando si applicano uno o più dei seguenti fattori:

  • Dashboard fortemente interattive. La dashboard dispone di numerosi filtri, del filtraggio incrociato e di funzioni di drill-down. Senza materializzazione, ogni interazione riesegue la query sul dataset, quindi precalcolare tali dataset offre vantaggi ripetuti nel corso di una sessione.
  • Set di dati costosi Il set di dati è basato su join tra più tabelle, viste complesse o espressioni di tabella comuni (CTE), funzioni di finestra o unioni tra numerose tabelle.
  • Filtri selettivi su tabelle grandi. Il dataset seleziona un piccolo sottoinsieme, come una regione o gli ultimi 7 giorni tra miliardi di righe. La materializzazione memorizza solo il piccolo sottoinsieme.
  • Tolleranza della freschezza pianificata. I dati devono essere aggiornati solo quanto il calendario di aggiornamento della dashboard, ad esempio orario o giornaliero, piuttosto che in tempo reale.

Per piccoli set di dati o dashboard che vengono aperti raramente, la query in tempo reale è spesso abbastanza veloce e la materializzazione potrebbe non giustificare il costo. Poiché la materializzazione è facoltativa per ogni pubblicazione e per ogni set di dati, puoi applicarla solo dove conviene.

Requisiti

  • Accesso a un dashboard di intelligenza artificiale/BI.
  • La dashboard viene pubblicata con l'opzione Permessi di Condivisione dei dati . La materializzazione non è supportata per le dashboard pubblicate con autorizzazioni individuali sui dati. Vedere Che cosa sono le autorizzazioni per i dati condivisi?.
  • Calcolo serverless attivato nello spazio di lavoro. La creazione iniziale e gli aggiornamenti vengono eseguiti su pipeline serverless di Lakeflow. Consultare Configurare i magazzini SQL serverless.
  • Autorizzazione CAN USE per un SQL warehouse con Databricks Runtime 17.3 e versioni successive.

Abilita la materializzazione del dataset

I dataset sono selezionati per la materializzazione di default, ma la materializzazione è disattivata per la dashboard finché non attivi l'opzione Materialize datasets al momento della pubblicazione.

Scegli quali set di dati materializzare

Nella scheda Dati , clicca sull'icona di materializzazione accanto a un dataset per includerlo o escluderlo.

La scheda Dati mostra un'icona verde di materializzazione su un dataset e un'icona deselezionata su un altro.

Quando escludi un dataset dalla materializzazione, le query su quel dataset restituiscono risultati in tempo reale, mentre le query contro dataset materializzati riflettono l'ultima esecuzione di materializzazione. Quando tutti i dataset utilizzano lo stesso calendario di materializzazione, i widget hanno una freschezza dei dati costante.

Pubblica con materializzazione

  1. Fai clic su Pubblica nella dashboard delle bozze.
  2. Seleziona permessi di condivisione dei dati nella finestra di pubblicazione.
  3. Attiva l'opzione Materializzare dataset per materializzare i dataset selezionati nella scheda Dati .
  4. Fare clic su Pubblica.

La finestra di pubblicazione con i permessi dati condivisi selezionati e l'opzione Materialize dataset.

Attiva l'opzione Materialize dataset ad ogni pubblicazione.

Imposta un programma di aggiornamento

I dati materializzati vengono aggiornati in base alla frequenza di aggiornamento della dashboard. Usa il calendario della dashboard per regolare la frequenza di aggiornamento.

Se la dashboard non ha un calendario, pubblicare con materializzazione abilitata aggiunge un programma di aggiornamento giornaliero. I programmi esistenti sono stati preservati. Senza un programma attivo, i dati materializzati non si aggiornano automaticamente dopo la creazione.

Il pannello Pianificazioni del dashboard mostra il badge

Visualizza lo stato della materializzazione

Nella dashboard pubblicata, apri l'icona del menu Kebab. e seleziona Info. La barra laterale mostra lo stato di ogni dataset materializzato e le informazioni di aggiornamento.

Il menu kebab della dashboard pubblicata con l'opzione Info consente di visualizzare lo stato della materializzazione.

La barra laterale Info elenca lo stato di ogni dataset materializzato e le informazioni di aggiornamento.

Riutilizzo e pulizia

Azure Databricks gestisce il ciclo di vita dei tuoi dati materializzati:

  • Riutilizzare tra le revisioni. Se una dashboard viene ripubblicata dallo stesso utente e un dataset rimane invariato, la materializzazione esistente verrà riutilizzata, evitando calcolo sprecato.
  • Pulizia automatica. Azure Databricks elimina le materializzazioni a cui una dashboard pubblicata non fa più riferimento, ad esempio dopo una modifica della definizione o un annullamento della pubblicazione.

La ripubblicazione non aggiorna necessariamente i dati materializzati.

Limitations

La materializzazione del dataset presenta le seguenti limitazioni:

  • Solo dashboard pubblicate. La materializzazione si applica ai dashboard pubblicati. Le bozze continuano a interrogare dati in tempo reale.
  • Nessun dataset parametrizzato. I dataset che definiscono i parametri non possono essere materializzati. Se si configura un set di dati parametrizzato per la materializzazione, Azure Databricks lo segnala come non riuscito invece di materializzarlo.
  • L'aggiornamento segue solo il calendario della dashboard. Non esiste un programma di aggiornamento separato per ogni dataset. La materializzazione si aggiorna in base alla frequenza di aggiornamento pianificata della dashboard.
  • Serverless obbligatorio. La creazione iniziale e gli aggiornamenti vengono eseguiti su pipeline Lakeflow serverless, quindi nello spazio di lavoro deve essere abilitato il compute serverless.
  • I dati protetti non vengono forniti dalle materializzazioni. La materializzazione non può essere creata per dati sorgente protetti da sicurezza a livello riga, maschere di colonna o politiche di controllo degli accessi basate su attributi (ABAC). Se la sicurezza a livello di riga viene aggiunta a una tabella sorgente dopo la creazione della materializzazione, le query successive sulla vista delle metriche ignorano la materializzazione e vengono eseguite direttamente sui dati di origine.
  • Permessi di condivisione dei dati necessari. Puoi abilitare la materializzazione solo quando pubblichi con permessi di dati condivisi. Non puoi abilitarlo quando pubblichi con i permessi dei dati individuali.

Domande frequenti

Le domande seguenti riguardano il comportamento di materializzazione dei dataset, gli aggiornamenti e i permessi.

La materializzazione cambia le mie metriche o i miei risultati?

La materializzazione preserva la logica delle query del dataset, ma i suoi dati riflettono l'ultimo aggiornamento riuscito. Per le viste metriche locali, le misure vengono calcolate al momento della query rispetto ai dati materializzati. Vediamo cosa si materializza.

Cosa succede se una materializzazione non è pronta o non è disponibile?

Se una materializzazione non è pronta o non è disponibile al momento della query, la query restituisce un errore invece di interrogare dati in tempo reale. Attendi il completamento della materializzazione, quindi esegui nuovamente la query.

Dove vengono archiviati i dati materializzati?

Azure Databricks archivia i dati materializzati in uno spazio di archiviazione interno gestito associato alla dashboard pubblicata. Non c'è nulla da pubblicare nel Catalogo Unity, né schema o archiviazione da gestire. L'accesso continua a dipendere dal tuo dashboard e dalle autorizzazioni dei dati sottostanti.

Quanto spesso i dati materializzati si aggiornano?

I dati materializzati vengono aggiornati in base alla frequenza di aggiornamento della dashboard. Vedi Impostare un programma di aggiornamento.

Quante risorse di calcolo utilizza la materializzazione?

La creazione iniziale e i refresh sono entrambi eseguiti su pipeline serverless Lakeflow gestite da Azure Databricks. Ecco perché il calcolo serverless deve essere abilitato nello spazio di lavoro.

La materializzazione influisce sui permessi?

No La materializzazione non garantisce accesso aggiuntivo ai dati. L'accesso segue ancora la configurazione di condivisione della dashboard e i permessi utilizzati per pubblicarla.

Cosa succede quando ripubblico?

Le materializzazioni esistenti possono essere riutilizzate quando lo stesso utente ripubblica un dataset invariato. Vedi Riutilizzo e pulizia. Attiva l'opzione Materialize dataset ad ogni pubblicazione.

Risorse aggiuntive