הרצת שאילתות על טבלאות Lakehouse באמצעות שפה טבעית

ניתוח נתוני השיחות ב-BigQuery מאפשר לכם לשלוח הנחיות בשפה טבעית כדי לבצע שאילתות על נתונים בפורמט פתוח. היכולת הזו מתבססת על קטלוג ייעודי לזמן ריצה בתוך Lakehouse ללא גבולות, כדי למפות באופן אוטומטי את השאלות שלכם לסכימות של הטבלאות הבסיסיות. כך תוכלו ליצור ולהריץ שאילתות SQL בלי לכתוב את הקוד באופן ידני.

כשמגדירים את השאילתות, אפשר להשתמש בסוכני נתונים כדי לספק מילוני מונחים עסקיים והוראות למערכת, וכך לשפר את הדיוק.

איך פועל ניתוח נתונים של שיחות

ניתוח נתונים בממשק שיחה משתמש במודלים גדולים של שפה (LLM) כדי להבין את השאלות שלכם בשפה טבעית ולמפות אותן לסכימה של הטבלאות. התהליך מתבצע באופן הבא:

  1. גילוי סכימה: המערכת מאחזרת מטא-נתונים מקטלוג זמן הריצה של Lakehouse כדי להבין את מבני הטבלאות, את שמות העמודות ואת סוגי הנתונים.
  2. יצירת SQL: מודל ה-LLM יוצר שאילתת SQL שתואמת למנוע BigQuery ולפורמט הנתונים הבסיסי.
  3. ביצוע: מערכת BigQuery מריצה את שאילתת ה-SQL שנוצרה ישירות על הנתונים בפורמט הפתוח ב-Lakehouse של Google Cloud.
  4. תשובה: התוצאות מוחזרות לממשק השיחה, ולרוב מלוות בסיכום או בהדמיה.

מידע נוסף על ניתוח נתונים בשיחה, כמו ניהול סוכני נתונים, תמחור או שיטות מומלצות, זמין במאמר סקירה כללית של ניתוח נתונים בשיחה.

פורמטים נתמכים

ניתוח שיחות מתרגם את השאלות שלכם בשפה טבעית לשאילתות SQL. הוא תומך בפורמטים של טבלאות פתוחות שנתמכים על ידי קטלוג זמן הריצה של Lakehouse, כמו טבלאות Apache Iceberg.

לפני שמתחילים

כדי לשלוח שאילתות על הנתונים, צריך לרשום את הטבלאות החיצוניות בקטלוג של זמן הריצה של Lakehouse. קטלוג זמן הריצה של Lakehouse משמש כמרכז מאוחד שמקשר את BigQuery Studio לנתונים חיצוניים בפורמט פתוח. אחרי הקישור, הטבלאות הופכות לנכסים שאפשר לגלות ב-BigQuery.

שליחת שאילתות לטבלאות באמצעות ניתוח נתונים בשיחה

  1. במסוף Google Cloud , עוברים אל BigQuery Studio Agents Hub.

    כניסה ל-Agents Hub

  2. יוצרים סוכן נתונים או מתחילים שיחה ישירה עם סוכן נתונים קיים.

  3. בוחרים את הטבלאות.

    מכיוון שקטלוג זמן הריצה של Lakehouse מאחד את כל הפורמטים השונים האלה, חוויית הגילוי זהה לחיפוש טבלאות רגילות ב-BigQuery.

    1. חיפוש: כשמוסיפים את מקור הידע, מחפשים את שמות הטבלאות בממשק החיפוש והבחירה של הטבלאות. אפשר להשתמש במילות מפתח לחיפוש כדי לסנן את התוצאות, כולל:

      • TABLE_NAME
      • catalog: CATALOG_NAME
      • project: PROJECT_ID
      • namespace: NAMESPACE_NAME
    2. אימות המקור: שימו לב לחלק של מערך הנתונים בשם המלא. בדרך כלל, הטבלאות שנוצרו על ידי מקורות חיצוניים ומנוהלות על ידי קטלוג ייעודי לזמן ריצה של Lakehouse יהיו בפורמט שמשלב את הקטלוג ואת מרחב השמות. לדוגמה: PROJECT_ID.biglake_catalog.finance_namespace.my_iceberg_table או PROJECT_ID.sap_catalog.sales.delta_table.

    3. בחירה: הוספת הטבלה שנבחרה להקשר הפעיל של השיחה.

  4. לשאול שאלות בשפה טבעית. המערכת מתרגמת אוטומטית את ההנחיה לשאילתת SQL מאוחדת.

שיפור הדיוק של השאילתות

כדי לעזור לניתוח שיחות להבין טוב יותר את הסכימות והטרמינולוגיה שלכם, אפשר להשתמש באפשרויות ההגדרה של סוכן הנתונים. האפשרויות האלה כוללות מילוני מונחים עסקיים, שאילתות SQL מאומתות והוראות מערכת.

המאמרים הבאים