Knowledge Catalog (לשעבר Dataplex Universal Catalog) מאפשר לכם לגלות ולאנדקס באופן אוטומטי מבנים טכניים, הקשר עסקי, מדדים של איכות נתונים ויחסים תפעוליים בכל נכסי הנתונים המבוזרים שלכם. ב-Knowledge Catalog, המטא-נתונים האלה מאורגנים במטא-מודל גמיש וניתן להרחבה ובגרף הקשר הפעיל, שעוזרים לכם לנהל נכסי נתונים ולבסס סוכני AI גנרטיביים.
מטא-מודל של Knowledge Catalog
מטא-מודל Knowledge Catalog מספק ניהול מאוחד ומובנה של מטא-נתונים, ומבסס את הבסיס המבני של Active Context Graph בתוך Agentic Data Cloud של Google. גרף ההקשר הזה עוזר לכם ולצוותי הנתונים שלכם לגלות ולנהל נכסים, ומאפשר לסוכני AI גנרטיבי לאחזר הקשר עסקי מהימן ומבוסס.
ב-Knowledge Catalog, המטא-נתונים מאורגנים באמצעות היררכיה מודולרית של קונטיינרים, נכסים, סכימות ויחסים:
- מאגרים ונכסים: קבוצות של רשומות מארגנות רשומות, שמייצגות נכסי נתונים בודדים ועמודות סכימה שלהם.
- העשרה מובנית: סוגי מאפיינים מגדירים סכימות למאפיינים, שמצרפים מטא-נתונים מובְנים לרשומות, לעמודות או לקשרים.
- תקנים וניהול: סוגי רשומות מגדירים תבניות שמחילות היבטים נדרשים על רשומות.
- קשרים: סוגי קישורים לרשומות מגדירים קשרים (קישורים לרשומות) שמקשרים בין רשומות קשורות ומונחים עסקיים.
בטבלה הבאה מפורטים ההבדלים בין משאבים שמנוהלים על ידי המערכת (שמסופקים באופן אוטומטי על ידי Google Cloud) לבין משאבים מותאמים אישית שהוגדרו על ידי המשתמש:
| רכיב מטא-מודל | מנוהל על ידי המערכת (מובנה) | בהגדרת משתמש (בהתאמה אישית) |
|---|---|---|
| קבוצות של נקודות כניסה | מוגדר מראש לכל פרויקט עבור Google Cloud שירותים (לדוגמה, @bigquery, @spanner, @pubsub). |
נוצר על ידי משתמשים כדי לקבץ ולנהל נכסי נתונים מותאמים אישית והרשאות. |
| רשומות | מאוכלסים אוטומטית ממקורות Google Cloud (כמו טבלאות, תצוגות, מערכי נתונים ומודלים של BigQuery). | נוצר על ידי משתמשים כדי לייצג מקורות נתונים, קבצים או מסדי נתונים של צד שלישי בהתאמה אישית. |
| סוגי היבטים | תבניות מערכת מוגדרות מראש (לדוגמה, Schema, Overview, Contacts, DataQuality, Lineage). |
נוצר על ידי משתמשים כדי להגדיר סכימות של מטא-נתונים ספציפיים לדומיין (כמו סיווג של פרטים אישיים מזהים או רמות של הסכם רמת שירות). |
| היבטים | מאוכלס באופן אוטומטי ממערכות מקור, מיומני שאילתות או מסריקות אוטומטיות. | נוצר על ידי משתמשים, צינורות או סוכנים ומצורף לרשומות, לעמודות או לקישורי רשומות. |
| סוגי רשומות | תבניות מוגדרות מראש שמייצגות Google Cloud סוגי משאבים. | מוגדר על ידי משתמשים כדי לציין היבטים חובה ואופציונליים של נכסי נתונים מותאמים אישית. |
| קישורים לדף הנחיתה | סוגי קשרים מובנים (כמו synonym, definition, schema-join, related). |
מופעים שנוצרו בין רשומות או עמודות ספציפיות כדי ליצור מודל של חיבורים בין מערכות. |
בקטעים הבאים מתוארים הרכיבים העיקריים שמרכיבים את מטא-מודל של Knowledge Catalog.
קבוצות של רשומות
קבוצת רשומות (EntryGroup) היא מאגר אזורי של רשומות וקישורים לרשומות, שמשמש כגבול אדמיניסטרטיבי ואבטחתי לניהול המשאבים האלה.
אפשר להשתמש בקבוצות של רשומות כדי להגדיר את הדברים הבאים:
- בקרת גישה לניהול זהויות והרשאות גישה (IAM): אפשר לתת הרשאות צפייה או עריכה לצוותים ספציפיים בקבוצת רשומות בלי לשנות את ההרשאות של רשומות בודדות.
- שיוך למיקום ולפרויקט: קיבוץ נכסים לפי אזור גיאוגרפי ובעלות על פרויקט.
במקורות Google Cloud , Knowledge Catalog יוצר באופן אוטומטי קבוצות של רשומות מערכת לכל פרויקט (למשל, @bigquery או @spanner). במקורות נתונים מותאמים אישית, אתם יוצרים קבוצות של רשומות בהתאמה אישית.
לדוגמה, צוות הכספים יכול ליצור קבוצה של רשומות בהתאמה אישית בשם production_finance_data כדי לנהל את הרשאות הגישה לכל הרשומות בהתאמה אישית שקשורות לכספים במקום אחד.
מידע נוסף זמין במאמר בנושא קבוצות של רשומות.
רשומות ונתיבי סכימה
רשומה (Entry) מייצגת נכס נתונים יחיד. רשומה יכולה לייצג טבלה מובנית של מסד נתונים, מודל אנליטי, טבלה לא מובנית של אובייקט או מערך נתונים חיצוני מותאם אישית.
הרכיבים העיקריים של רשומה כוללים את הפרטים הבאים:
- מזהה הרשומה: שם משאב ייחודי בתוך קבוצת הרשומות הראשית שלו.
- סוג הרשומה: התבנית שמגדירה את המבנה של הרשומה ואת ההיבטים הנדרשים.
- מאפיינים: מאפייני מטא-נתונים מובְנים שמצורפים לרשומה.
- נתיבי סכימה (עמודות): חלקים או שדות ספציפיים בנכס הנתונים, כמו טבלה ב-BigQuery או שדה בסכימת JSON.
בעזרת עמודות אפשר לצרף מטא-נתונים לשדות ספציפיים בנכס. אתם לא מגדירים עמודות באופן ידני, הן מתמלאות כשמצרפים רכיב מסוג schema לרשומה. אפשר להפנות לשדות מוטמעים באמצעות נתיבים עם סימון נקודות (לדוגמה, customer.address.postal_code).
לדוגמה, טבלה ב-BigQuery בשם orders_project.sales.customer_orders מיוצגת כרשומה. כדי לתאר את השדה email_address בטבלה ככזה שמכיל מידע רגיש, מצמידים מאפיין סיווג ישירות לנתיב העמודה email_address.
מידע נוסף זמין במאמר בנושא רשומות.
סוגי היחסים
סוג היבט (AspectType) הוא תבנית סכימה לשימוש חוזר שמגדירה את השדות, סוגי הנתונים וכללי האימות של היבט. כל היבט הוא מופע של סוג היבט.
סוגי ההיבטים יכולים להיות מוגדרים על ידי המערכת (מסופקים על ידי Google Cloud) או מותאמים אישית (נוצרים על ידי הארגון שלכם).
כשמגדירים את metadata_template לסוג מאפיין מותאם אישית, אפשר להשתמש בסוגי הנתונים הנתמכים הבאים:
| סוג הנתונים של השדה | תיאור | תרחיש שימוש לדוגמה |
|---|---|---|
string |
ערך טקסט (UTF-8). | כתובת האימייל של הבעלים, תווית סיווג הנתונים, שם המחלקה. |
integer / number |
ערכים מספריים (מספרים שלמים או מספרים בשיטת נקודה צפה). | מספר הימים לשמירת הנתונים, אחוז היעד של הסכם רמת השירות (SLA), דירוג העדיפות. |
boolean |
דגל אמיתי או דגל שקר. | contains_pii: true, is_certified: false. |
enum |
רשימה מוגדרת מראש של ערכי מחרוזת מותרים. | סביבה: ["DEV", "STAGING", "PROD"]. |
datetime / timestamp |
תאריך ושעה בפורמט ISO 8601. | התאריך האחרון שבו קיבלת אישור, המועד האחרון לבדיקת התאימות. |
record |
אובייקט מקונן ומובנה שמכיל שדות צאצא. | ContactInfo { name: string, email: string, phone: string }. |
array |
רשימה של ערכים חוזרים מכל סוג פרימיטיבי או סוג רשומה. | רשימה של בעלי נתונים משניים: ["user1@example.com", "user2@example.com"]. |
map |
צמדים של מחרוזות מפתח/ערך למאפיינים שניתנים להרחבה. | תגי פריסה בהתאמה אישית: {"cost_center": "1042", "tier": "gold"}. |
לדוגמה, כדי להגדיר תבנית לשימוש חוזר לפרטים ליצירת קשר, אפשר ליצור סוג מאפיין בשם ContactInfo עם שדות לowner_name (string), email (string) ו-support_channel (string).
מידע נוסף זמין במאמר בנושא סוגי היבטים.
היבטים
אספקט (Aspect) הוא קבוצה של שדות מטא-נתונים קשורים שתואמים לסוג אספקט. המאפיינים מצורפים לרשומה, לנתיב של רשומה (עמודה) או לקישור של רשומה כדי לתאר את המשאב הזה.
בניגוד למערכות תיוג מדור קודם, ההיבטים ב-Knowledge Catalog מוכללים ישירות ברשומות האב או בקישורי הרשומות שלהם, מה שמאפשר לכם לבצע פעולות אטומיות של קריאה וכתיבה.
היבטים משמשים בכמה פונקציות:
- מבנה טכני: ההיבט
Schemaמתאר עמודות בטבלה, סוגי נתונים ותיאורים. - הקשר עסקי: היבטים מותאמים אישית מתארים בעלות, תאימות וסטטוס מחזור החיים.
- אמינות תפעולית: היבטים של איכות הנתונים מתעדים תוצאות של סריקת כללים אוטומטית וציוני אימות.
- גרפים של ישויות לא מובְנים: ההיבט
GraphProfileמתעד ישויות שחולצו על ידי AI וקצוות של קשרים מקבצים גולמיים.
לדוגמה, אפשר ליצור מופע של סוג ההיבט ContactInfo עם הערכים {"owner_name": "Alex", "email": "alex@example.com"} ולצרף אותו לרשומה customer_orders.
מידע נוסף מופיע במאמר בנושא היבטים.
סוגי רשומות
סוג רשומה (EntryType) הוא תבנית ניהול ליצירת רשומות בהתאמה אישית. הוא אוכף סטנדרטים של איכות מטא-נתונים על ידי הגדרת סוגי ההיבטים הנדרשים שצריך לצרף לרשומה מסוג מסוים.
כשיוצרים רשומה מסוג רשומה ספציפי, Knowledge Catalog מוודא שכל סוגי ההיבטים שמסומנים ב-required בסוג הרשומה קיימים ותקינים.
לדוגמה, אפשר ליצור סוג רשומה בשם CertifiedDataProduct
שמציין את סוגי ההיבטים OwnerInfo ו-DataRetentionPolicy כסוגים נדרשים. כל רשומה חדשה שנוצרת עם סוג הרשומה הזה חייבת לכלול את ההיבטים האלה כדי שתוכלו לשמור אותה.
מידע נוסף זמין במאמר בנושא סוגי רשומות.
קישורי כניסה וסוגי קישורי כניסה
קישור כניסה (EntryLink) יוצר קשר סמנטי בין שני רשומות נתונים או בין עמודות ספציפיות ברשומות. כל קישור לכניסה הוא מופע של סוג קישור לכניסה (EntryLinkType).
קישורים לכניסה יכולים להיות מכוונים או לא מכוונים:
- סימטרי (לא מכוון): קשרים שבהם שני הצדדים הם עמיתים (לדוגמה,
synonym,relatedאוschema-join). - אסימטרי (מכוון): קשרים עם מקור ויעד מפורשים (לדוגמה,
definition, קישור מונח במילון מונחים עסקי לעמודה בטבלה).
אפשר גם לצרף היבטים ישירות לקישורים של רשומות (חוץ מקישורים מסוג schema-join
). כך תוכלו לתאר את הקשר עצמו, למשל לתעד ציוני מהימנות של הצטרפות, כללי טרנספורמציה או הערות מיפוי.
Knowledge Catalog תומך בסוגים הבאים של קישורי כניסה מובנים:
-
synonym: קישור בין מושגים עסקיים מקבילים או בין מונחים חלופיים. -
related: חיבור נכסים עם צימוד רופף בין מערכות. -
definition: מקשר בין הגדרות במילון המונחים הארגוני לבין עמודות או רשומות פיזיות. -
schema-join: מחבר בין טבלאות שאפשר לבצע בהן הצטרפות לאורך נתיבי מפתח זר או סכימה תואמים.
מידע נוסף זמין במאמר EntryLinks REST reference.
מילוני מונחים ארגוניים
מילון המונחים הארגוני מאפשר לכם ליצור טקסונומיה עסקית רשמית על ידי הגדרת מילוני מונחים, קטגוריות ומונחים עסקיים.
באמצעות קישורי כניסה מהסוגים definition או synonym, אפשר למפות מונחים עסקיים ישירות לערכים פיזיים ולנתיבי עמודות. כשמשתמשים או סוכני AI מחפשים בקטלוג באמצעות שפה טבעית, מנוע החיפוש מפענח את המונחים העסקיים האלה כדי לאתר את נכסי הנתונים הפיזיים הנכונים.
מידע נוסף זמין במאמר בנושא ניהול מילוני מונחים עסקיים.
מקורות נתמכים Google Cloud
מערכת Knowledge Catalog בולעת באופן אוטומטי מטא-נתונים מהמקורות הבאים:Google Cloud בשירותים מסוימים, כמו AlloyDB ל-PostgreSQL ו-Cloud SQL, צריך קודם להפעיל את השילוב של Knowledge Catalog לפני שאפשר להטמיע מטא-נתונים:
Analytics ו-lakehouse
- מערכי נתונים, טבלאות, תצוגות, מודלים, שגרות, חיבורים, מערכי נתונים מקושרים וגרפים ב-BigQuery (גרסת Preview)
- שיתוף ב-BigQuery (לשעבר Analytics Hub) – חילופי נתונים ורישומים
- מאגרי Dataform ונכסי קוד
- שירותים, מסדי נתונים וטבלאות של Dataproc Metastore
טבלאות בקטלוג REST של Iceberg (כולל Google Cloud קטלוג ייעודי לזמן ריצה של Lakehouse IRC, Databricks Unity IRC, AWS Glue Data Catalog IRC ו-Snowflake Horizon IRC)
טבלאות Apache Hive
טבלאות Delta Lake ב-SAP Business Data Cloud (BDC)
טבלאות Apache Iceberg שמנוהלות על ידי קטלוג זמן הריצה של Lakehouse
AI ולמידת מכונה
- מודלים, מערכי נתונים, קבוצות תכונות, תצוגות תכונות ומופעים של חנות אונליין ב-Vertex AI
בינה עסקית
- מכונות, מרכזי בקרה, רכיבים של מרכזי בקרה, תצוגות, פרויקטים של LookML, מודלים, ניתוחים ותצוגות ב-Looker (Google Cloud Core) (תצוגה מקדימה)
מסדי נתונים
- מופעים, אשכולות וטבלאות של Bigtable (כולל פרטים על משפחות עמודות)
- מכונות, מסדי נתונים, טבלאות ותצוגות של Spanner
סטרימינג והעברת הודעות
- נושאי Pub/Sub
נתונים לא מובְנים
מסדי נתונים תפעוליים
- אשכולות, מכונות, מסדי נתונים, סכימות, טבלאות ותצוגות (תצוגה מקדימה) של AlloyDB ל-PostgreSQL. Knowledge Catalog מאחזר מטא-נתונים רק ממופעים ראשיים של AlloyDB ולא ממופעים משוכפלים לקריאה. מידע נוסף זמין במאמר בנושא ניהול משאבי AlloyDB ל-PostgreSQL באמצעות Knowledge Catalog.
- מכונות, מסדי נתונים, סכימות, טבלאות ותצוגות של Cloud SQL. Knowledge Catalog מאחזר מטא-נתונים רק ממכונות ראשיות של Cloud SQL ולא ממכונות לקריאה בלבד. מידע נוסף מופיע במאמר ניהול משאבי Cloud SQL באמצעות Knowledge Catalog.
כדי לייבא מטא-נתונים ממקור של צד שלישי אל Knowledge Catalog, אפשר להשתמש במחברים של Knowledge Catalog או בצינור קישוריות מנוהל. מידע נוסף זמין במאמרים מידע על מחברים של Knowledge Catalog וסקירה כללית על קישוריות מנוהלת.
אילוצים של פרויקטים ומיקומים
משאבי הקטלוג ב-Knowledge Catalog מאוחסנים בפרויקטים ובמיקומים גיאוגרפיים ספציפיים ב- Google Cloud . ההגבלות הבאות חלות על היקף ההרשאות:
| משאב | כלל מיקום | כלל פרויקט |
|---|---|---|
| רשומות | המיקום של הרשומה חייב להיות זהה למיקום של EntryType שלה,
או שEntryType חייב להיות global. |
אפשר להפנות לסוגי רשומות גלובליים או לסוגי רשומות באותו פרויקט. |
| היבטים ברשומות | הערך של המאפיין AspectType צריך להיות מאוחסן באותו מיקום שבו מאוחסנת הרשומה, או שהערך של AspectType צריך להיות global. |
אפשר להפנות לסוגי היבטים גלובליים או כאלה ששייכים לאותו פרויקט. |
| קישורים לדף הנחיתה | המיקום של קישור הכניסה חייב להיות זהה לערך EntryLinkType שלו, או
שערך EntryLinkType חייב להיות global. |
אפשר לקשר רשומות שנמצאות בפרויקטים שונים באותו ארגון. |
| סוגי רשומות | מורכב מסוגי מאפיינים שמאוחסנים באותו מיקום כמו סוג הרשומה, או מסוגי מאפיינים שהם global. |
אם סוג רשומה מפנה לסוגי היבטים בהתאמה אישית, סוגי ההיבטים צריכים להיות באותו פרויקט ובאותו מיקום. |
פידים של שינויים במטא-נתונים
אפשר להשתמש בפידים של שינויים במטא-נתונים כדי להזרים אירועים של שינויים במטא-נתונים ב-Knowledge Catalog כמעט בזמן אמת.
פיד של שינויים במטא-נתונים מפרסם התראות לגבי יצירה, עדכון או מחיקה של רשומות בנושא Pub/Sub שהגדרתם. לקוחות שרשומים כמנויים יכולים להשתמש באירועים האלה כדי להפוך תהליכי עבודה תפעוליים לאוטומטיים, כמו הפעלה של הערכות איכות נתונים כשסכימה משתנה או עדכון של לוחות בקרה של ניהול נתונים במורד הזרם.
מידע נוסף זמין במאמר מידע על פידים של שינויים במטא-נתונים.
תמחור
ב-Knowledge Catalog, החיוב על נפח המטא-נתונים המאוחסן מתבצע לפי מק"ט האחסון של המטא-נתונים. מידע נוסף מופיע במאמר בנושא תמחור של Knowledge Catalog.
אין חיובים על הפעולות הבאות:
- יצירה וניהול של משאבי מטא-מודל של קטלוג (סוגי רשומות, סוגי היבטים, קבוצות רשומות, רשומות וקישורי רשומות).
- קריאות ל-Search API ושאילתות חיפוש שבוצעו במסוף Google Cloud .
המאמרים הבאים
הוספת מטא-נתונים לטבלה
איתור נכסים וצירוף מטא-נתונים של היבטים בהתאמה אישית לטבלה ב-BigQuery.
הוספת מקורות נתונים בהתאמה אישית
הגדרת סוגי רשומות והוספת מטא-נתונים מותאמים אישית ממסדי נתונים ומצינורות חיצוניים.
ניהול מילוני מונחים עסקיים
ליצור טקסונומיה עסקית ולמפות מונחים ישירות לטבלאות ולעמודות פיזיות.
חיפוש נכסים וגילוי נכסים
איתור משאבים ב-Google Cloud ובמקורות מותאמים אישית באמצעות פרדיקטים של חיפוש.
אחזור הקשר לסוכני AI
אחזור מטא-נתונים מוכנים לשימוש במודלים גדולים של שפה (LLM) והקשר פעיל כדי להנחות סוכני AI גנרטיבי.
מעבר מ-Data Catalog
העברת תבניות תגים, רשומות בהתאמה אישית ותהליכי עבודה אל Knowledge Catalog.