הדאטה שלכם לא מוכנה ל-AI: מדריך העומק לתשתית נתונים לפני מודל תמהיל, ניבוי, וסוכנים אוטונומיים

שישים אחוז. זה שיעור פרויקטי ה-AI שגרטנר צופה שארגונים ינטשו עד סוף 2026, לא בגלל שהמודל היה גרוע, אלא בגלל שהדאטה מתחתיו לא היה ברמה שהמודל דרש. הסקר, שכלל 1,203 מנהלי דאטה ונאסף ביולי 2024, מצא ש-63% מהארגונים מודים שאין להם ניהול נתונים מתאים ל-AI, או שהם לא בטוחים שיש. זה לא סטטיסטיקה כללית על תעשיית הטכנולוגיה. זה תיאור מדויק של מה שקורה כשצוות שיווק בישראל מזמין מודל תמהיל מדיה או סוכן ניבוי, ומגלה אחרי שבועות עבודה שהתוצאה לא אמינה כי אף אחד לא בדק את הדאטה לפני שהתחילו.
למה פרויקטים נכשלים בשכבת הדאטה, הרבה לפני שהם מגיעים למודל
הטעות הנפוצה היא לחשוב שכשמודל AI נותן תוצאה מוזרה, הבעיה היא באלגוריתם. לפי הבדיקה שעשינו מול צוותי שיווק שרצו להטמיע מודל תמהיל מדיה או ניבוי, ברוב המקרים הבעיה מתגלה שלוש שכבות מתחת למודל, בדאטה שמזין אותו. סקר Adverity שפורסם בספטמבר 2025, בקרב 200 מנהלי שיווק בארה"ב, בריטניה, גרמניה, אוסטריה ושוויץ, מצא ש-45% מהדאטה שמשמש להחלטות עסקיות חלקי, שגוי או מיושן. מה שמעניין הוא ש-85% מהמנהלים באותו סקר הביעו אמון בדאטה שלהם, בזמן ש-43% מהם מודים בפועל שפחות מחצי מהדאטה שלהם ראוי לאמון. הפער הזה בין מה שצוותי שיווק חושבים שיש להם לבין מה שבאמת יש להם, הוא הסיבה המספר אחת לכישלון פרויקטי AI.
שלוש בעיות ספציפיות חוזרות שוב ושוב:
- מקורות מפוזרים בלי גשר ביניהם: נתוני מדיה יושבים ב-Meta Ads Manager, נתוני אתר ב-, נתוני מכירות ב-CRM, ונתוני שיחות טלפון במערכת נפרדת לגמרי. כל מערכת מדווחת מספר אחר לאותו קמפיין, ואף אחד לא בונה שכבת חיבור ביניהן לפני שמזינים דאטה למודל.
- אין זהות לקוח אחידה בין ערוצים: בלי identity resolution, אותו אדם שנחשף למודעה בפייסבוק, חיפש בגוגל, ואז קנה בחנות הפיזית, נראה למודל כמו שלושה אנשים שונים. מודל תמהיל מדיה שמזין אותו את הנתונים האלה בונה מסקנות שגויות על תרומת כל ערוץ, כי הוא פשוט לא רואה את המסע המלא.
- ייצוא ברמת סיכום במקום ברמת אירוע: הרבה צוותים מייצאים דוח יומי מסוכם מכל פלטפורמה, במקום את הנתונים הגולמיים ברמת האירוע הבודד. מודל ניבוי או סוכן אוטונומי שעובד על נתונים מסוכמים כבר איבד את הפרטים שהיו יכולים להסביר למה קמפיין מסוים עבד או לא עבד.
גם בעולם הסוכנים האוטונומיים התמונה דומה. ניתוח של MarTech על נתוני Gartner מ-2025 מצא ש-81% מהארגונים כבר מריצים פיילוט או שימוש פעיל בסוכני AI, ו-89% מצפים לתועלת עסקית משמעותית. אבל 45% מדווחים שהסוכן שקיבלו מהספק לא מספק את הביצועים שהובטחו, ו-50% מהמובילים מציינים פערי תשתית כגורם המרכזי. גרטנר צפתה שעד 2026, 40% מהאפליקציות הארגוניות יכללו ייעודי, אבל בפועל הנתון עמד על פחות מ-5% ב-2025. הפער הזה לא נובע מחוסר יכולת של הסוכנים. הוא נובע מכך שהסוכנים מקבלים גישה לדאטה שלא היה מוכן לשאלות שהם מנסים לענות עליהן.
ארבעה מימדי איכות דאטה שקובעים אם המודל בכלל יעבוד
לפני שמסיקים מסקנות מכל מודל שמבוסס AI, שווה להסתכל על ארבעה מימדי איכות שספציפית קריטיים כשמודל, ולא אדם, קורא את הדאטה. אדם יכול להבחין אינטואיטיבית שמשהו לא הגיוני בדוח ולעצור. מודל לא עוצר, הוא פשוט מייצר תוצאה על בסיס מה שקיבל, גם אם זה שגוי.
- שלמות: חוסר בשדות קריטיים, כמו מזהה קמפיין חסר או ערך ריק, לא נעלם כשמזינים אותו למודל. הוא הופך להטיה שיטתית. אם 20% מהעסקאות שלכם חסרות ייחוס מקור, המודל לא "מתעלם" מהן, הוא מייחס אותן בטעות לערוץ הזול ביותר או האחרון בנתיב, ומעוות את כל תמונת התרומה.
- עקביות timestamp וזמן: כשמערכת אחת רושמת אירועים לפי UTC ואחרת לפי שעון ישראל, מודל שמנסה לחבר אירוע פרסום לאירוע המרה מפספס את הסדר הכרונולוגי הנכון. זה נשמע כמו פרט טכני קטן, אבל בפועל זו הסיבה הנפוצה ביותר לכך שמודלי ניבוי מבוססים על GA4 נותנים תוצאות לא עקביות בין ריצות.
- טקסונומיית שמות קמפיינים אחידה: אם קמפיין אחד נקרא "קיץ_2026_מכירה" ובחודש הבא "Summer Sale 26", מודל שמנסה לזהות דפוסים חוזרים בין תקופות פשוט לא יודע שמדובר באותה משפחת קמפיינים. בלי מוסכמת שמות קבועה, כל ניתוח היסטורי שהמודל מנסה לבצע נשבר.
- גרנולריות, אירוע מול סיכום: מודל תמהיל מדיה טוב צריך לראות דפוסים ברמת היום והשעה, לא רק סיכום שבועי. כשהדאטה כבר מגיע מסוכם, המודל מאבד את היכולת לזהות אפקטים כמו עייפות קהל או תזמון פרסום אופטימלי, שדורשים רזולוציה גבוהה בהרבה מדוח סיכום.
זה עובד, אבל בתנאים האלה בלבד: המודל, יהיה מדויק ככל שיהיה, לא יכול לתקן דאטה חסר, לא עקבי, או ברזולוציה נמוכה מדי. הוא יכול רק לעבד את מה שהוא מקבל.
תשתית בסיסית שכל צוות שיווק בינוני יכול לבנות
הבשורה הטובה היא שתשתית דאטה מוכנה ל-AI לא דורשת צוות הנדסה של עשרות אנשים. לפי הבדיקה שעשינו מול צוותים בגודל בינוני בישראל, ארבעה רכיבים בסיסיים מספיקים כדי לעבור מ"דאטה מפוזר" ל"דאטה שאפשר להאכיל מודל".
הראשון הוא ייצוא GA4 ל-BigQuery. בניגוד לממשק הרגיל של GA4 שמציג נתונים מסוכמים ומוגבלים על ידי דגימה, הייצוא ל-BigQuery מעביר כל אירוע גולמי, ברמת המשתמש הבודד, בלי הגבלת דגימה. זו נקודת ההתחלה לכל מודל שדורש רזולוציה גבוהה, בין אם זה מודל תמהיל מדיה או קהלים חזויים. מי שרוצה להבין את הפער בין הממשק לנתונים הגולמיים כדאי שיקרא את GA4 למשווק: המדריך השלם, שמפרק את זה לעומק.
השני הוא תהליך ELT פשוט, לא מורכב. לא צריך פלטפורמת אינטגרציה יקרה כדי להתחיל. תהליך שמושך נתונים ממקורות המדיה העיקריים, טוען אותם לטבלה מרכזית ב-BigQuery, וממיר שמות שדות למבנה אחיד, כבר פותר חלק ניכר מבעיית הפיזור. השלישי הוא איסוף first-party data מכוון, לא אגבי. כל טופס, כל התחברות, כל אינטראקציה בצ'אט, צריכה להישמר עם מזהה שמאפשר לחבר אותה בהמשך למקורות אחרים. זה הבסיס שממנו נבנית זהות לקוח אחידה בין ערוצים, נושא שמורחב עליו Attribution בעידן Post-Cookie.
הרכיב הרביעי, ולעיתים המוזנח ביותר, הוא server-side tagging כמקור דאטה, לא רק ככלי פרטיות. רוב הצוותים שמיישמים tagging בצד השרת עושים את זה כדי לעקוף חסימות דפדפן. זה תפקיד לגיטימי, אבל הוא לא התפקיד המרכזי. tagging בצד השרת נותן שליטה על אילו שדות נשלחים, באיזה פורמט, ובאיזו עקביות, מה שהופך אותו לנקודת האכיפה הטבעית של טקסונומיה אחידה ושלמות נתונים. הפרטים המעשיים על איך לבנות את זה נכון נמצאים בServer-side tracking ב-2026.
שכבת הממשל שמונעת מסוכן AI לדמיין נתונים ישנים
ניתוח MarTech שהתפרסם ב-2026 על מגמות identity resolution מציין שברוב הארגונים המדיניות לגבי גישה לדאטה נכתבת רק אחרי שמשהו כבר השתבש, לא לפני. זו בעיה קטנה כשמדובר באדם שמסתכל על דוח. זו בעיה גדולה כשמדובר בסוכן AI אוטונומי שמקבל הרשאה לשלוף נתונים בעצמו ולקבל החלטות על בסיסם.
הסוכן לא יודע להבחין בין הטבלה העדכנית לבין עותק ישן ממנה ששכח מישהו למחוק. הוא לא יודע שקמפיין מסוים סומן כטסט פנימי ולא כתקציב אמיתי. בלי שכבת ממשל מסודרת, סוכן AI שמקבל שאלה על ביצועי קמפיין עלול לשלוף מהטבלה הלא נכונה ולייצר תשובה שנשמעת סמכותית לגמרי ומבוססת על נתונים שגויים. זו לא תקלה טכנית, זו תוצאה ישירה של תשתית שלא נבנתה עם המחשבה שסוכן, ולא אדם, יגיע לשם.
שלושה רכיבי ממשל שצריך להטמיע לפני שנותנים לכל מודל או סוכן גישה לדאטה השיווקי:
- תיעוד דאטה שמישהו באמת מתחזק: לכל טבלה מרכזית צריך להיות מסמך שמסביר מה המקור שלה, מתי היא מתעדכנת, ומי אחראי עליה. בלי זה, גם צוות אנושי טועה בין טבלה נכונה לטבלה ישנה, וסוכן AI טועה הרבה יותר, כי הוא לא מרגיש חוסר ודאות.
- בקרת גישה לפי תפקיד, לא גישה גורפת: סוכן שמריץ ניתוחי ביצועים לא צריך גישה לטבלאות גלם לא מעובדות, בדיוק כמו שאנליסט זוטר לא מקבל הרשאת עריכה למקור האמת. הגבלת הגישה מקטינה את הסיכוי שהסוכן ישלוף בטעות מהמקום הלא נכון.
- ניהול גרסאות לטבלאות ולמודלים: כשמישהו משנה את ההגדרה של "המרה" או מוסיף שדה חדש לטבלת הקמפיינים, צריך תיעוד ברור מתי זה קרה. בלי ניהול גרסאות, מודל שמאמן על נתונים משתי תקופות עם הגדרות שונות מייצר תוצאה שנראית תקינה אבל בעצם משווה תפוחים לתפוזים.
מה שמעניין הוא שהצוותים שכבר עברו את התהליך הזה מדווחים לא רק על אמון גבוה יותר בתוצאות המודל, אלא על פחות זמן שמושקע בבדיקת "למה המספר הזה מוזר", כי הבעיות שהיו יכולות לגרום למספר מוזר כבר טופלו קודם. הנושא הזה קשור ישירות לפער שכבר תועד באתר בין ארגונים שמצהירים על ערך מ-AI לבין אלה שמצליחים להוכיח אותו, נושא שמורחב ב75% אומרים ש-AI מייצר ערך, 7% מוכיחים.
צ'קליסט מוכנות: מה מריצים השבוע
לפני שמסיקים מסקנות ומזמינים פרויקט תמהיל מדיה או ניבוי, שווה להריץ בדיקה מהירה על הדאטה הקיים. זה לא פרויקט של חודשיים, זו רשימת בדיקות שאפשר להתחיל בה השבוע, ותוצג לצוות עד סוף החודש תמונה ברורה של איפה עומדים.
- מפו את כל מקורות הדאטה שמזינים החלטות שיווק: רשמו כל מערכת שנתונים ממנה משפיעים על תקציב או אסטרטגיה, כולל מערכות שנראות שוליות כמו טופס יצירת קשר או מערכת שירות לקוחות.
- בדקו שיעור השדות החסרים בטבלאות המרכזיות: שאילתה פשוטה שבודקת אחוז ערכים ריקים בשדות קריטיים כמו מקור, מדיום, וערך המרה, נותנת תמונה מהירה של רמת השלמות בפועל, לא הרמה שחושבים שיש.
- ודאו שכל המערכות רושמות timestamp באותו אזור זמן: בדיקה חד פעמית שיכולה לחסוך שבועות של ניתוח שגוי בהמשך, במיוחד כשמשלבים דאטה ממדיה, מ-CRM, ומאתר.
- אחדו את טקסונומיית שמות הקמפיינים לפני שממשיכים: קבעו מוסכמת שמות אחת לכל הצוות, ותעדו אותה במקום נגיש, כי ללא זה כל ניתוח היסטורי שמודל ינסה לבצע יתחיל מנקודת חולשה.
- ודאו שהייצוא הוא ברמת אירוע ולא ברמת סיכום בלבד: אם היום כל מה שיש הוא דוחות יומיים מסוכמים, זה הזמן להפעיל ייצוא גולמי, לפני שמתחילים לבנות מודל שדורש רזולוציה גבוהה.
הצ'קליסט הזה הוא בדיוק מה שצריך לעמוד לפני עבודת Marketing Mix Modeling שחזר ב-2026, שדורש נתוני מדיה עקביים לאורך תקופות ארוכות. הוא גם התנאי המקדים לכל ניתוח תרומה מצטברת אמין, כי בלי בסיס נתונים נקי, כל בדיקת השפעה שוליים בונה מסקנה על יסוד רעוע.
שאלות נפוצות
כמה זמן לוקח להכין דאטה שיווקי מוכן ל-AI?
תלוי בכמות המקורות, אבל צוות בינוני שמתחיל מהצ'כליסט הבסיסי יכול להגיע לרמת מוכנות סבירה תוך שישה עד שמונה שבועות. ההגדרה של הטקסונומיה ואיחוד ה-timestamp הם השלבים הכי מהירים, בניית ELT יציב ותהליכי governance לוקחים יותר זמן.
האם חייבים CDP כדי לבנות identity resolution?
לא בהכרח בשלב הראשון. אפשר להתחיל עם מזהה משתמש אחיד שמתועד בכל נקודת מגע, ולבנות עליו טבלת מיפוי ב-BigQuery. CDP הופך משתלם כשהמורכבות עולה, לא לפני שהבסיס קיים.
מה ההבדל בין דאטה מוכן ל-BI לדאטה מוכן ל-AI?
דוח BI סובל מדגימה, מסיכום, ומחוסר עקביות קטן, כי אדם שקורא אותו מפצה אינטואיטיבית. מודל AI לא מפצה, הוא לומד את ההטיה כאילו היא דפוס אמיתי. לכן דרישת הרזולוציה והעקביות למודל גבוהה משמעותית מדרישת דוח BI רגיל.
איך מזהים שסוכן AI מקבל החלטות על בסיס נתונים ישנים או כפולים?
הסימן הנפוץ הוא תשובות שסותרות זו את זו כשאותה שאלה נשאלת בשתי הזדמנויות שונות, או מספרים שלא מתיישבים עם דוח המקור. זה הזמן לבדוק את שכבת הממשל, לא את המודל עצמו.
מה עושים עם זה
לפני שמזמינים מודל תמהיל מדיה, ניבוי, או סוכן אוטונומי, תריצו את בדיקת השדות החסרים על טבלת הקמפיינים המרכזית שלכם השבוע. תוצאה מתחת ל-90% שלמות בשדות מקור, מדיום וערך המרה, אומרת שהפרויקט הבא צריך להתחיל בתיקון הדאטה, לא בבחירת ספק המודל. זו הפעולה הבודדת שחוסכת הכי הרבה זמן וכסף בהמשך.
📲 כל כתבה חדשה, ישר לטלגרם
בלי אלגוריתם ובלי פיד. עדכון אחד בערוץ בכל פעם שעולה כתבה.
5 עדכונים שחשוב לדעת + ניתוח אחד. אימייל אחד בשבוע, בלי ספאם.

