AEO רב-לשוני: למה מנוע ה-AI מצטט את הגרסה האנגלית של האתר שלכם ולא את העברית

Peec AI בדקה יותר מ-10 מיליון חיפושי ChatGPT ומצאה ש-43% משלבי המחקר עבור שאלות שאינן באנגלית מתבצעים דרך מקורות אנגליים, ו-78% מהשיחות הלא-אנגליות כוללות לפחות חיפוש משנה אחד באנגלית. זו לא תקלה נדירה. זו התנהגות ברירת מחדל. אם אתם מנהלים אתר עברי לצד גרסה אנגלית, או דומיין .com בנוסף ל-.co.il, הסיכוי הסביר הוא שכשמישהו שואל שאלה בעברית בתחום שלכם, ה-AI בונה את התשובה על בסיס תוכן אנגלי, לפעמים גם על תוכן אנגלי של מתחרה זר. לא באג. תוצאה צפויה של איך שהמערכות האלה בנויות.
למה AI בכלל בוחר באנגלית
שימו לב מה לא אומרים לכם בהצגות המכירה של כלי ה-: הבעיה לא מתחילה בשלב הציטוט. היא מתחילה בשלב החיפוש שקורה לפני הציטוט, ורוב האתרים הישראלים לא רואים אותו בכלל. כשמישהו שואל שאלה בעברית, המודל לא בהכרח מחפש רק בעברית. הוא מריץ ברקע שאילתות משנה, ולפי הנתונים של Peec AI חלק ניכר מהן יוצא באנגלית, כי שם נמצא נפח התוכן הגדול ביותר ואיתו רוב אותות הסמכות, קישורים נכנסים וציטוטים. אנגלית מהווה בערך מחצית מהתוכן באינטרנט, ולכן היא ברירת המחדל הבטוחה מבחינת המודל, גם כשהמשתמש כתב את השאלה בעברית מושלמת.
יש כאן גם שכבה שנייה, ופחות מדוברת: מודלי שפה גדולים מראים ביצועים חלשים יותר בשפות שאינן אנגלית, לא רק בגלל נפח האימון אלא גם בגלל איכות הפירוק (parsing) של תחביר ומורפולוגיה מורכבים, כפי שדווח ב-Nature בהקשר של הטיית מודלים לטובת אנגלית ויוזמות מקומיות שמנסות לתקן את זה. עברית, עם שורשים ומשקלים וכתיב חסר ניקוד, לא הופכת את המשימה לקלה יותר. זה לא אומר "וותרו". זה אומר שהתחלה מנקודת נחיתות מובנית, וכל טעות טכנית נוספת בצד שלכם רק מעמיקה אותה. וכאן מגיעה הנקודה שאתם לא רוצים לשמוע: אצל הרבה מותגים ישראלים, הגרסה העברית היא בפועל תרגום דליל של המקור האנגלי, לא מקור עצמאי. מבחינת המודל, זה בדיוק מה שזה נראה: תמצית, לא מסמך סמכותי. זה לא מדע. זו תצפית, אבל היא חוזרת על עצמה בכל אודיט שעשיתי.
hreflang: המנגנון שרוב האתרים הישראלים מפוצצים בלי לדעת
בכל פעם שיוצא כלי AEO חדש, מישהו מבטיח שהוא "יפתור" את בעיית השפה. בפועל, שום כלי לא יתקן hreflang שבור, כי זו לא בעיית תוכן, זו בעיית תשתית. hreflang אמור לומר למנועי חיפוש אילו גרסאות שפה קיימות ואיזו מתאימה לאיזה קהל, אבל התג הזה עובד רק אם הוא הדדי: כל גרסת שפה חייבת להצביע על כל שאר הגרסאות, כולל על עצמה, אחרת גוגל פשוט מתעלם ממנו, לפי התיעוד הרשמי של Google Search Central. באתרים ישראלים דו-לשוניים אני רואה שוב ושוב את אותן שלוש טעויות: קישור חד-כיווני מהעברית לאנגלית בלי קישור חוזר, x-default חסר לחלוטין כך שאין ברירת מחדל ברורה למשתמש שהשפה שלו לא זוהתה, וה-canonical של הדף העברי שמצביע בטעות לדף האנגלי כי מישהו העתיק תבנית מהאתר האנגלי ולא טרח לשנות אותה.
עכשיו, לפני שאתם רצים לתקן hreflang וחושבים שסגרתם את הפינה: הבדיקה של Glenn Gabe מדצמבר 2025 מראה ש-ChatGPT, Perplexity ו-Claude החזירו שוב ושוב את הגרסה האנגלית של אתרים גם כשהעדפת השפה של המשתמש הוגדרה במפורש לצרפתית או איטלקית, בעוד ש-Copilot ו-Gemini התפקדו טוב יותר כי הם רתומים למנועי Bing ו-Google בהתאמה. המסקנה שלו, ואני מסכימה איתה: hreflang עדיין קריטי לאינדוקס הקלאסי של גוגל ול- שיושב עליו, אבל אין הוכחה ברורה שמנועי AI עצמאיים כמו ChatGPT קוראים אותו ישירות בתור אות החלטה. זה נשמע טוב בפרזנטציה שאומרת "תקנו hreflang והציטוטים יחזרו". בפועל, hreflang הוא תנאי הכרחי, לא מספיק. מבנה כתובות ה-URL משפיע גם הוא: תת-תיקייה (aipulse.co.il/en/) עדיפה מבחינת איחוד סמכות דומיין על פני פרמטר (?lang=en) שרוב הכלים מתעלמים ממנו, ותת-דומיין (en.aipulse.co.il) נמצא באמצע, תלוי כמה קישורים חיצוניים הוא צובר בעצמו. למי שרוצה לרדת עוד רמה לתוך התשתית הזאת, יש אודיט Technical SEO מלא לאתר ישראלי בעידן ה-AI שמפרק את זה שלב אחר שלב.
דוגמה קטנה שממחישה את זה יותר טוב מכל הסבר תיאורטי: דף מוצר בעברית שמכריז hreflang="he-il" לעצמו ו-hreflang="en-us" לגרסה האנגלית, בזמן שדף המוצר האנגלי מכריז hreflang="en" בלי מדינה, בלי x-default כלל, ובלי קישור חזרה לעברית. מבחינת גוגל זה זוג שלא באמת מחובר, כי ההצהרות לא תואמות זו לזו במדויק. ראיתי את זה בערך בכל אתר שני שביקשתי לבדוק, כולל אתרים עם תקציב רציני, כי מי שבנה את זה לא בדק תוצאה, רק סימן וי על משימה.
Schema ו-inLanguage: התיוג שגוגל ו-AI בכלל טורחים לקרוא
הבעיה לא ב-hreflang לבד. הבעיה בזה שרוב האתרים מסתמכים רק עליו ומזניחים את השכבה המבנית שיושבת מתחתיו. תג inLanguage בתוך .org מסמן לכל צרכן מבני, כולל רובוטים שמפעילים מנועי AI, מהי שפת הדף בצורה חד-משמעית שלא תלויה בזיהוי אוטומטי של טקסט. דף עברי בלי inLanguage="he" ודף אנגלי בלי inLanguage="en" משאירים למודל לנחש, ולפי כל מה שראינו עד כה, כשהוא מנחש הוא נוטה לצד האנגלי. זה תיקון של כמה שורות קוד, לא פרויקט רבעוני, ואין סיבה טובה שהוא עדיין חסר ברוב האתרים הדו-לשוניים שבדקתי.
מעבר לזה, ה-Schema של הדף עצמו (Article, WebPage, FAQPage) צריך להתקיים בנפרד לכל גרסת שפה, עם url שמצביע נכון על עצמו ולא על הגרסה המקבילה. זו נקודה שמזלזלים בה כי היא לא נראית "אסטרטגית", אבל היא בדיוק מהסוג של דברים שמנועי AI כן קוראים בקלות כי הם מובנים מראש ולא דורשים פענוח שפה. אם עוד לא בניתם את השכבה הזאת נכון, יש מדריך Schema ו-Structured Data ל-AEO בעברית שכדאי לעבור עליו לפני שממשיכים הלאה.
ויש עוד פרט קטן שנשכח כמעט תמיד: כותרת ה-title tag וה-meta description צריכות להיות כתובות בשפת הדף, לא תרגום גוגל אוטומטי שהודבק ולא נבדק. אני נתקלת בזה הרבה יותר ממה שהייתי רוצה, כתובת עברית עם meta description באנגלית שברירת המחדל של מערכת הניהול יצרה. זה נראה כמו פרט קוסמטי, אבל זה עוד אות שאומר למודל: משהו כאן לא עקבי בשפה, תתייחס בזהירות.
כשהגרסה העברית קצרה מהאנגלית, אתם מפסידים לפני שהתחלתם
גם עם hreflang מושלם ו-schema נקי, יש שכבה שרוב האנשים מדלגים עליה כי היא לא טכנית, היא עריכתית: עומק תוכן. מודל AI שמחפש תשובה מעדיף מקור מקיף על מקור תמציתי, גם כשקהל היעד דובר שפה אחרת מהמקור הזה. אם הגרסה האנגלית שלכם היא מדריך של 2,000 מילה עם דוגמאות, טבלאות ושאלות נפוצות, והגרסה העברית היא תמצית של 400 מילה שמישהו הדביק במהירות כדי "שיהיה גם בעברית", אתם בעצם אומרים למודל בקול רם: המקור הסמכותי כאן הוא האנגלית. הנתונים של Temso AI, על פני יותר מ-7 מיליון ציטוטים ב-6 שפות שאינן אנגלית, מראים פער של 41 נקודות אחוז בין ענפים: תחומים ממוקדי-מקום כמו חינוך יסודי הגיעו ל-76.9% ציטוטים בשפה המקומית, בעוד ענפים גלובליים כמו מלונאות ואירוח צנחו ל-35.5% בלבד. ההבדל לא נובע מהמאמצים. הוא כן קשור, בגדול, לכמה עומק מקומי-מקורי באמת קיים מול כמה שהוא סתם תרגום.
אז מה כן עובד: לבנות את הגרסה העברית כאילו היא המקור, לא הנגזרת. זה אומר דוגמאות ישראליות, מקורות עבריים, הקשר מקומי, לא רק תרגום נאמן של הפסקאות באנגלית. זה יקר יותר בזמן כתיבה, ואין דרך לעקוף את זה בקיצור דרך.
נקודה טכנית שקל לפספס: עומק לא נמדד רק במילים, אלא גם במבנה שמודל יכול לפרק בקלות. גרסה עברית שמורכבת מבלוקים ברורים, כותרות משנה, רשימות, שאלות ותשובות, נותנת למודל יחידות מידע נפרדות שהוא יכול לשלוף ולצטט אחת אחת. פסקת ענק אחת בעברית, גם אם היא ארוכה, קשה יותר לפרק ל"עובדה שאפשר לצטט" מאשר אותו תוכן בדיוק מחולק נכון. זו עוד סיבה שבגללה גרסאות אנגליות שנכתבות בכלים עם מבנה מובנה מנצחות גרסאות עבריות שנכתבו כזרם תודעה.
ישות אחת, לא שני אתרים חלשים: העקביות בין השפות
הבעיה הבאה קטנה בגודל ועצומה בהשפעה: כשהאתר העברי והאתר האנגלי מתנהגים כשתי ישויות נפרדות במקום כישות אחת, כל אחת מהן מתחילה עם פחות סמכות מהמינימום שהיה לה אילו התאחדו. Schema מסוג Organization או Person צריך להצביע דרך sameAs על אותם פרופילים חיצוניים, LinkedIn, Wikipedia, Wikidata אם יש, בשתי גרסאות השפה, כדי שמנוע AI שמזהה ישות אחת דרך הגרסה האנגלית יזהה את אותה ישות בדיוק דרך הגרסה העברית. בית הכותב (byline) צריך להיות עקבי, לא "רוני שגב" בעברית ו-"editorial team" גנרי באנגלית, כי חוסר עקביות כזה שובר את שרשרת האמון שהמודל מנסה לבנות בין הכותב לתוכן.
זה לא מדע. זה תרגיל בסיסי של: מי אנחנו, בכל שפה שבה אנחנו מדברים, ולמה זו אותה חברה ולא שתי חברות שונות. אם אתם רוצים להבין את המנגנון המלא של איך ישות נבנית מספיק חזק כדי ש-AI יבחר בה, חוקי GEO שגורמים ל-AI לצטט אתכם נותן את התמונה המלאה, לא רק את החלק הרב-לשוני שלה.
הבדיקה של חמש דקות: מי מצוטט כששואלים בעברית
לפני שאתם מתקנים משהו, תבדקו קודם אם יש בכלל מה לתקן, כי חלק מהאתרים שאני בודקת מגלים שהם דווקא בסדר. פתחו את ChatGPT, Perplexity ו-Gemini בנפרד, ושאלו שאלה שלקוח אמיתי היה שואל בעברית טבעית בתחום שלכם, לא מילת מפתח יבשה. תעדו אילו דומיינים מצוטטים בתשובה: הגרסה העברית שלכם, הגרסה האנגלית שלכם, מתחרה ישראלי, או מתחרה זר. חזרו על זה עם שלוש עד חמש שאלות שונות, כי תשובה אחת לא אומרת כלום, ותשובה עם דפוס חוזר כן. אם הגרסה האנגלית שלכם מופיעה במקום העברית שוב ושוב, יש לכם עכשיו נתון, לא תחושת בטן.
שווה לחזור על הבדיקה הזאת אחת לחודש, לא כי משהו ישתנה בין לילה, אלא כי ההתנהגות של המנועים עצמם משתנה, ולפי ניתוח של Profound על 3.25 מיליארד ציטוטים ב-14 מדינות, שפת השאלה משנה לגמרי את גרף הציטוטים, אילו דומיינים מופיעים ואיזה סוגי מקורות בכלל נכנסים לתמונה. מנוע שהתנהג בצורה מסוימת בחודש שעבר עלול להתנהג אחרת החודש, ובלי מעקב תלמדו על זה רק דרך ירידה בטראפיק. מי שרוצה להבין את ההבדלים בין המנועים לפני שבונים סביבם אסטרטגיה, נתח השוק העדכני של מנועי ה-AI נותן את נקודת הפתיחה.
צ'קליסט התיקון: מה עושים השבוע הזה
אחרי שהאבק שוקע ואתם יודעים בדיוק איפה הבעיה, הסדר הבא הוא זה שחוסך הכי הרבה זמן, בדוק על עשרות אתרים:
- תעשו אודיט hreflang אמיתי, לא בדיקה חזותית: ודאו שכל גרסת שפה מקשרת בחזרה לכל שאר הגרסאות, כולל לעצמה, ושה-x-default מוגדר ומצביע על משהו הגיוני, לא נשכח בברירת מחדל של תבנית.
- תאחדו את ה-canonical, לא רק תבדקו אותו: כל דף חייב להצביע קנוני על עצמו. דף עברי שמצביע קנוני על האנגלי אומר לגוגל, וברוב הסיכויים גם למנועי AI שנשענים על אינדוקס גוגל, שהוא בעצם לא הגרסה החשובה.
- תשלימו את התוכן העברי לעומק שווה לאנגלי, לא לאורך שווה: תוספת מילים בלי תוספת מידע לא משנה כלום. דוגמאות מקומיות, מקורות עבריים, הקשר ישראלי, אלה מה שהופך תמצית למקור.
- תתקנו schema ב-inLanguage ותוודאו sameAs עקבי: כל גרסת שפה מתויגת נכון בפני עצמה, וכל גרסת שפה מקשרת לאותם פרופילים חיצוניים כדי לבנות ישות אחת ולא שתיים חלשות.
- תחליטו החלטה אסטרטגית מודעת, לא תקועים באמצע: או שאתם הולכים על עברית קודם עם השקעה עמוקה שם והאנגלית כתרגום נלווה, או שאתם בונים מראה מלאה בשתי השפות. הגרסה הגרועה ביותר היא זו שקיימת היום ברוב האתרים: שני חצאי מוצר שאף אחד מהם לא מספיק חזק לבד.
שאלות נפוצות
האם צריך לוותר על הגרסה האנגלית כדי שהעברית תצוטט?
לא, וזה גם לא היה עוזר. הבעיה היא היררכיה שגויה בין הגרסאות, לא עצם הקיום של שתיהן. תקנו hreflang, canonical ועומק תוכן כדי שכל גרסה תעמוד בפני עצמה כמקור סמכותי בשפתה, במקום להעלים אחת מהן.
כמה זמן לוקח לתיקון hreflang להשפיע על ציטוטים ב-AI?
אין לוח זמנים אחיד, וכל מי שמבטיח מספר מדויק מוכר לכם משהו. הזחילה מחדש של גוגל יכולה לקחת שבועות, ומעבר לזה מנועי AI עצמאיים כמו ChatGPT לא בהכרח מגיבים ישירות ל-hreflang בכלל, אלא לומדים מדפוסי תוכן וסמכות לאורך זמן. הבדיקה החודשית שתיארתי היא הדרך היחידה לדעת בפועל, לא הערכה תיאורטית.
האם דומיין נפרד כמו .com עדיף על תת-תיקייה לגרסה האנגלית?
ברוב המקרים לא, כי דומיין נפרד מתחיל לבנות סמכות מאפס ולא נהנה מהאותות שכבר נצברו ל-co.il. תת-תיקייה כמו /en/ שומרת על איחוד סמכות דומיין, ומקלה משמעותית על hreflang וקישור הדדי נכון בין הגרסאות.
האם Google AI Overviews מתנהג אותו דבר כמו ChatGPT בנושא הזה?
לא באותה מידה. Google AI Overviews יושב על אותו אינדוקס שקורא hreflang כחלק מהחיפוש הרגיל, ולכן נוטה להיות מדויק יותר בזיהוי שפה. מנועים עצמאיים כמו ChatGPT, Perplexity ו-Claude מתבססים פחות על אותות hreflang קלאסיים ויותר על זיהוי שפה ברמת התוכן עצמו, מה שהופך תוכן עברי עמוק ותקין לחשוב יותר, לא פחות.
הנה מה שהייתי עושה: קודם הבדיקה בפועל, לא ההנחה. אחר כך אודיט hreflang ו-canonical, כי בלעדיהם שום דבר אחר לא יתפוס. ואז, ורק אז, השקעה בעומק התוכן העברי כאילו הוא המקור ולא הנספח. זה לא פרויקט של יום אחד, וכל מי שמבטיח לכם תוצאה מיידית לא בדק את זה בעצמו. אבל זו הפעם הראשונה שיש נתונים אמיתיים על למה זה קורה, וזה כבר יתרון על רוב האתרים שעדיין מנחשים.
📲 כל כתבה חדשה, ישר לטלגרם
בלי אלגוריתם ובלי פיד. עדכון אחד בערוץ בכל פעם שעולה כתבה.
5 עדכונים שחשוב לדעת + ניתוח אחד. אימייל אחד בשבוע, בלי ספאם.

