יולי 26, 2026
נהלל 4, חדרה
חדשות כלים

TabFM של Google, המודל שמנבא מטבלאות בלי שאימנתם אותו

בסוף יוני שחררה Google Research מודל בשם TabFM, והוא מכוון בדיוק לסוג הנתונים שרוב העסקים באמת מחזיקים, לא טקסטים ולא תמונות, אלא טבלאות. שורות ועמודות של לקוחות, עסקאות, מלאי ושכר. הרעיון נשמע כמעט מוזר למי שמכיר את התחום, המודל מבצע סיווג וחיזוי ערכים על טבלה שהוא מעולם לא ראה, בלי אימון ייעודי, בלי כוונון פרמטרים ובלי הנדסת מאפיינים ידנית. מזינים לו דוגמאות מסומנות, והוא מנבא את השורות החדשות במעבר חישוב אחד. בכתבה הזאת ננסה להסביר בגובה העיניים מה זה אומר, ולמה זה מעניין גם את מי שחי בגיליונות נתונים ולא במעבדות מחקר.

הבעיה שהמודל בא לפתור

בעוד שמודלי שפה כבשו את הטקסט ומודלי תמונה את הוויזואליה, עולם הנתונים הטבלאיים נשאר במשך שנים ממלכה של כלים ותיקים כמו XGBoost ו-LightGBM, שמבוססים על עצי החלטה. הכלים האלה מדויקים מאוד, אבל יש להם מחיר, על כל טבלה חדשה צריך לאמן מודל מאפס, לבחור אילו עמודות רלוונטיות, לנקות ולעבד אותן, ולהריץ חיפוש ארוך אחר ההגדרות הנכונות. בעסק ממוצע, זה אומר שכל שאלת חיזוי, אילו לקוחות צפויים לנטוש, איזו עסקה חריגה, דורשת פרויקט של איש נתונים. TabFM מציע גישה אחרת, מודל אחד שאומן מראש ומוכן לכל טבלה, כמו שמודל שפה מוכן לכל שאלה.

איך זה עובד בלי אימון

הסוד הוא טכניקה שנקראת למידה בתוך הקשר. במקום לאמן את המודל על הנתונים שלכם, מגישים לו את הטבלה כולה כקלט, השורות המסומנות שכבר ידוע מה קרה בהן לצד השורות שרוצים לנבא, והוא מסיק את הדפוסים תוך כדי קריאה. שום דבר לא משתנה במודל עצמו, הוא רק קורא ומשיב. כדי להגיע ליכולת הזאת, Google אימנה את TabFM על מאות מיליוני טבלאות סינתטיות שנוצרו באמצעות מודלים סיבתיים מבניים, כי פשוט אין בעולם הפתוח מספיק טבלאות אמיתיות ומגוונות, ונתונים עסקיים אמיתיים כרוכים בבעיות פרטיות ורישוי. לפי Google, המודל שאומן על הטבלאות המלאכותיות האלה מכליל היטב לנתונים אמיתיים, ובמבחן TabArena על 51 מערכי נתונים הוא עקף גם כלים מסורתיים שכווננו בקפידה. המודל זמין להורדה חופשית ב-Hugging Face וב-GitHub, עם ממשק שתואם לספריית scikit-learn המוכרת לכל איש נתונים.

מה זה אומר לאנליסט, לחשב השכר ולבעל העסק

בטווח המיידי, חשוב להיות כנים, TabFM הוא כלי למי שיודע קצת Python, לא כפתור חדש באקסל. אבל הכיוון ברור ומשמעותי. אפשר לדמיין אנליסט שמקבל טבלת לקוחות ורוצה לדעת מי בסיכון נטישה, ובמקום לפתוח פרויקט של שבועות מריץ חיזוי תוך דקות. או צוות כספים שמסמן עשרות חריגות ידועות בהנהלת חשבונות ומבקש מהמודל לאתר דומות להן בעשרות אלפי שורות. ככל שיכולות כאלה יתחברו לכלים היומיומיים, העבודה עם נתונים עסקיים תיראה אחרת, והמרחק בין מודל מחקרי לפיצ'ר בגיליון ממילא הולך ומתקצר בשנים האחרונות.

הצד השני לפני שנפרדים מהכלים הוותיקים, כמה עובדות מקרקעות. תוצאות המבחנים המרשימות מגיעות מ-Google עצמה, והתחום הזה כבר ראה לא מעט הכרזות של למידה עמוקה שמנצחת את עצי ההחלטה, שהתבררו כמוקדמות מדי אחרי שאנשי מקצוע בחנו אותן על נתונים אמיתיים ומבולגנים. יידרש זמן עד שהקהילה תאמת את הביצועים באופן עצמאי. בנוסף, חיזוי הוא לא הבנה, מודל שמסמן לקוח כסיכון נטישה לא מסביר בהכרח למה, ובהחלטות עסקיות ורגולטוריות ההסבר חשוב לא פחות מהתחזית. ולבסוף, נתונים עסקיים אמיתיים מלאים בערכים חסרים, בשגיאות הקלדה ובעמודות לא ברורות, ואף מודל, חכם ככל שיהיה, לא פוטר את הארגון מעבודת הסדר בנתונים. הכלי מרשים, הפוטנציאל אמיתי, והזהירות המקצועית עדיין במקומה.


1. מה TabFM עושה ומה מיוחד בו לעומת כלים קיימים?
TabFM הוא מודל של Google Research שמבצע סיווג וחיזוי ערכים על טבלאות שהוא מעולם לא ראה, בלי אימון ייעודי, בלי כוונון פרמטרים ובלי הנדסת מאפיינים ידנית. מזינים לו דוגמאות מסומנות והוא מנבא את השורות החדשות במעבר חישוב אחד. זאת בניגוד לכלים ותיקים כמו XGBoost ו-LightGBM, שדורשים אימון מודל מאפס על כל טבלה חדשה.

2. איך המודל מצליח לנבא בלי שאימנו אותו על הנתונים?
הסוד הוא טכניקה שנקראת למידה בתוך הקשר. במקום לאמן את המודל, מגישים לו את הטבלה כולה כקלט, השורות המסומנות שכבר ידוע מה קרה בהן לצד השורות שרוצים לנבא, והוא מסיק את הדפוסים תוך כדי קריאה. שום דבר לא משתנה במודל עצמו, הוא רק קורא ומשיב.

3. על מה Google אימנה את המודל ולמה דווקא על נתונים מלאכותיים?
המודל אומן על מאות מיליוני טבלאות סינתטיות שנוצרו באמצעות מודלים סיבתיים מבניים. הסיבה, אין בעולם הפתוח מספיק טבלאות אמיתיות ומגוונות, ונתונים עסקיים אמיתיים כרוכים בבעיות פרטיות ורישוי. לפי Google, המודל מכליל היטב לנתונים אמיתיים, ובמבחן TabArena על 51 מערכי נתונים הוא עקף גם כלים מסורתיים שכווננו בקפידה.

4. האם אנליסט או בעל עסק יכול להשתמש בזה כבר היום?
בטווח המיידי TabFM הוא כלי למי שיודע קצת Python, לא כפתור חדש באקסל. המודל זמין להורדה חופשית ב-Hugging Face וב-GitHub עם ממשק שתואם לספריית scikit-learn. אבל הכיוון ברור, אפשר לדמיין אנליסט שמריץ חיזוי נטישת לקוחות תוך דקות במקום פרויקט של שבועות, וככל שיכולות כאלה יתחברו לכלים היומיומיים, העבודה עם נתונים עסקיים תיראה אחרת.

5. מה הסיבות לזהירות לפני שמאמצים את הכלי?
ראשית, תוצאות המבחנים המרשימות מגיעות מ-Google עצמה, והתחום כבר ראה הכרזות מוקדמות מדי על ניצחון הלמידה העמוקה על עצי החלטה. שנית, חיזוי הוא לא הבנה, מודל שמסמן לקוח כסיכון נטישה לא מסביר למה, ובהחלטות עסקיות ורגולטוריות ההסבר חשוב לא פחות. ולבסוף, אף מודל לא פוטר את הארגון מעבודת הסדר בנתונים, שמלאים בערכים חסרים ושגיאות.

דני מאור

administrator
מפתח תוכנה עם ניסיון של עשרות שנים, שהחל לתכנת בגיל 13. עוסק בפיתוח מערכות, אתרי אינטרנט, אפליקציות מובייל, משחקים ופרויקטים בתחום החומרה וה-Maker, ומשלב בין חשיבה הנדסית ליצירתיות טכנולוגית.

כתיבת תגובה

האימייל לא יוצג באתר. שדות החובה מסומנים *