מערכת החדשות והעדכונים של משכוכית · AI בארגון

מחקר ה'גבול המשונן' (HBS/BCG): 25% מהר יותר עם AI - אבל 19 נקודות אחוז פחות מדויק מחוץ לגבול

הניסוי השדה המתואם של HBS, Wharton, MIT Sloan ו-BCG (758 יועצים, ספטמבר 2023): בתוך 'גבול היכולות' של ה-AI היועצים השלימו 12.2% יותר משימות, 25.1% מהר יותר, ובאיכות גבוהה ביותר מ-40% - אבל במשימה מחוץ לגבול היו פחות מדויקים ב-19 נקודות אחוז. מפת ההתאמה למנהלים.

איור מערכתי של משכוכית המציג מפה משוננת עם אזורים ירוקים ואדומים ומנהל מנווט ביניהם
תמונה מקורית: מערכת החדשות והעדכונים של משכוכית · נוצרה בסיוע OpenAI

מחקר 'הגבול הטכנולוגי המשונן' (Dell'Acqua, Mollick, Lifshitz-Assaf ועמיתים, ספטמבר 2023) הוא ניסוי השדה הגדול הראשון על AI בעבודת ידע: 758 יועצי BCG ביצעו 18 משימות ייעוץ ריאליסטיות. בתוך גבול היכולות של ה-AI, המשתמשים השלימו 12.2% יותר משימות, 25.1% מהר יותר ובאיכות גבוהה ביותר מ-40%. אבל במשימה שנבחרה מחוץ לגבול, משתמשי ה-AI היו פחות מדויקים ב-19 נקודות אחוז - כי האמינו לפלט. המסקנה הניהולית: לא 'האם להשתמש ב-AI' אלא 'באילו משימות' - ומי מחזיק את מפת הגבול.

הממצאים המרכזיים של המחקר

הניסוי, שתוכנן מראש (pre-registered) ונערך עם BCG, חילק 758 יועצים - כ-7% מהיועצים ברמת individual contributor בחברה - לעבודה עם ובלי AI על סל משימות ייעוץ ריאליסטי. בתוך גבול היכולות: משתמשי ה-AI השלימו בממוצע 12.2% יותר משימות, סיימו 25.1% מהר יותר, והפיקו תוצרים באיכות גבוהה ביותר מ-40% מקבוצת הביקורת.

הממצא הקריטי הוא הצד השני של הגבול: במשימה שנבחרה בכוונה מחוץ ליכולות ה-AI, משתמשי הכלי היו פחות מדויקים ב-19 נקודות אחוז מאלה שלא השתמשו בו. הכלי לא 'התריע' שהוא מחוץ לגבול - הוא הפיק תשובה חלקה ומשכנעת שגויה, והיועצים נטו לאמץ אותה. כלומר הסיכון אינו שה-AI ייכשל, אלא שהוא ייכשל בשקט ובשכנוע.

החוקרים מתארים שני דפוסי עבודה מוצלחים: 'קנטאור' - חלוקת עבודה מודעת בין האדם ל-AI לפי הגבול, ו'קיבורג' - שילוב אינטראקטיבי מתמיד. שניהם עדיפים על שימוש אקראי; ההחלטה באיזה דפוס לבחור תלויה במשימה ובמפת הגבול של הארגון.

מהו 'הגבול המשונן' ולמה הוא מסוכן

יכולות ה-AI אינן קו רציף: משימה שנראית קשה לאדם (כתיבת ניתוח שיווקי מלוטש) עשויה להיות עמוק בתוך הגבול, ומשימה שנראית טריוויאלית (שאילתת דיוק על נתון ספציפי בהקשר מסוים) עשויה להיות מחוצה לו. ה'משוננות' היא שהגבול אינו נראה לעין ואינו מתואם עם האינטואיציה שלנו על קושי. לכן עובד מנוסה עלול להאמין לפלט מחוץ-לגבול בדיוק באותה מידת ביטחון שהוא מקבל פלט בתוך-הגבול.

זו גם הסיבה שהנזק מחוץ לגבול גדול מהרווח בתוכו במשימות קריטיות: 19 נקודות אחוז ירידה בדיוק הן לא 'פחות שיפור' אלא רגרסיה מוחלטת בביצועים. במונחי ניהול סיכונים, כל החלטת שימוש ב-AI דורשת קודם שאלה אחת: האם אנחנו יודעים באיזה צד של הגבול המשימה הזו נמצאת - ומאיזו ראיה?

נקודה נוספת שהמחקר מדגישה היא האפקט ההפיך: יועצים חלשים יחסית נהנו מהכלי יותר מחזקים, כלומר בתוך הגבול ה-AI פועל כמשווה כלפי מעלה. אבל אותו מנגנון בדיוק - פלט מלוטש שממלא פערי ידע - הוא שמסוכן מחוץ לגבול: מי שאין לו תשתית לשפוט את התשובה גם אין לו דרך לזהות שהיא שגויה. המסקנה המעשית: ככל שהעובד פחות מומחה בתחום, כך הבקרה על שימוש מחוץ למפה חייבת להיות הדוקה יותר.

מה זה אומר לארגונים בישראל

בשוק הישראלי, שבו עבודת ידע נשענת על צוותים קטנים ומהירים, הפיתוי להפעיל AI 'על הכול' גדול במיוחד - והמחקר מראה שזו בדיוק הטעות היקרה. ארגון קטן אינו יכול להרשות לעצמו רגרסיית דיוק של 19 נקודות אחוז במשימת לקוח קריטית, ובדיחה מדגם אחת מחוץ לגבול יכולה לעלות בלקוח.

מניסיון ההדרכה של משכוכית בארגונים ישראליים, היישום המנצח הוא 'מפת גבול ארגונית': רשימה חיה של סוגי המשימות שבהן הכלי הוכיח עצמו אצלנו (תוך הגבול - שימוש חופשי), מול סוגי המשימות שבהן הוא כשל (מחוץ לגבול - בקרת אדם מלאה או איסור). המפה נבנית מניסוי מקומי קטן, מתעדכנת עם כל גרסת מודל, והיא נכס ניהולי לא פחות חשוב מהרישיונות עצמם.

כדאי לחבר את זה גם לתהליך הקבלה של עובדים חדשים: אונבורדינג שכולל את מפת הגבול ואת כללי הבקרה מייצר הרגלים נכונים מהיום הראשון, במקום לתקן דפוסים רעים אחר כך. בארגונים קטנים, שם כל עובד מרימון הכול, ההשקעה הקטנה הזו באונבורדינג היא ההגנה הזולה ביותר מפני טעות AI יקרה מול לקוח.

ארבע פעולות מעשיות למנהלים

ראשית, בנו מפת גבול ראשונית: קחו עשר משימות חוזרות של הצוות, הריצו כל אחת עם הכלי, ותעדו איפה התוצר עבר בקרת איכות בלי תיקון ואיפה לא. שנית, סמנו את המשימות הקריטיות (לקוח, כסף, משפטי) וקבעו להן בקרת אדם מלאה גם אם הן נראות בתוך הגבול - מחיר הטעות בהן גבוה מדי לניחוש.

שלישית, הכשירו את הצוות בשני דפוסי העבודה מהמחקר: 'קנטאור' למשימות עם גבול ידוע (חלוקת עבודה מפורשת), ו'קיבורג' למשימות יצירתיות-חקירתיות (שילוב מתמיד). רביעית, עדכנו את המפה עם כל שדרוג מודל משמעותי: הגבול נע, ומה שהיה מחוץ לגבול לפני שנה עשוי להיות עמוק בתוכו היום - ולהיפך.

קריאה ביקורתית של המחקר

המחקר נערך בספטמבר 2023 עם GPT-4 בממשק מוקדם - דורות מודלים לפני ההווה - ועל אוכלוסיית יועצים עילית, שאינה מייצגת את רוב עובדי הידע. ה'גבול' שנמדד אז זז מאז משמעותית, וחלק מהמשימות 'מחוץ לגבול' של 2023 עשויות להיות שגרתיות היום. כמו כן, מדידת 'איכות' נעשתה על ידי מעריכים אנושיים, ונטיית הערכה אפשרית.

עם זאת, התרומה המתודולוגית נצחית יותר מהמספרים: הרעיון של גבול משונן ובלתי נראה, וההוכחה שאמון עודף מחוץ לגבול מוריד ביצועים, תקפים לכל דור מודלים. הקריאה הנכונה אינה לשאול 'איפה הגבול לפי המחקר' אלא לאמץ את השיטה: מיפוי מתמשך, בקרה על משימות קריטיות, והכשרת עובדים להטיל ספק בפלט חלק.

מה לעשות עם המחקר כבר השבוע

בחרו חמש משימות חוזרות מהצוות והריצו 'מבחן גבול' מקומי: אותה משימה, פעם עם הכלי ופעם בלעדיו, והשוו זמן ואיכות מול קריטריון קבלה מוגדר. תוך יום עבודה אחד תקבלו גרסה ראשונה של מפת הגבול שלכם - הכלי הניהולי החשוב ביותר שהמחקר מציע.

במקביל, הטמיעו כלל אחד פשוט: כל תוצר AI במשימה קריטית עובר בקרת אדם מוקצית, שתפקידה לחפש דווקא את הטעות החלקה - לא לקרוא 'שזה נשמע הגיוני'. הכלל הזה, שמקורו בממצא ה-19 נקודות, עולה כמעט כלום ומונע את הכישלון היקר ביותר.

ולמדוד את ההשפעה: אחרי חודש של עבודה עם מפת הגבול, השוו זמני משימה ואיכות תוצר מול קו הבסיס. המחקר מראה שהפוטנציאל בתוך הגבול עצום - 25% מהר יותר - אבל הוא ממומש רק אצל מי שמודד.

  • מפו את הגבול: עשר משימות, עם ובלי הכלי, מול קריטריון קבלה.
  • קבעו בקרת אדם מלאה למשימות קריטיות - גם אם נראות בתוך הגבול.
  • הכשירו שני דפוסים: קנטאור (חלוקה מודעת) וקיבורג (שילוב מתמיד).
  • למדו את הצוות לחפש את הטעות החלקה, לא רק את השגיאה הגלויה.
  • עדכנו את המפה עם כל שדרוג מודל משמעותי - הגבול נע.

שלוש טעויות נפוצות בקריאת המחקר

הטעות הראשונה היא לסקור '40% שיפור איכות' כרישיון לשימוש גורף: המספר תקף רק בתוך הגבול, ומחוצה לו נמדדה רגרסיה. הטעות השנייה היא להניח שהגבול של 2023 עדיין תקף: היכולות זזו, ומפות גבול מתיישנות כמו רשימות מלאי. הטעות השלישית היא לייחס את הכישלון מחוץ לגבול ליועצים: הם היו מומחים שקיבלו פלט משכנע; הכישלון מובנה בחוויית השימוש, לא באדם.

הקריאה המאוזנת: המחקר הוא מסגרת החלטה, לא ציונים. הערך שלו הוא בשאלה שהוא מלמד לשאול על כל משימה - באיזה צד של הגבול אנחנו, ומה הבקרה אם טעינו?

מבחן גבול מקומי ביום עבודה אחד

הפרוצדורה המדויקת לבניית גרסה ראשונה של מפת הגבול הארגונית שלכם.

  1. בחרו חמש משימות חוזרות וכתבו לכל אחת קריטריון קבלה מדיד.
  2. הריצו כל משימה פעם עם הכלי ופעם בלעדיו; מדדו זמן ואיכות מול הקריטריון.
  3. סמנו כל משימה: בתוך הגבול (עברה בקרה בלי תיקון) או מחוצה לו.
  4. קבעו לכל משימה קריטית בקרת אדם מוקצית שמחפשת את הטעות החלקה.
  5. קבעו תאריך עדכון מפה: עם שדרוג המודל הבא או בעוד רבעון, המוקדם מביניהם.

מה חשוב לקחת

  • בניסוי שדה עם 758 יועצי BCG, שימוש ב-AI בתוך גבול היכולות העלה תפוקה (12.2% יותר משימות, 25.1% מהר יותר) ואיכות (מעל 40%).
  • מחוץ לגבול, משתמשי ה-AI היו פחות מדויקים ב-19 נקודות אחוז - הכלי הפיק תשובה חלקה ומשכנעת שגויה, והם אימצו אותה.
  • המסקנה הניהולית: מפת גבול ארגונית מתעדכנת, בקרת אדם על משימות קריטיות, והכשרה בדפוסי עבודה 'קנטאור' ו'קיבורג'.

שאלות נפוצות

מהו מחקר 'הגבול הטכנולוגי המשונן'?
ניסוי שדה מתוכנן מראש (2023) של חוקרי HBS, Wharton ו-MIT Sloan עם BCG: 758 יועצים ביצעו משימות ייעוץ ריאליסטיות עם ובלי AI כדי למדוד פרודוקטיביות ואיכות.
מה נמצא בתוך גבול היכולות של ה-AI?
משתמשי ה-AI השלימו 12.2% יותר משימות, סיימו 25.1% מהר יותר, והפיקו תוצרים באיכות גבוהה ביותר מ-40% מקבוצת הביקורת.
מה נמצא מחוץ לגבול?
במשימה שנבחרה מחוץ ליכולות ה-AI, המשתמשים היו פחות מדויקים ב-19 נקודות אחוז - כי הפלט החלק והמשכנע הוביל לאמון עודף.
מהו 'גבול משונן'?
התיאוריה שיכולות ה-AI אינן רציפות: משימות שנראות קשות עשויות להיות בתוך הגבול ומשימות טריוויאליות לכאורה מחוצה לו - והגבול אינו נראה למשתמש.
מהם דפוסי 'קנטאור' ו'קיבורג'?
קנטאור: חלוקת עבודה מודעת בין האדם ל-AI לפי הגבול; קיבורג: שילוב אינטראקטיבי מתמיד. שניהם עדיפים על שימוש אקראי לפי החוקרים.
האם הממצאים תקפים גם היום?
המספרים מדדו מודל מספטמבר 2023 והגבול זז מאז; אבל המסגרת - גבול בלתי נראה, אמון עודף מחוצה לו, וצורך במיפוי - תקפה לכל דור מודלים.
איך מנהל צריך ליישם את המחקר?
לבנות מפת גבול ארגונית מניסוי מקומי, לקבוע בקרת אדם על משימות קריטיות, ולעדכן את המפה עם כל שדרוג מודל משמעותי.

מקורות שנבדקו

  1. Navigating the Jagged Technological Frontier (SSRN abstract 4573321)SSRN / Harvard Business School Working Paper 24-013
  2. Navigating the Jagged Technological Frontier (HBS PDF)Harvard Business School
  3. SSRN-id4573321 (MIT Sloan mirror PDF)MIT Sloan School of Management
העדכון רלוונטי לארגון שלכם?

רוצים מפת גבול משלכם?

נבנה יחד ניסוי מקומי קטן שממפה איפה ה-AI מחזק את הצוות שלכם ואיפה הוא מסוכן - עם כללי בקרה ברורים לכל משימה.

לתיאום שיחת אפיון