האיש שלימד את צ'אט-ג'יפיטי לדבר בנה מודל שלא מסוגל להוציא מילה
0.114 שניות. זה הזמן שלקח לג'ב, מודל חדש של חברה בשם טייפסייף, לענות על שאילתה בהדגמה הרשמית. ג'יפיטי-5.6 טרה של OpenAI, על אותה שאילתה בדיוק, צריך 8.566 שניות. פי 75 בערך.
וזה עוד לא החלק המוזר. ג'ב לא כותב. לא משפט, לא מילה, לא "כמובן, אשמח לעזור". הוא פשוט מחזיר החלטה ואחוז ביטחון, וחוזר לשתוק.
מי שבנה אותו הוא דיוגו אלמיידה, חוקר לשעבר ב-OpenAI ואחד השותפים להמצאת השיטה שהפכה מודלי שפה לבני שיח, ולצ'אט-ג'יפיטי עצמו. כלומר האיש שאחראי במידה רבה לכך שמכונות מדברות איתנו היום, החליט שהן מדברות יותר מדי.
אלמיידה ישב שנתיים בשקט מוחלט. בלי הכרזות, בלי ראיונות, בלי פוסטים. ב-15 בספטמבר 2026 הוא יצא מהמחבוא עם 40 מיליון דולר גיוס, עם חברה ועם מודל. וכדי להוכיח שהמודל עובד, הצוות שלו לימד אותו לשחק דום.
למה בכלל צריך מודל שלא מדבר
כדי להבין את זה, צריך לחשוב רגע על מה שקורה בפועל כשמפתחת משלבת מודל שפה במוצר שלה.
נניח שהיא צריכה שהמערכת תחליט לאיזו מחלקה לנתב פנייה של לקוח שכתב "חייבו אותי פעמיים". היא שולחת את הטקסט למודל, מבקשת ממנו להחזיר תשובה בפורמט מסוים, ומקבלת בחזרה משפט. אחר כך היא צריכה לפרק את המשפט, לוודא שהוא בפורמט הנכון, לבדוק שהמודל לא המציא מחלקה שלא קיימת, ולעטוף הכל בשכבות הגנה שיתפסו את המקרים שבהם הוא סתם הלך לאיבוד.
כל זה, בשביל החלטה שמחשב אמור לקבל בחלקיק שנייה.
אלמיידה מנסח את זה קצר ממני: "תחשבו על ג'ב כקריאת פונקציה של אינטליגנציה מתקדמת. מצב לא מובנה נכנס, החלטות הסתברותיות מוגדרות יוצאות".
בפועל זה נראה כך: המפתחת מגדירה מראש שלוש אפשרויות, חיובים, תמיכה טכנית ומכירות. ג'ב מחזיר הסתברות לכל אחת, למשל 85% לתמיכה טכנית, יחד עם ציון ביטחון. המודל לא מייצר מילה אחרי מילה, אלא מחזיר את כל הערכים בשאילתה מקבילה אחת. הוא גם לא יכול להחזיר משהו שלא מופיע ברשימה. לא כי אימנו אותו להיות מנומס וזהיר, אלא כי פשוט אין לו לאן.
אימון על ביטחון, לא על נימוס
הפער הזה מתחיל כבר בשיטת האימון.
מודלים מובילים מאומנים היום בעיקר בשתי שיטות: למידת חיזוק ממשוב אנושי, שמלמדת את המודל לענות כמו שבני אדם שמדרגים אותו אוהבים, ולמידת חיזוק מתגמולים ניתנים לאימות, שבודקת אם התשובה עוברת מבחן מוגדר. את הראשונה, אגב, אלמיידה עזר להמציא.
את ג'ב טייפסייף אימנה בשיטה שהיא קוראת לה "למידת חיזוק להחלטות מכוילות". המטרה שונה: לא רק שהמודל יצדק, אלא שהוא יידע כמה הוא בטוח. אם הוא מחזיר ביטחון של 70%, הוא אמור לצדוק בערך ב-70% מהמקרים.
למי שבונה מערכות, זה ההבדל בין כלי שאפשר לסמוך עליו לבין כלי שצריך לשמור עליו. מודל שמצליח ב-95% מהמקרים אבל לא יודע להגיד מתי הוא נמצא ב-5% הנותרים, לא יכול להריץ שום תהליך לבד.
המספרים, ולמה כדאי לקרוא אותם בזהירות
לפי הפוסט של טייפסייף, זמן התגובה של ג'ב נע בין 70 ל-500 אלפיות שנייה. אצל מודלי השיחה המובילים, לפי מדד חיצוני שהחברה מצטטת, זמני התגובה נעים בין שלוש שניות ל-329 שניות.
העלות מספרת סיפור דומה. עיבוד קלט מתומחר ב-0.042 דולר למיליון טוקנים, לעומת 0.20 עד עשרה דולרים למיליון במודלים שיחתיים. ועל הפלט? טייפסייף לא גובה בכלל. בחברה מסבירים שהוא זול מכדי שיהיה שווה לספור אותו.
במבחני "זרימות עבודה" שהחברה בנתה, מול תשובות ייחוס של ג'יפיטי-6 אסטרה ופייבל 5.1, טייפסייף מדווחת על ביצוע מהיר עד פי 193.6 וזול עד פי 444.6.
שתי הערות לפני שמתלהבים.
ראשית, כל המדידות האלה פנימיות, כפי שמציין גם הסיקור של האתר היפני גיגזין. את המבחנים בנו אנשי צוות היכולות של החברה, והם הורצו מהמחשבים של הצוות בחוף המערבי של ארצות הברית. טייפסייף עצמה, לזכותה, כותבת שהמספרים האלה הם כנראה הקצה העליון של מה שיקרה בעולם האמיתי, ושהיא לא יכולה להוכיח שהמחיר לא מסובסד. זה לא אומר שהמספרים שקריים. זה אומר שעד שמישהו חיצוני יריץ אותם, אלה מספרים של חברה שמציגה את עצמה.
שנית, ההשוואה לא לגמרי הוגנת מטבעה. ג'ב לא מנסה לכתוב לכם מייל, לנתח חוזה או להסביר למה הבן שלכם קיבל 60 במתמטיקה. הוא עושה דבר אחד צר, ועושה אותו מהר. זה קצת כמו להשוות קטנוע משלוחים למשאית ולהכריז שהקטנוע ניצח, כי הוא הגיע ראשון עם הפיצה.
דום, ויקיפדיה וחולצה הוואית
ההדגמות שטייפסייף פרסמה הן דווקא החלק המשעשע.
המהנדס שבנה את הדגמת הדום הריץ בוט שמגיב בזמן אמת למצב המשחק, בקצב של עשר שאילתות בשנייה. העלות: כשבעה דולרים לשעה. הוא חשש שזה יקר מדי. שאר הצוות חשב שזה זול מהצפוי. ובחברה מודים בלי בושה שבוט רגיל, בלי שום בינה מלאכותית, היה משחק דום טוב יותר. הם פשוט רצו בוט שמקשיב להוראות.
מבחן שני בדק מרוץ ויקיפדיה: להתחיל בערך אחד ולהגיע לערך אחר רק דרך קישורים. ג'ב סיים את המסלולים בפחות צעדים ממודלים חיצוניים שרצו בלי מצב חשיבה. הוא יודע לבחור מתוך עד 255 אפשרויות, ובבחירות גדולות הוא מנקד כל אפשרות בנפרד לפני ההכרעה.
מאז ההשקה המפתחים לא חיכו. לפי סיכום שפורסם ב-23 בספטמבר, בתוך שבוע כבר קם אתר שאוסף אפליקציות ניסיוניות שנבנו על ג'ב: כלי שמדרג דחיפות של שורות בגיליון, תאי הלבשה וירטואליים שמראים לכם בתוך 620 אלפיות שנייה כמה רע תיראו בחולצה ההוואית שאתם שוקלים לקנות, ובוטים לטטריס, לשח ולמתיישבי קטאן. בשח, אגב, ג'ב הפסיד למודל פתוח. אבל הוא הפסיד בזול.
הכיוון ההפוך
שלוש שנים התעשייה רצה לכיוון אחד: מודל אחד ענק שיודע הכל, מדבר על הכל ועושה הכל. גדול יותר, כללי יותר, יקר יותר.
אלמיידה, שהיה בחדר כשזה התחיל, הלך הפוך. הוא לקח את ההנחה שמודל חייב לדבר כדי להיות שימושי, וזרק אותה לפח. את השם ג'ב הוא לקח מוויליאם סטנלי ג'בונס, הכלכלן הבריטי מהמאה ה-19 שהראה שמנועי קיטור יעילים יותר לא הקטינו את צריכת הפחם אלא הגדילו אותה. ההימור ברור: אם החלטה של בינה מלאכותית תעלה כמעט אפס, נשתמש בה בכל שורת קוד.
גם אנדריי קרפתי, מהשמות המוכרים בתחום וכיום חוקר באנתרופיק, כתב שג'ב חשף ביקוש סמוי שהוזנח בגלל המרוץ לאינטליגנציה גבוהה יותר. במילים פשוטות: הרבה חברות לא צריכות גאון. הן צריכות פקיד מהיר, זול ועקבי.
אם אלמיידה צודק, חלק גדול ממה שחברות משלמות עליו היום הוא בזבוז. הן מפעילות מנוע שיודע לכתוב שירה כדי להחליט אם פנייה היא תלונה או בקשת החזר. הן משלמות על טוקנים של נימוס, על מילות קישור, על פסקת פתיחה שאף אחד לא ביקש.
ואם הוא טועה, ג'ב יישאר כלי נישה נחמד לצוותי תשתית, ובעוד שנה מעטים יזכרו את השם.
אני נוטה לצד הראשון. לא בגלל המספרים, שעוד צריכים בדיקה חיצונית, אלא בגלל מי שעומד מאחוריהם. אדם שעזר לבנות את המוצר שהגדיר את העשור בחר להיעלם לשנתיים כדי לבנות את ההפך הגמור ממנו. אנשים לא עושים את זה כי משעמם להם.
הוא ראה משהו מבפנים שאנחנו עדיין רואים רק מבחוץ.
