כרטיס שיתוף: איך מודדים אמינות של סוכן על עבודה אמיתית, OpticoAI

איך מודדים אמינות של סוכן על עבודה אמיתית

מדידת סוכני AI היא בדיקה של משימה עסקית מקצה לקצה: האם התקבלה הזמנה, האם נוצר תוצר מקושר, מה מצב התוצאה, האם נדרשה הסלמה ומה נשאר אחרי כשל. היא שונה ממדידת תשובה בודדת, כי העבודה האמיתית כוללת כלים, קבצים, הרשאות ותור של בעלים.

במערכת שלנו נספרו 1,195 הזמנות עבודה לאורך 102 ימים. ל-839 משימות היה תוצר מקושר, ו-356 הזמנות נשארו בלי רשומת תוצר. המספר הזה שינה את דרך הדיווח. במקום להציג רק את המשימות שהגיעו לבסיס המדידה, נבנה טווח שמכניס גם את החסר לתמונה. עמוד מערכת ההפעלה האגנטית מציג את הנתונים כחלק מגבולות ההוכחה.

⚡ בקצרה
  • יחידת המדידה היא הזמנת עבודה עם תוצר ובעלים, ולא ריצה טכנית או הודעת הצלחה.
  • 356 הזמנות בלי תוצר מונעות מאיתנו להציג את הקצה העליון לבדו.
  • שיעור ההשלמה מדווח תמיד כטווח 44.5% עד 63.4%, לפי היחס לעבודה החסרה.
  • שדה התוצאה נכתב כהערכה עצמית של הסוכן המבצע. הוא דורש ביקורת חיצונית ואינו ציון בלתי תלוי.

מהי יחידת עבודה אמיתית

מה מודדים לפני שמדברים על הצלחה? מערכת תפעולית מתחילה בהזמנה. ההזמנה צריכה לציין מטרה, תחום, בעלים וקובץ או יעד צפוי. בסיום היא צריכה להצביע על תוצר. אם נוצר קובץ בלי קשר להזמנה, הוא קיים בדיסק אך קשה לדעת איזו עבודה פתר. אם ההזמנה סומנה הצלחה בלי תוצר, ההצהרה אינה מספיקה לביקורת.

לכן ספרנו שלושה מעגלים: הזמנות, תוצרים על הדיסק ומשימות עם תוצר מקושר. היו 929 תוצרים על הדיסק, אבל רק 839 משימות עם קשר שאפשר לעקוב אחריו. הפער כולל תוצרים יתומים או לא מקושרים. הוא מזכיר שמדידת קבצים ומדידת עבודה הן שתי שאלות שונות.

💡

הוסיפו מזהה משימה לתוצר בזמן הכתיבה. ניסיון לחבר קבצים להזמנות בדיעבד מייצר הרבה מצבים לא ידועים ופחות ראיות.
שלושה אריחי מספר ממדידת עבודה אמיתית: 1,195 הזמנות עבודה על פני 102 ימים, ו-929 תוצרים מקושרים
שיעור ההשלמה הנקי בניסיון הראשון נמסר כטווח, 44.5% עד 63.4%, כי הקצה העליון לבדו אינו טענה שאפשר להגן עליה.

למה יש טווח ולא מספר יחיד

בתוך בסיס 839 המשימות נרשמו 532 משימות נקיות בניסיון הראשון. אם מחלקים אותן בבסיס שנמדד, מקבלים את הקצה העליון. אם מתייחסים ל-356 ההזמנות בלי תוצר ככישלון, מתקבל הקצה התחתון. לכן הניסוח הציבורי הוא טווח 44.5% עד 63.4%. הקצה העליון לבדו היה מסתיר כמעט שליש מההזמנות.

הטווח אינו ניסיון לרכך תוצאה. הוא מראה שתי הנחות. הראשונה אומרת: מודדים רק משימות עם תוצר מקושר. השנייה מחמירה ואומרת: הזמנה שאין לה תוצר נספרת ככישלון. ארגון יכול לבחור הנחה אחרת, אך הוא צריך לראות כיצד הבחירה משנה את התוצאה.

⚠️

שדה התוצאה נכתב על ידי הסוכן המבצע על עצמו. זו הערכה עצמית, ולא ביקורת בלתי תלויה. הטווח מתאר את הרשומות הקיימות ודורש שכבת אימות נוספת.

הקטגוריות שבין הצלחה לכשל

תוצאה בינארית מוחקת הרבה מידע. בבסיס המדידה היו 177 משימות חלקיות, 112 בלי תווית תוצאה ושתי משימות עם ערכים אחרים. בנוסף נרשמו 10 כשלים מלאים ושש הצלחות עם הסתייגות מוצהרת. לכל קבוצה יש משמעות תפעולית אחרת. חלקי עשוי להיות תוצר שימושי שמחכה לצעד נוסף. בלי תווית מעיד גם על חוב בתהליך הדיווח.

הקטגוריות צריכות להיות מוגדרות לפני המדידה. הצלחה נקייה יכולה לדרוש תוצר, בדיקות ואפס פעולה אסורה. הצלחה עם הסתייגות צריכה להביא הסבר ברור. חלקי צריך להצביע על מה חסר ומי הבעלים. כשל מלא צריך לשמור מצב שמאפשר להבין אם נגרם נזק.

תוצאת משימה ומה בודקים אחריה
תוצאהמה היא אומרתבדיקת המשך
נקיהתוצר והבדיקות הושלמוביקורת מדגמית
חלקינוצר ערך אך חסר שלבבעלים ופעולה הבאה
הסתייגותהצלחה עם מגבלה ידועההאם המגבלה מתקבלת
כשלהמשימה לא נסגרהנזק, שאריות וסיבת כשל
בלי תוויתהדיווח חסרשחזור ותיקון חוזה

356 הזמנות בלי תוצר הן מדד בפני עצמו

אז מה עושים עם עבודה שאין לה תוצר? 29.8% מכל ההזמנות לא קיבלו רשומת תוצר מקושרת. יש כמה סיבות אפשריות: משימה שלא התחילה, עבודה שנעשתה בלי תיעוד, תוצר שנכתב במקום אחר, חסימה שלא נסגרה או כשל. בלי ראיה אי אפשר לבחור ביניהן. לכן הקבוצה אינה מקבלת סיפור אופטימי או פסימי. היא מקבלת סטטוס חסר ודרישת חקירה.

זהו אזור שבו קוד יציאה מטעה במיוחד. תהליך יכול לסיים ריצה בלי שגיאה ועדיין לא לייצר תוצר שימושי. בדיקת אמינות צריכה לחפש את הקובץ, הרשומה או הפעולה שהמשתמש צריך. אם היא אינה קיימת, הצלחת התהליך הטכני אינה סוגרת את ההזמנה.

בפועל, רשימת העבודה בלי תוצר היא תור איכות. מתחילים ממשימות בעלות סיכון או ערך גבוה, מחברים ראיות קיימות ומתקנים את הצינור כדי שהמקרה הבא ייקשר בזמן אמת. המטרה אינה לצבוע את ההיסטוריה. המטרה היא לצמצם קדימה את קבוצת המצבים הלא ידועים.

הסלמות הן חלק מהצלחה

בחלון המדידה נרשמו 96 הסלמות לאדם. אין סיבה לראות בכל הסלמה כשל. אם המדיניות קובעת שפעולה מסוימת דורשת אישור, העברה לאדם היא המסלול הנכון. המדד צריך לשאול אם ההסלמה הגיעה עם הקשר, בעלים ופעולה ברורה, וכמה זמן נשארה בתור.

הסלמה חלשה אומרת צריך עזרה. הסלמה טובה כוללת מה הסוכן ניסה, איזה תנאי חסם, מה כבר הוכן ומה האדם צריך להחליט. ההבדל משפיע על עלות תפעול. מערכת שמסלימה הרבה אך שולחת חבילה מלאה יכולה להיות שימושית יותר ממערכת שמסלימה מעט ומשאירה אחריה תעלומה.

כדאי למדוד הסלמות לפי סיבה. אם אותן שאלות חוזרות, אפשר לשפר הקשר או להוסיף כלל. אם ההסלמות קשורות לפעולה בלתי הפיכה, ייתכן שזה עיצוב נכון. המדד אינו פחות אדם בכל מחיר. המדד הוא שימוש נכון באדם בנקודת הסיכון.

מדידת ניסיון ראשון מול רצף ניסיונות

הנתון נקי בניסיון הראשון עונה על שאלה חשובה: כמה משימות לא נזקקו לתיקון. הוא אינו מספר מה יקרה אם נריץ כל משימה שוב מסביבה נקייה. 833 מתוך 839 המשימות שנמדדו רצו פעם אחת בלבד. שש קיבלו ניסיון שני שכבר כלל מידע מהניסיון הראשון. לכן התיק ההיסטורי אינו מתאים למדד רצף.

המדריך לאמינות לאורך רצף ניסיונות מסביר למה נדרש הארנס נפרד. כל ניסיון מתחיל מסביבה נקייה, אוכף בקרת שלילה ודורש אישור הפיכות. המדידה הזאת משלימה את התיק ההיסטורי. היא אינה מחליפה אותו, כי תיק אמיתי חושף תורים, הרשאות והסלמות שהארנס מבודד בכוונה.

שתי המדידות צריכות לחיות זו לצד זו. הארנס בודק יכולת חוזרת בתנאים נשלטים. מדידת הפרודקשן בודקת אם העבודה נסגרת בתוך מערכת חיה. פער ביניהן הוא מידע. הוא יכול להצביע על הקשר, כלי, הרשאה או תפעול שמוסיפים קושי מעבר למשימה הבסיסית.

לוח מדדים שמספר אמת שימושית

לוח ראשון יכול להיות קטן. הציגו הזמנות חדשות, תוצרים מקושרים, עבודה בלי תוצר, חלוקת תוצאות, הסלמות וזמן עד בעלים. אל תערבבו זמינות עם אמינות. משימה מתוזמנת שרצה היא תשתית זמינה. היא לא מוכיחה שהסוכן יצר תוצאה נכונה.

  • שיעור הזמנות עם תוצר מקושר.
  • התפלגות נקי, חלקי, הסתייגות, כשל ובלי תווית.
  • מספר הסלמות לפי סיבה וזמן טיפול.
  • חסימות שער והפעולה שנשמרה אחריהן.
  • ביקורת חיצונית מדגמית מול ההערכה העצמית.

השלב הבא הוא ביקורת עצמאית. דוגמים תוצרים, מגדירים מחוון ומפרידים בין הסוכן שמבצע לבין הבודק. הבדיקה כוללת גם משימות נקיות, חלקיות וחסרות תוצר, כדי שהמדגם לא יבחר רק את המקרים הקלים. עד שהשכבה הזאת קיימת, מציגים במפורש ששדה התוצאה הוא הערכה עצמית. אמון נבנה מההסתייגות הזאת. הוא לא נפגע ממנה.

הטכנולוגיה שמאחורי זה

מדידת אמינות על עבודה אמיתית דורשת מקור רשומה אחד וקפוא, וחלון זמן שמוצמד לכל מספר. זה מה שמפריד בין ראיה לבין הרושם שהמערכת עובדת.

אפשר לקרוא את איך גבורה מודדת את עצמה, או לראות את ההסבר המלא בעברית על מערכת ההפעלה האגנטית.

שאלות נפוצות

מהו המדד הראשון לאמינות סוכן?

הקשר בין הזמנת עבודה לתוצר מקושר. הוא מראה אם פעילות הסתיימה במשהו שבעלים יכול לבדוק. אחריו מוסיפים מצב תוצאה, הסלמות וביקורת חיצונית.

למה מדווחים טווח השלמה?

כי קיימות הזמנות בלי תוצר. הקצה העליון מודד משימות נקיות מתוך הבסיס עם תוצר מקושר, והקצה התחתון סופר את העבודה החסרה ככישלון. הטווח חושף את ההנחות במקום להסתיר אותן.

האם שדה התוצאה של הסוכן מספיק?

לא לבדו. זהו דיווח שימושי לתפעול, אך הוא הערכה עצמית. צריך ביקורת חיצונית מדגמית, קריטריונים קבועים וראיות תוצר כדי להפוך אותו למדד אמינות חזק.

האם הסלמה לאדם נחשבת כשל?

תלוי בחוזה. אם המדיניות דרשה אישור, הסלמה מלאה היא הצלחה תפעולית. אם הסוכן מסלים בגלל הקשר חסר שהיה אמור לקבל, זו הזדמנות לתיקון. תמיד מודדים את הסיבה ואת איכות חבילת ההסלמה.

רוצים למדוד את התהליך, לא את הרושם?

נחבר הזמנה, תוצר, תוצאה והסלמה בתהליך אחד. תקבלו קו בסיס, קבוצת מצבים לא ידועים ורשימת תיקונים שמגדילה את הראיות לפני שמגדילים אוטונומיה.

לתיאום מדידת אמינות

רוצים ש-OpticoAI יעשה את זה בשבילכם?

מערכת ההפעלה האגנטית ←

מאמרים קשורים

Similar Posts

כתיבת תגובה

האימייל לא יוצג באתר. שדות החובה מסומנים *