Agentic Operating System
מערכת הפעלה אגנטית שמריצה עסק חי
מערכת הפעלה אגנטית היא שכבת תפעול שמנהלת כמה סוכני AI לאורך זמן. היא מחברת עבודה לזיכרון ולכלים, ובקוד שלה נקבע מתי אפשר לבצע ומתי אדם חייב להיכנס לתמונה.
מערכת הפעלה אגנטית שמריצה עסק חי. סוכנים מרובים, זיכרון מתמשך, ושער בקוד על כל פעולה שיוצאת החוצה.
הבדל קטגוריה
למה זו לא ספרייה
ספרייה מפעילה סוכן ברגע נתון. מערכת הפעלה מחזיקה את העבודה לפני הריצה ואחריה: מי קיבל משימה, איזה זיכרון מותר לקרוא, איזה כלי זמין ומתי השער עוצר.
| השאלה | LangGraph / CrewAI / AutoGen | Sierra / Agentforce | המערכת שלנו |
|---|---|---|---|
| מה זה | ספרייה שבונים איתה | פלטפורמה ארגונית | מערכת שרצה על עסק חי |
| מי מפעיל | המפתח שלך | הצוות שלך עם הטמעה | שכבת תפעול פעילה |
| ממשל | אתה כותב אותו | מנוע מדיניות מנוהל | ארבעה שערים בקוד, נסגרים כברירת מחדל |
| הוכחה | דוגמאות ובנצ'מרקים | לוגו לקוחות | פעולות מתועדות על עסק אמיתי |
LangGraph נותן לך גרף. CrewAI נותן לך תפקידים. שניהם נותנים לך את הרגע שבו הסוכן רץ. אף אחד מהם לא נותן לך את הרגע שבו הוא לא צריך לרוץ.
הסטאק
שש שכבות, מהמודל עד ליומן ההחלטות
החלק הנדיר נמצא בתחתית הסטאק: אכיפת מדיניות ויכולת לשחזר מה קרה. שם מערכת ניסוי הופכת לתשתית שאפשר להפעיל על עסק.
מודל
מודל לתכנון וסקירה, מודל לביצוע. הבחירה נעשית לפי סוג העבודה.
כלים
298 תיקיות כלים עם קוד מקור ו-101,495 שורות קוד בפייתון.
זיכרון
867 רשומות מובנות ואינדקס של 2,942 מקטעים על 751 קבצים, עם גבול פרטיות אכוף בקוד.
אורקסטרציה
1,195 הזמנות עבודה, 929 תוצרים ו-96 הסלמות על פני 102 ימים.
מדיניות
ארבעה שערים בקוד. הם חסמו 29 מתוך 137 החלטות, 21%, ושמרו את הסיבה.
תצפית וביקורת
7,321 פעולות מתועדות על פני 92 ימים, לצד יומן החלטות נפרד לכל שער.
רמת אוטונומיה
מ-L0 עד L4, עם הורדה אוטומטית לפני נזק
המערכת עובדת ב-L3 ובחלק מהזרימות ב-L4. כסף, פרסום או הודעה ללקוח מורידים את הזרימה ל-L2 ומחזירים אדם לתמונה.
הגבול חשוב יותר מהתווית
רמת האוטונומיה נקבעת לכל זרימה ולכל פעולה. המערכת אינה מקבלת הרשאה גורפת רק משום שזרימה אחת הוכיחה את עצמה.
מתחילים מסוכן אחד?
עמוד הקמת סוכן AI לעסק מתאים לארגון שנמצא ב-L1 או L2 ורוצה תפקיד ממוקד לפני שכבת תפעול מלאה.
קבלות מפרודקשן
מה המערכת מריצה בפועל
המערכת מחוברת לעבודה שיש בה לקוחות, כסף ותהליכים שחוזרים כל יום. המספרים כאן מתארים מערכות חיות, עם התאריך והמגבלה של כל מדידה.
שכבת הריצה החדשה
שכבת ריצה חדשה נבנתה ב-6 באוגוסט 2026. ששת הזרימות הראשונות הוגרו אליה מ-Windows Task Scheduler והריצו 4,365 flows עם 16 כשלים. שאר המשימות עדיין על המתזמן הישן, וההגירה מתבצעת בגלים.
חשבונאות
ממייל למסמך מתויק
3,077 שרשורי מייל נסרקו, ו-503 קובצי PDF מתויקים עם נתיב חזרה למקור.
מדיה בתשלום
תוצאה כפי שגוגל מודדת
תשואה של כמעט פי עשרה כפי שגוגל מודדת. זו אטריבוציה של פלטפורמת המודעות.
שירות לקוחות
עבודה מול לקוחות אמיתיים
בוט החנות ניהל 458 שיחות לקוח ו-2,595 הודעות, עם גישה חיה לקטלוג ולהזמנות.
המספרים
טווח אמין עדיף על מספר עגול
המדידה מפרידה בין עבודה שנחתה נקייה, עבודה חלקית, כשל מלא והזמנה שאין לה רשומת תוצר.
שדה התוצאה נכתב על ידי הסוכן המבצע על עצמו. זו הערכה עצמית ולא ביקורת חיצונית. בנוסף, 356 הזמנות עבודה אינן מחזיקות רשומת תוצר; לכן שיעור ההשלמה מוצג כטווח 44.5% עד 63.4%.
אי אפשר לגזור pass^k מהתיק ההיסטורי, ולכן בנינו הארנס שמתחיל כל ניסיון מסביבת עבודה נקייה. 833 מתוך 839 המשימות שנמדדו רצו פעם אחת בלבד. הקוד והמתודולוגיה זמינים במאגר הציבורי; תוצאות ההארנס ידווחו בנפרד.
גבולות ההוכחה
מה איננו טוענים
ההסתייגויות כאן הן חלק מהראיה. הן מבהירות מה כבר נבדק, מה עדיין דורש הוכחת פרודקשן ואיפה אדם נשאר בתוך הלולאה.
בידוד דיירים
בידוד דיירים בנוי ונבדק, אך טרם הוכח בפרודקשן. 213 טסטים עוברים ב-14 חבילות, ו-11 מתוך 12 הגנות הבידוד נאכפות. ההגנה הנוספת ממתינה להחלטה מפורשת ומתועדת. עדיין אין דייר חיצוני משלם.
מוצר והטמעה
זה עדיין אינו מוצר לרכישה עצמית. המערכת תפורה למפעיל אחד, וארגון חדש זקוק לעבודת אפיון והטמעה לפני שיוכל להפעיל אותה.
מדידת אמינות
אי אפשר לגזור pass^k מהתיק ההיסטורי, ולכן בנינו הארנס שמתחיל כל ניסיון מסביבת עבודה נקייה. 833 מתוך 839 המשימות שנמדדו רצו פעם אחת בלבד. תוצאות ההארנס ידווחו בנפרד.
פיקוח אנושי
שכבת השיגור הלא-מפוקחת כבויה מאז 19 במאי. המצב התפעולי הוא מקביליות בפיקוח מפעיל, עם ירידה ל-L2 לפני כסף, פרסום או הודעה ללקוח.
גבולות שהאודיט חשף
- רכיב ההפעלה המקבילית הישן מחזיק 39 קובצי bytecode ואפס קוד מקור, ולכן אינו מוצג כיכולת אוטונומית מוכחת.
- תור העבודה שיועד לחיבור נוסף כולל ארבעה קבצים, ושלושה מהם הועברו למבצע אחר. ריבוי הספקים אינו מוצג כיכולת פעילה.
- אינדקס הזיכרון אמיתי, אך שאילתות חיות עוברות כרגע לדירוג לקסיקלי אחרי timeout של 30 שניות מול תהליך שלוקח 33 שניות.
- 11 מתוך 101 המשימות המתוזמנות מחזירות כרגע קוד יציאה שאינו אפס.
- צינור החשבוניות נכשל בכתיבה מדי יום מאז 4/8. שני עותקים של אותו סקריפט מתנגשים על אותו קובץ; סריקת המיילים ממשיכה לעבוד.
הראיה שקשה לייצר בדמו
מה אי אפשר לזייף
המערכת ביצעה אודיט על עצמה, מצאה כשלים וסירבה לאשר טענות שלא עמדו בבדיקה. הדוקטרינה בקוד דורשת מטענה שלילית לצטט את הבדיקה ואת הראיה.
עסק חי משאיר סימנים
יש תורים שנשארו פתוחים, זרימות שנכשלו ושערים שעצרו פעולה. הם מוצגים יחד עם מה שעבד, משום שכך נראית מערכת תפעול אמיתית.
אורן מפתח את המערכת על חשבונו, ומממן את הפיתוח מעבודות פרילנס. השירותים שבאתר הם מה שמממן את הפיתוח, והם גם מה שמוכיח שהמערכת עובדת על עסק אמיתי.
גבורה כאן היא היכולת לעצור פעולה מסוכנת ולתעד למה היא נעצרה, בלי לאבד את הכוונה בדרך.
שיחת התאמה
איפה המערכת צריכה לעצור אצלכם?
השיחה הראשונה עוסקת בתהליכים שכבר פועלים, במערכות שאליהן צריך להתחבר ובפעולות שדורשות אדם. משם אפשר להחליט אם מתחילים מסוכן אחד או משכבת תפעול רחבה.
מה להביא לשיחה
תהליך אחד שחוזר הרבה, דוגמה למקרה שבו טעות עולה כסף, ושם המערכת שבה הנתונים יושבים היום. זה מספיק להתחלה.
שאלות נפוצות
מהי מערכת הפעלה אגנטית?
זו שכבת תפעול שמנהלת כמה סוכני AI לאורך זמן, מחברת עבודה לזיכרון ולכלים ואוכפת בקוד מתי אפשר לבצע ומתי אדם חייב להיכנס לתמונה.
במה זה שונה מסוכן AI אחד?
סוכן אחד מבצע תפקיד. מערכת הפעלה מנהלת כמה תפקידים, זיכרון משותף, הרשאות, תורים ויומן החלטות. ארגון שמתחיל מתפקיד ממוקד יכול להשתמש קודם בשירות הקמת סוכן AI.
איזו רמת אוטונומיה המערכת מפעילה?
הזרימות פועלות ב-L3 ובחלקן ב-L4. לפני כסף, פרסום או הודעה ללקוח, המערכת יורדת ל-L2 ומחכה לאדם.
האם בידוד הדיירים כבר הוכח בפרודקשן?
עדיין לא. 213 טסטים עוברים ב-14 חבילות, ו-11 מתוך 12 הגנות הבידוד נאכפות. אין עדיין דייר חיצוני משלם, ולכן הוכחת הפרודקשן נשארת פתוחה.
איך נמדדת אמינות?
המדידה ההיסטורית מציגה טווח 44.5% עד 63.4% להשלמה נקייה ו-1.2% כשל מלא. שדה התוצאה הוא הערכה עצמית של הסוכן המבצע. בנוסף נבנה הארנס נפרד שמתחיל כל ניסיון מסביבה נקייה.
