כל מודל משמעותי, נבדק על אותה אפליקציה עם חבלות
גרסה 4 היא אפליקציית Rails אחת שגדלה לאורך שבעה ספרינטים, בזמן שסוכן משנה מבודד שותל ארבע־עשרה חבלות שמבוססות על CVEs אמיתיים. המודלים מדורגים לפי ערנות: האם הם שמו לב למה שנשבר ותיקנו אותו? כדי להגיע לזה בניתי את הבנצ׳מרק מאפס בפעם השלישית.
כשמודל חזית משמעותי יוצא, הוא עובר דרך אותה טבלה. הסבב האחרון הוסיף 5 מודלים ב-23 בספטמבר 2026. כך אני בוחר באיזה מודל להשתמש למה, וכמה כל אחד עולה למשימה.
- 44
- מודלים מדורגים
- 14
- חבלות לגלות
- 7
- ספרינטים בכל הרצה
- $4,000+
- הוצאו ב-9 ימים

בנצ׳מרקים
הנתונים שמאחורי הבחירות שלי במודלים, ואיך השיטה השתנתה כשהבדיקות הישנות הגיעו לרוויה.
בנצ׳מרק LLM v4: Opus 5.5, GPT 6 Sol ו-Luna, MiMo 2.6, Grok 4.7
חמישה מודלים חדשים נכנסים לטבלה של v4. האם שווה לשדרג, ולמה Grok 4.7 נסוג לאחור ביחס לקודם שלו.
בנצ׳מרק ה-LLM החדש v4, חלק 1: התהליך
למה זרקתי גרסה שלמה, איך עובדת אפליקציית ה-Rails עם החבלות, וכמה זה עלה: יותר מ-4,000 דולר בתשעה ימים.
בנצ׳מרק ה-LLM החדש v4, חלק 2: דירוג של 39 מודלים
הטבלה המלאה, מדורגת לפי ערנות. שישה מודלים בתיקו בפסגה, מודל חינמי שעוקף חצי מ-Claude, ועלות מול ציון.
בנצ׳מרקים ל-LLM: שווה לערבב מודלים באותו פרויקט?
שבעה שילובים ב-Claude Code, ב-opencode וב-Codex, ולמה מודל חזק אחד נשאר ברירת המחדל.
איך אני עובד עם סוכנים
התהליך, ה-skills ורשתות הביטחון שמאפשרים לאדם אחד לתחזק כל כך הרבה פרויקטים.
קצת על ה-skills שלי ל-AI
skills הם פרומפטים בקובצי טקסט. שלי סגרו יותר מאלף PRs ו-issues. קראו אותם, ואז כתבו משלכם.
תפסיקו לחפש תירוצים ותשחררו יותר
כשמודלי החזית טועים פחות מרוב המפתחים, הבירוקרטיה של code review היא התירוץ האחרון לעכב דיפלוי. המספרים שלי מאז פברואר.
תרומות AI לפרויקטי קוד פתוח: הדעה שלי
pull requests שנכתבו ב-AI כאן כדי להישאר, כולל הזבל. תעשו אוטומציה למיון ולביקורת, והשאירו את ההחלטה הסופית לבני אדם.
שיטות עבודה מומלצות בקוד פתוח עם LLMs: המינימום
התקנה פשוטה, בדיקות ו-CI אמינים, ותיעוד שמסביר את הבעיה. גרסאות סטנדרטיות הופכות את האוטומציה לצפויה.
Clean Code לסוכני AI
כשסוכן הוא הקורא העיקרי: קוד קטן, שמות שקל למצוא ב-grep, מקור מתועד, בדיקות ללא ממשק וכללים מפורשים.
איך אני מונע מהסוכנים שלי למחוק לי דברים
חמישה חודשים במצב YOLO בלי תקלה, ועדיין בלי אמון: snapshots של BTRFS, גיבויים עם restic, sandbox ומשמעת.
ניסויים וכלים
דברים שבניתי או ניסיתי, כולל אלה שלא עבדו.
אתגר AI: המרת ROMs של NES ל-Master System
מודלי החזית מול תרגום מ-6502 ל-Z80, עם האמולטור בתור אורקל המשוב, והמקום שבו ה-mappers תוקעים הכול.
משתמש ב-AI כדי לפתור את הבעיות הקטנות של היומיום
שעון שולחני עם ווידג׳טים, קוראי מנגה, אימייל, תרגול הקלדה, קריוקי: כלים קטנים שנולדו ממטרדים קטנים.
ai-memory 2.0
הפורמט הפתוח OKF, embeddings מקומיים כברירת מחדל וצוותים שעובדים במקביל, בהשוואה לחלופות.
Vibe code: מאפס לפרודקשן בשישה ימים
איך הניוזלטר, הבלוג, הפודקאסט ובוט ה-Discord של The M.Akita Chronicles עלו לאוויר בשישה ימים וב-201 קומיטים.
דעות
המקום שבו אני דוחף נגד ההייפ. צפו למילים חריפות.
אני מעדיף לבקש סליחה מאשר לבקש רשות.
דעה חריפה: harness engineering, loop engineering ו-graph engineering הם שטויות
שלושים מאגרים ציבוריים, בנצ׳מרק ומרתון AI, ואף אחד מהם לא היה צריך דיסציפלינה חדשה עם תג מחיר של ייעוץ.
חפירה: ה-AI הרג את המתכנתים?
למה AI לא יחליף מתכנתים מנוסים, התקרה של עקומת ה-S של מודלי ה-LLM של היום, ומה משתנה למהנדסים.
כל מה שיש כאן הוא קוד פתוח
הכלים, ה-skills והבנצ׳מרק הם מאגרים ציבוריים. עשו להם fork ובנו את הגרסה שמתאימה לדרך שבה אתם עובדים.