Kimi K3: 2.8 טריליון פרמטרים בקוד פתוח - והסוד קורא MoE
Moonshot AI הסינית שחררה במשקלים פתוחים את Kimi K3, המודל הפתוח הכי גדול אי פעם: 2.8 טריליון פרמטרים. אבל רק 16 מתוך 896 מומחים נדלקים בכל צעד, וזה בדיוק מה שהופך מפלצת כזו לזולה. פירקנו איך סין עוקפת את מגבלות הייצוא של השבבים - עם יעילות, לא כוח גס.
מאת Yuval Avidaniקריאה בת 4 דק׳
אהבתם? שתפו
אמ;לק
5 הדברים שצריך לדעת
Moonshot AI שחררה את Kimi K3: 2.8 טריליון פרמטרים, המערכת הפתוחה הראשונה במחלקת ה-3-טריליון. ה-API עלה ב-16.7.2026, והמשקלים המלאים שוחררו להורדה חופשית ב-27.7.2026.
K3 בנוי כ-MoE (תערובת מומחים): 896 'מומחים' קטנים, אבל רק 16 מהם נדלקים לכל טוקן. כלומר מתוך 2.8 טריליון פרמטרים, רק חלק זעיר (כ-50 מיליארד) באמת מחשב בכל צעד. זה מה שהופך מפלצת כזו לזולה להרצה.
K3 קיבל 57 במדד האינטליגנציה של Artificial Analysis - התוצאה הגבוהה ביותר לכל מודל פתוח. ב-Terminal-Bench 2.1 הוא קיבל 88.3%, חצי נקודה בלבד מאחורי GPT-5.6 Sol (88.8%), ובזירת ה-Frontend Code הוא עקף את Claude Fable 5.
K3 אומן ישירות בדיוק נמוך (MXFP4 - נקודה צפה של 4 ביט למשקלים). התוצאה: קובץ המשקלים שוקל כ-1.4 טרה-בייט במקום 5.6 שהיה נדרש בדיוק רגיל. עדיין צריך אשכול רציני, אבל זה קפיצה ענקית בנגישות.
בזמן שהיצוא של שבבים מתקדמים לסין מוגבל, Moonshot מראה שאפשר להגיע לחזית עם ארכיטקטורה חכמה יותר: יעילות אימון גבוהה פי 2.5 מהדור הקודם (K2), ואימון מודע-קוונטיזציה מהשלב הראשון.
Moonshot AI הסינית שחררה בקוד פתוח את Kimi K3 - 2.8 טריליון פרמטרים, המודל הפתוח הכי גדול שהעולם ראה, וכל אחד יכול להוריד אותו החל מה-27 ביולי. וזה עוד לא החלק המפתיע. המפתיע הוא שמפלצת בגודל כזה בכלל אפשרית להרצה, והתשובה מסתתרת בשלוש אותיות: MoE.
בואו נפרק את זה, כי מתחת למספר הענק מסתתר השיעור החשוב באמת של 2026 - איך בונים מודל חזק בלי גישה לשבבים הכי חדשים.
2.8 טריליון פרמטרים - ולמה זה בכלל אפשרי
פרמטרים (parameters) הם המספרים שהמודל לומד באימון, ובגדול, יותר פרמטרים משמעם יותר "מקום" ללמוד בו. אבל יש כאן מלכוד: מודל צפוף (dense) עם 2.8 טריליון פרמטרים היה צריך להדליק את כל הפרמטרים בכל פעם שהוא מייצר מילה - וזה יקר עד בלתי-אפשרי. כאן נכנס הטריק.
K3 בנוי כ-MoE, תערובת מומחים (Mixture of Experts): במקום מוח אחד ענק, יש 896 "מומחים" קטנים, ולכל טוקן נדלקים רק 16 מהם. תחשבו על זה כמו בית חולים: יש בו מאות רופאים מומחים, אבל כשאנחנו מגיעים עם כאב גרון, לא מזמנים את כל הצוות - קורא לנו רופא אף-אוזן-גרון ואולי עוד אחד. כל המומחיות קיימת, אבל רק החלק הרלוונטי עובד בכל רגע.
התוצאה: מתוך 2.8 טריליון פרמטרים, רק חלק זעיר - כ-50 מיליארד, פחות מ-2% מהמודל - באמת מחשב בכל צעד. זה מה שמאפשר מודל בגודל כזה לרוץ במהירות ובמחיר שפוי.
גרף · נתונים מאומתים
2.8 טריליון פרמטרים - אבל רק חלק זעיר עובד בכל צעד
סך כל הפרמטרים2800מיליארדי פרמטרים
פעילים בכל צעד50מיליארדי פרמטרים
הרעיון של MoE (תערובת מומחים): מתוך 2.8 טריליון פרמטרים סך הכל, רק 16 מתוך 896 מומחים נדלקים לכל טוקן - כ-50 מיליארד פרמטרים פעילים בכל צעד, פחות מ-2% מהמודל. זה מה שמאפשר להריץ מודל בגודל כזה במהירות ובמחיר שפוי. מקור: Hugging Face (ResterChed). נכון ל־2026-07.
המספרים: מוביל את הפתוחים, נושף בעורף לסגורים
בואו נהיה מדויקים. K3 הוא לא "הכי חזק בעולם" - הוא הכי חזק מבין הפתוחים, וצמוד באופן מפתיע לחזית הסגורה. במדד האינטליגנציה של Artificial Analysis הוא קיבל 57, התוצאה הגבוהה ביותר לכל מודל במשקלים פתוחים אי פעם. בזירת ה-Frontend Code Arena, שבה מפתחים מדרגים קוד בעיוור, K3 עקף את Claude Fable 5 והתברג ראשון.
הקטע המדליק ביותר הוא בקוד וטרמינל. ב-Terminal-Bench 2.1, מבחן של תפעול טרמינל אוטונומי, K3 קיבל 88.3% - חצי נקודה בלבד מאחורי GPT-5.6 Sol (88.8%), אחד המודלים הסגורים החזקים בעולם. הוא גם מוביל במבחני קוד ארוכי-טווח כמו SWE Marathon ו-Program Bench.
גרף · נתונים מאומתים
Terminal-Bench 2.1: הפתוח נושף בעורף הסגור
Kimi K3 (פתוח)88.3% הצלחה
GPT-5.6 Sol (סגור)88.8% הצלחה
Terminal-Bench 2.1 בודק תפעול טרמינל אוטונומי (הרצת פקודות, קריאת פלט, תיקון). Kimi K3, מודל פתוח, קיבל 88.3% - חצי נקודה בלבד מאחורי GPT-5.6 Sol (88.8%), מודל סגור מהחזית. מקורות: Hugging Face, MindStudio. נכון ל־2026-07.
חשוב לומר גם את הצד השני: כמה מהמקורות מדגישים שסיכון ההזיות (hallucinations) של K3 לא פורסם בשקיפות מלאה, ובמשימות אוטומציה מסוימות הוא עדיין מאחור. מודל פתוח וחזק זה נהדר, אבל אימות עצמאי חשוב שבעתיים כשהיצרן בוחר מה לפרסם.
הקסם השני: קוונטיזציה של 4 ביט
יש כאן חדשנות שנייה ששווה להבין, כי היא זו שמאפשרת בכלל להוריד את המפלצת הזו. בדרך כלל מאמנים מודל בדיוק גבוה (16 ביט לכל מספר), ורק אחר כך "מכווצים" אותו לדיוק נמוך כדי לחסוך זיכרון - תהליך שנקרא קוונטיזציה (quantization), ושבו לרוב מאבדים קצת איכות.
Moonshot עשו את זה הפוך: הם אימנו את K3 מלכתחילה בדיוק של 4 ביט (פורמט בשם MXFP4), כך שהמודל למד לפצות על הדחיסה תוך כדי האימון. התוצאה מרשימה: קובץ המשקלים שוקל כ-1.4 טרה-בייט, במקום כ-5.6 טרה-בייט שהיה נדרש בדיוק רגיל. זה עדיין לא רץ על הלפטופ שלנו - צריך אשכול של כמה שרתים - אבל זו קפיצת נגישות עצומה, והפורמט נתמך במקורי על שבבי Blackwell של Nvidia ו-MI400 של AMD.
צעד אחר צעד
איך מריצים מפלצת של 2.8 טריליון פרמטרים בלי לפוצץ את הזיכרון
1
1 / 4
למה זה סיפור על גיאופוליטיקה, לא רק על AI
וכאן מגיע ההקשר הגדול. ארצות הברית מגבילה כבר שנים את יצוא השבבים המתקדמים לסין, מתוך הנחה שבלי החומרה הכי חדשה, קשה לאמן מודלים בחזית. K3 הוא ההוכחה שהיעילות יכולה לפצות על החומרה. במקום כוח גס, Moonshot השקיעה בארכיטקטורה חכמה: תשומת-לב ליניארית היברידית, אופטימייזר ברמת ראש-הקשב, ואימון מודע-קוונטיזציה - שיחד נותנים לפי דיווחיהם יעילות אימון גבוהה פי 2.5 מהדור הקודם, Kimi K2.
בעיניי, זה הצד שהכי קל לפספס בכותרת "המודל הכי גדול". השורה התחתונה היא לא הגודל, אלא ההוכחה שאפשר להגיע לחזית עם פחות שבבים, אם עובדים חכם יותר. וזה, לכל מי שבונה על קוד פתוח, חדשות מצוינות: עוד שחקן חזק, פתוח, שמפזר את הכוח במקום לרכז אותו אצל שתי-שלוש חברות סגורות.
בדקו את עצמכם
אם ל-Kimi K3 יש 2.8 טריליון פרמטרים, למה בכלל אפשר להריץ אותו במהירות?
שורה תחתונה
בעיניי, Kimi K3 הוא שני סיפורים בגוף אחד. הראשון טכני: MoE וקוונטיזציה של 4 ביט הם הסיבה שמודל של 2.8 טריליון פרמטרים בכלל אפשרי להרצה - לא הגודל, אלא כמה ממנו עובד בכל רגע. השני גיאופוליטי: סין מראה שיעילות מנצחת מגבלות ייצוא. ההסתייגות שלי הוגנת - לא כל מספר פורסם בשקיפות, וצריך אשכול רציני כדי להריץ את זה - אבל הכיוון ברור.
אז אם המודל הפתוח הכי גדול בעולם כבר נושף בעורף החזית הסגורה, ומגיע מחברה שאמורה בכלל להיות מוגבלת בחומרה - מה זה אומר על היתרון של הענקים הסגורים?