המערכת של YUV.AI

הדרכות

מדדנו כמה טוקנים עולה 'שלום': המילה - 9, דרך Claude Code - 43,483

המילה 'שלום' עולה 9 טוקנים - אבל דרך Claude Code היא שוקלת 43,483, פי כמעט 4,800. מדדנו שבעה מודלים עד הטוקן הבודד: קלט, פלט, מצב חשיבה (מודל אחד שרף 264 טוקנים על ברכה), ומס-העברית שמכפיל את החשבון.

אהבתם? שתפו
מדדנו כמה טוקנים עולה 'שלום': המילה - 9, דרך Claude Code - 43,483

אמ;לק

5 הדברים שצריך לדעת

'שלום' עצמה עולה רק 2-10 טוקני קלט (Gemini 2, GPT 7-8, Claude 9-10). כל השאר בחשבון הוא תקורה קבועה, מצב חשיבה, ומעטפת הפלטפורמה. ב-Claude 70-80% מ'מילה אחת' זה תקורה; ב-Gemini התקורה כמעט אפס.

המנוע הוא קוד, אבל אוצר-המילים מאומן על קורפוס (BPE: ממזגים שוב ושוב את הזוג הכי תכוף). לכן 'שלום' היא טוקן אחד בטוקנייזר החדש של GPT-4o, אבל 4 טוקנים - כולל שברי-בייטים - בטוקנייזר הישן. קורפוס אנגלוצנטרי = עברית יקרה.

על פסקה זהה (תוכן טהור): GPT-4o (o200k) 1.34x, Gemini 1.66x, Claude 1.90x, GPT-4 הישן (cl100k) 3.96x. פסקה של 99 טוקנים באנגלית = 188 ב-Claude. אזהרה: על מחרוזות קצרות התקורה מדללת את היחס ומטעה.

Haiku 4.5 שילש את הפלט (27→81); Gemini 2.5 Flash חשב 31, Gemini 3.5 Flash 264, ו-GPT-5 בין 64 ל-192 טוקני reasoning - על מילה אחת. Opus 4.8 עם adaptive thinking היה היחיד שחשב 0.

הבייסליין הוא הקריאה העירומה (2-10 טוקנים). מס-הפלטפורמה = סיסטם-פרומפט + כלים + זיכרון. מדדנו את Claude Code מלוגי הסשן: 43,483 בתור ראשון, 119,331 בממוצע, 95% מהקאש. ברמת פלטפורמה, בחירת ה-LLM כמעט לא משנה - המעטפת שולטת.

הכתבה ב־5 שניות · נבנה עם HyperFrames

המילה "שלום" עולה למודל שפה בין 2 ל-10 טוקנים בלבד. אבל כששלחנו אותה דרך Claude Code - סוכן הקוד שבו עבדנו על המחקר הזה - היא עלתה 43,483 טוקנים בתור הראשון. אותה מילה, פי כמעט 4,800. אז פתחנו טרמינל, חיברנו את ה-API של Anthropic, של Google ושל OpenAI, ומדדנו הכל עד הטוקן הבודד: קלט, פלט, חשיבה, עברית מול אנגלית, על פני שבעה מודלים. מצאנו מס-עברית שאף אחד לא מדבר עליו, ומודל שלם שחושב 264 טוקנים כדי לענות "שלום". בואו נצלול, עם כל המספרים.

התכלס: כמה עולה "שלום" בכל מודל

לפני ההסברים, הנה המספרים המדודים - כמה טוקנים עולה "שלום" בודדת:

  • Claude Opus 4.8 - 9 טוקני קלט, בערך 26 פלט. חשיבה: 0. הוא מספיק חכם לא לחשוב על ברכה.
  • Claude Haiku 4.5 ו-Sonnet 4.6 - 10 טוקני קלט, בערך 27 פלט. אבל אם מדליקים חשיבה, Haiku קופץ ל-81 טוקני פלט - פי 3 על אותה מילה.
  • Gemini 2.5 Flash - 2 טוקני קלט בלבד (!), בערך 11 פלט. אבל כברירת מחדל הוא חושב 31 טוקנים על "שלום", ו-Gemini 3.5 Flash חושב 264.
  • GPT-4.1 - 8 טוקני קלט, 8 פלט, בלי reasoning. אבל GPT-5 חשב בין 64 ל-192 טוקני reasoning על "שלום" - עד פי 24 מ-8 הטוקנים ש-GPT-4.1 צריך לאותה מילה בדיוק. על מילה אחת.
  • Claude Code (כאן, בטרמינל) - אותה "שלום" עולה 43,483 טוקני קלט בתור הראשון, כי הסיסטם-פרומפט הענק נוסע איתה. פי כמעט 4,800 מהמילה עצמה.

השורה שחוזרת על עצמה: המילה "שלום" עולה 2 עד 10 טוקנים. כל השאר בחשבון - התקורה, החשיבה, ומעטפת הסוכן - זה מה שבאמת עולה כסף.

השוואה

אותה 'שלום', ארבעה עולמות - כמה היא עולה בכל אחד

איך מדדנו את כל זה? חיברנו ישירות את שלושת ה-APIs - של Anthropic, של Google ושל OpenAI. לכל אחד יש דרך לספור טוקני קלט בחינם בלי להריץ את המודל (כמו count_tokens של Anthropic, שתאם אצלנו בול לחיוב האמיתי), ואת הפלט ואת טוקני החשיבה ראינו בשדה ה-usage של תשובה אמיתית. ואת GPT מדדנו חי מול ה-API של OpenAI - GPT-4.1 ו-GPT-5, כולל טוקני ה-reasoning.

בואו נפרק כל אחד מהממצאים, כי מאחורי כל מספר יש לקח. אבל קודם - צריך להבין מה בכלל מודדים.

מה זה בכלל טוקנייזר, ואיך בונים אחד?

טוקנייזר הוא הרכיב שממיר טקסט למספרים שהמודל מבין. הוא מפרק את "שלום" לרשימה של מזהי-טוקן (מספרים), והמודל עצמו אף פעם לא רואה אותיות - רק את המספרים האלה. תחשבו עליו כמו על מילון שממפה חתיכות-טקסט למספרים.

השאלה המעניינת: טוקנייזר זה קוד או מודל? התשובה היא שניהם. המנוע שמפרק טקסט לפי המילון הוא קוד פשוט וזריז. אבל המילון עצמו - כלומר איזה רצף אותיות זוכה לטוקן משלו - לא נכתב ביד. הוא נלמד מדאטה, בדיוק כמו מודל.

איך מאמנים טוקנייזר? השיטה הנפוצה נקראת BPE (קיצור של Byte-Pair Encoding). מתחילים ממצב שבו כל תו הוא טוקן נפרד, ואז חוזרים שוב ושוב על פעולה אחת: מוצאים את זוג הטוקנים הצמודים שמופיע הכי הרבה בטקסט, וממזגים אותו לטוקן חדש אחד. הרצנו את זה בפועל על קורפוס קטן - כלומר ערימת טקסט קטנה - של מילים עבריות, ותוך חמישה מיזוגים הטוקנייזר "למד" את המילה שלום:

How a tokenizer is built - a tiny BPE trainer (and the pieces of שלום)
import tiktoken
# A tokenizer's VOCAB is trained, not hand-written. BPE = start from
# characters, then repeatedly merge the most frequent adjacent pair.
from collections import Counter

corpus = ("שלום עולם שלום לכולם עולם יפה שלום שלום עולם עולם " * 40).split()
vocab = [list(w) for w in corpus]           # every char is its own token
for step in range(5):
    pairs = Counter((a, b) for w in vocab for a, b in zip(w, w[1:]))
    best, freq = pairs.most_common(1)[0]      # the hottest adjacent pair
    vocab = [merge(w, best) for w in vocab]   # fuse it everywhere
    print(f"merge #{step+1}: {best[0]}+{best[1]} -> {''.join(best)}  ({freq}x)")

# And the payoff - the SAME word in two real OpenAI tokenizers:
for name in ["o200k_base", "cl100k_base"]:
    ids = tiktoken.get_encoding(name).encode("שלום")
    print(name, len(ids), "tokens", ids)

תסתכלו על הפלט: קודם ש+ל התמזגו ל-של, אחר כך של+ו ל-שלו, ואז שלו+ם ל-שלום שלמה. זה כל הטריק: רצף שמופיע הרבה בקורפוס האימון זוכה לטוקן משלו; רצף נדיר נשאר מפורק לחתיכות. (הטוקנייזר של Gemma ו-Gemini בנוי בכלי בשם SentencePiece, שמאמן אוצר-מילים בשיטה קצת אחרת מ-BPE - הוא מתחיל מאוצר גדול ומקצץ ממנו במקום לבנות מלמטה - אבל הרעיון שמעניין אותנו זהה: אוצר-המילים נלמד מדאטה, לא נכתב ביד.)

וכאן טמון כל מקור מס-העברית: הקורפוסים שמאמנים עליהם טוקנייזרים הם ברובם המכריע אנגלית. אז לאנגלית יש המון מיזוגים - מילים שלמות זוכות לטוקן - ולעברית, שהיא מיעוט זעיר בדאטה, נשארים מעט מיזוגים, והמילים נשארות מפורקות ויקרות.

מילון קטן: קורפוס, אוצר-מילים, ואמבדינג (ולמה בכלל צריך אותם)

עצרנו על כמה מונחים - קורפוס, אוצר-מילים - ואני חייב להסביר אותם באמת, כי בלעדיהם קשה להבין מה קורה מתחת למכסה המנוע. וגם נוסיף מונח שלישי שכולם זורקים ומעטים מסבירים: אמבדינג. בשורש הכל יש בעיה אחת פשוטה: מחשב יודע לעשות חשבון רק על מספרים, אבל שפה היא טקסט. אז כדי שמודל יעבוד בכלל, צריך לתרגם טקסט למספרים בכמה שלבים, וכל שלב פותר בעיה משלו:

  • קורפוס הוא ערימת הטקסט הענקית שממנה לומדים - מיליארדי מילים מהאינטרנט, ספרים וקוד. הבעיה שהוא פותר: אי אפשר ללמד מכונה שפה עם חוקים, כי שפה מבולגנת מדי; במקום זה מראים לה המון טקסט אמיתי, והיא לומדת לבד את הדפוסים. תחשבו על ילד שלומד לדבר משמיעה של מיליוני משפטים, לא מספר דקדוק. וכאן, אגב, נולד מס-העברית: הקורפוס הוא ברובו אנגלית, אז המכונה כמעט לא "שמעה" עברית - ולכן היא יקרה לה.
  • אוצר-מילים (המילון) הוא הרשימה הסופית והקבועה של כל הטוקנים שהמודל מכיר - למשל כ-200 אלף ערכים ב-o200k (ובטוקנייזר של Gemini כ-256 אלף). הבעיה שהוא פותר: יש אינסוף מחרוזות אפשריות, אבל מודל צריך מספר סופי וקבוע של אבני-בניין לעבוד איתן. תחשבו על ערכת לגו עם מספר קבוע של צורות - בונים ממנה הכל, ואם מילה שלמה לא נמצאת כאבן אחת, מרכיבים אותה מהרבה חתיכות קטנות ויקרות (בדיוק מה שקורה לעברית).
  • אמבדינג (embedding) הוא ההמרה של טוקן - שהוא רק מספר-מזהה שרירותי - לרשימה של מספרים (וקטור) שתופסת את המשמעות שלו. הבעיה שהוא פותר: המזהה 106154 (המספר של "שלום" ב-o200k) הוא שרירותי לגמרי, הוא לא אומר כלום על המשמעות, ומזהה 5 ומזהה 9000 לא קשורים זה לזה. אמבדינג נותן לכל טוקן "קואורדינטות על מפת-משמעות", כך שמילים דומות יושבות קרוב זו לזו, ואפשר לעשות חשבון על משמעות. בלי אמבדינג, למודל אין שום דרך "להבין" שיש קשר בין מילים - יש לו רק מספרים חסרי-פשר.

אז התמונה המלאה, מקצה לקצה: הטקסט שלנו עובר טוקנייזר שמפרק אותו לטוקנים (מספרים), כל טוקן הופך לאמבדינג (וקטור משמעות), והמודל עובד על הווקטורים האלה ומייצר טוקנים בחזרה. הטוקנים שאנחנו סופרים לאורך כל הכתבה הם החוליה הראשונה בשרשרת הזאת - ולכן "כמה טוקנים" זה לא פרט טכני, זה הבסיס של כל החשבון.

מטקסט למספרים: כל השרשרת בתוך מודל שפה

  1. טקסט

    מה שאנחנו כותבים - למשל 'שלום'.

  2. טוקנייזר

    מפרק את הטקסט לטוקנים לפי אוצר-מילים שנלמד מקורפוס.

  3. טוקנים (מספרים)

    כל חתיכה הופכת למזהה - 'שלום' = 106154. פה נמדד כל החשבון של הכתבה.

  4. אמבדינג (וקטורים)

    כל מזהה הופך לרשימת מספרים שתופסת משמעות - מילים דומות יושבות קרוב.

  5. המודל

    עובד על הווקטורים, ומייצר טוקנים בחזרה - זה הפלט שאנחנו קוראים.

לראות את זה בעיניים: איך "שלום" מתפרקת

רוצים לראות את מס-העברית ממש בעיניים? הנה איך המילה "שלום" מתפרקת בשני הטוקנייזרים של OpenAI:

  • בטוקנייזר החדש (o200k, של GPT-4o ו-GPT-5): "שלום" היא טוקן אחד שלם. המילה כולה היא אריח לגו אחד.
  • בטוקנייזר הישן (cl100k, של GPT-4): "שלום" היא ארבעה טוקנים - 'ש', 'ל', ואז שני שברי-בייטים גולמיים (למשל 0xd7·0x95), שאפילו לא אות שלמה אלא חצי-אות ברמת הבייטים.

בטוקנייזר הישן, "שלום" לא סתם פורקה לאותיות - היא פורקה לחצאי-אותיות ברמת הבייטים. זה מס-העברית בצורתו הכי גולמית.

בדקו את עצמכם

המילה 'שלום' בטוקנייזר החדש של GPT-4o (o200k) היא טוקן אחד. בטוקנייזר הישן של GPT-4 (cl100k), לכמה טוקנים היא מתפרקת?

עברית מול אנגלית - הדאטהסט המלא

עכשיו למספרים המסכמים, כי מדדנו הרבה יותר מ"שלום". לקחנו חמישה זוגות של משפטים עברית↔אנגלית באותה משמעות, ואז פסקה שלמה, ומדדנו בכל הטוקנייזרים.

הממצא הכי חד הגיע דווקא מהפסקה הארוכה - ושם גם למדנו לקח מתודולוגי חשוב. אותה פסקה, במשמעות זהה בעברית ובאנגלית:

  • בטוקנייזר של GPT-4o (o200k): 90 טוקנים בעברית מול 67 באנגלית - מס של 1.34.
  • ב-Gemini: 111 מול 67 - מס של 1.66.
  • ב-Claude: 188 מול 99 - מס של 1.90, כמעט כפול.
  • בטוקנייזר הישן של GPT-4 (cl100k): 265 מול 67 - מס של 3.96, כמעט פי 4.

אותה פסקה בדיוק הופכת מ-99 ל-188 טוקנים ב-Claude (פי 1.9), ובטוקנייזר הישן של GPT-4 מ-67 ל-265 (כמעט פי 4). עברית פשוט עולה יותר, בכל מודל.

גרף · נתונים מאומתים

מס-העברית: פי כמה יותר טוקנים מאנגלית (פסקה זהה, תוכן טהור)

GPT-4o/5 · o200k1.34× לעומת אנגלית
Gemini 2.51.66× לעומת אנגלית
Claude1.9× לעומת אנגלית
GPT-4 ישן · cl100k3.96× לעומת אנגלית

יחס טוקנים עברית/אנגלית על פסקה זהה בת ~45 מילים, שבה תקורת-ההודעה זניחה (מדידה נקייה). מקורות: tiktoken (o200k=GPT-4o/5, cl100k=GPT-4 ישן), Gemini countTokens, Claude count_tokens. נמוך = יעיל יותר. אזהרה מתודולוגית: על מחרוזות קצרות + ספירת-API גולמית התקורה הקבועה של Claude מדללת את היחס ומטעה - לכן מדדנו על פסקה ארוכה. נכון ל־2026-07.

בתכל'ס לארנק: אותו טקסט, אותה משמעות - ומי שכותב בעברית משלם ל-Claude כמעט כפול, וממלא חצי מחלון-ההקשר על אותו תוכן. זה מס שגובים מאיתנו רק כי שפת-האם שלנו היא מיעוט בדאטת האימון.

והנה הלקח המתודולוגי, כי כמעט טעינו בו בעצמנו: אסור להשוות טוקנייזרים על מילים קצרות דרך ספירת-API גולמית. ל-Claude יש תקורה קבועה של בערך 7 עד 8 טוקנים לכל הודעה, שמדללת את היחס כלפי מטה - על "שלום" בודדת Claude נראה יעיל יותר מ-Gemini, וזה בדיוק הפוך מהאמת. רק על טקסט ארוך, בלי רעש התקורה, מתקבל הדירוג הנכון: GPT-4o הכי יעיל בעברית, אחריו Gemini, אחריו Claude, והרחק מאחור הדור הישן של GPT-4.

אז למה ל-Claude אין טוקנייזר פומבי? (וכן, טעינו קודם)

כאן חשוב לתקן משהו שבדקנו לעומק. הרושם הראשוני היה ש"רק OpenAI מפרסמת טוקנייזר" - וזה פשוט לא נכון. הנה התמונה המדויקת:

  • OpenAI מפרסמת את tiktoken בקוד פתוח, להורדה והרצה מקומית.
  • גוגל מפרסמת את הטוקנייזר של Gemma (המודל הפתוח שלה), ולפי גוגל, Gemma חולקת את אותה משפחת-טוקנייזר ואוצר-מילים עם Gemini (SentencePiece, אוצר של כ-256 אלף). כלומר אפשר להוריד ולהריץ מקומית טוקנייזר שהוא קירוב טוב מאוד לזה של Gemini - לא בהכרח זהה-בייט-לבייט לגרסה הנוכחית, אבל מספיק קרוב כדי לספור.
  • Anthropic לא מפרסמת כלום: אין מודל פתוח, אין ספרייה, רק count_tokens API.

החריג האמיתי הוא דווקא Anthropic - היא הכי סגורה מבין השלוש, וזו טעות שהייתה לי קודם. בעיניי זו ביקורת הוגנת. אז למה בכל זאת לסגור? שלוש סיבות סבירות: אוצר-המילים מסגיר מידע על דאטת האימון, יש בו טוקנים מיוחדים שאפשר לנצל להזרקת פקודות, ואי-פרסום נותן גמישות לשדרג בין גרסאות. ומה עם החשד ש"בזבזני בכוונה כדי לגבות יותר"? את זה המדידות דווקא הפריכו: Claude יעילה בעברית פי-שניים מהטוקנייזר הישן של GPT-4, ובזבוז טוקנים פוגע קודם כל ב-Anthropic עצמה - יותר חישוב לכל בקשה, וחלון-הקשר מתמלא מהר יותר. כל מעבדה בעולם רצה טוקנייזר יעיל יותר, לא בזבזני יותר.

מצב חשיבה - הבזבוז חוצה כל הספקים

מצב חשיבה הוא כשהמודל "חושב בקול" לפני שהוא עונה - מייצר שרשרת הגיון פנימית, וכל הטוקנים האלה מחויבים כפלט. שאלנו: מה קורה אם מפעילים חשיבה על "שלום"? התשובה מטרידה, וחוצה את כל הספקים.

ב-Claude Haiku 4.5, הדלקת החשיבה שילשה את הפלט (מ-27 ל-81 טוקנים) על ברכה של מילה אחת. Gemini 2.5 Flash חושב 31 טוקנים על "שלום" כברירת מחדל, ו-Gemini 3.5 Flash חושב 264. ו-GPT-5? הוא ייצר בין 64 ל-192 טוקני reasoning על "שלום" - לא-דטרמיניסטי, אבל תמיד עשרות עד מאות. רק Claude Opus 4.8, עם מצב adaptive שמחליט לבד כמה לחשוב, חשב 0 - הוא זיהה שברכה לא דורשת מחשבה, אפילו במאמץ הכי גבוה.

הכלל חוצה-הספקים: מצב חשיבה דלוק כברירת מחדל שורף עשרות עד מאות טוקנים על "שלום" - GPT-5, Gemini ו-Claude כאחד. Opus 4.8 החכם הוא היוצא מן הכלל.

גרף · נתונים מאומתים

טוקני חשיבה/reasoning על המילה 'שלום'

Opus 4.8 · adaptive0טוקני חשיבה על מילה אחת
Gemini 2.5 Flash31טוקני חשיבה על מילה אחת
Haiku 4.5 · thinking54טוקני חשיבה על מילה אחת
GPT-5 (64-192)128טוקני חשיבה על מילה אחת
Gemini 3.5 Flash264טוקני חשיבה על מילה אחת

טוקני מחשבה/reasoning שהמודל ייצר על 'שלום'. Gemini: thoughtsTokenCount (ברירת מחדל). GPT-5: reasoning_tokens (נמדד 64-192, לא-דטרמיניסטי - כאן ~128). Claude Haiku: תוספת הפלט במצב thinking.enabled. Opus 4.8 adaptive חשב 0 גם ב-effort=high. הפלט לא-דטרמיניסטי - משתנה בין הרצות. נכון ל־2026-07.

שתי שכבות: ה-LLM מול הפלטפורמה

עד כאן מדדנו את ה-LLM לבד. אבל אף אחד לא שולח "שלום" ל-API עירום - אנחנו שולחים אותה דרך פלטפורמה: ChatGPT, סוכן קוד, אפליקציה. וזו שכבת-עלות שנייה שכמעט כולם מתעלמים ממנה.

איך מודדים אותה נכון? צריך בייסליין. הבייסליין הוא הקריאה העירומה: רק ההודעה שלנו, בלי סיסטם-פרומפט ובלי כלים. זו הרצפה - "שלום" עולה שם 2 עד 10 טוקנים, תלוי מודל. מעל הרצפה יושבת מעטפת-הפלטפורמה: הסיסטם-פרומפט שלה, הגדרות הכלים, הזיכרון וההיסטוריה. ההפרש הוא מס-הפלטפורמה.

מדדנו את זה על Claude Code - סוכן הקוד שבו עבדנו - ישירות מלוגי ה-usage שלו. נתחיל בשני מושגים: קריאה "עירומה" היא כשאנחנו שולחים למודל רק את ההודעה שלנו ותו לא, ו"תור" (turn) הוא סבב אחד של בקשה-ותשובה בשיחה. עכשיו למספרים: אותה "שלום" שעולה 9 טוקנים בקריאה עירומה, הגיעה למודל עטופה ב-43,483 טוקני קלט כבר בתור הראשון. למה כל כך הרבה? כי בכל בקשה הסוכן שולח למודל, יחד עם המילה שלנו, את כל "חוברת ההפעלה" שלו: את הסיסטם-פרומפט הענק (ההוראות איך להתנהג), את ההגדרות של כל הכלים שהוא יכול להפעיל (לקרוא קובץ, להריץ פקודה בטרמינל וכו'), את ה-skills שנטענו, ואת הזיכרון שלו (קובץ CLAUDE.md). המילה "שלום" היא 9 טוקנים מתוך כל הערימה הזאת - כל השאר זו המעטפת הקבועה של הסוכן, וזה מה שמנפח את התור הראשון פי כמעט 4,800.

והמעטפת רק גדלה תוך כדי עבודה. הממוצע של 119,331 טוקני קלט לכל תור, שמדדנו על פני כל הסשן, גבוה בהרבה מהתור הראשון - כי הוא כולל גם את ההיסטוריה המצטברת של השיחה ואת התוכן של כל קובץ שהסוכן קרא בדרך. כלומר: זה לא באג ולא הפרויקט הספציפי - זו פשוט הדרך שבה סוכן עובד, הוא נושא איתו את כל ההקשר שלו בכל פעם. הערה חשובה להוגנות: כ-95% מהקלט הזה נקרא מהקאש (בערך עשירית מהמחיר), אז זה "מס" גדול בספירת הטוקנים - אבל בכסף הוא מרוכך משמעותית.

ומה עם הטענה שהסשן שלנו לא היה ״נקי״? מדדנו גם אותה. הרצנו קלוד-קוד לגמרי עירום - בלי skills, בלי MCP ובלי זיכרון - ואותה ״שלום״ עלתה שם בערך 23,000 טוקני קלט כבר בתור הראשון. כלומר גם המעטפת המינימלית ביותר היא פי ~2,550 מהמילה; ה-skills וה-MCP שלנו הוסיפו עוד כ-20 אלף מעל הבסיס. שני המספרים אמיתיים, וזה הטווח: מ-23 אלף טוקנים בסשן עירום ועד 43 אלף בסשן עמוס כמו בעבודה אמיתית. הביקורת צודקת עובדתית - ודווקא מחזקת את הנקודה: בכל תצורה, המעטפת מגמדת את המילה.

גרף · נתונים מאומתים

טוקני קלט על 'שלום', לפי צורת השליחה

Gemini · עירום2טוקני קלט
GPT-4.1 · עירום8טוקני קלט
Claude · עירום9טוקני קלט
Claude Code · עירום23019טוקני קלט
Claude Code · תור ראשון43483טוקני קלט
Claude Code · ממוצע לתור119331טוקני קלט

'API עירום' = הודעת 'שלום' בודדת ל-API, בלי סיסטם-פרומפט וכלים (הבייסליין / הרצפה). 'Claude Code' = נמדד ישירות מלוגי ה-usage של הסשן שבו נכתבה הכתבה. כ-95% מהקלט הזה נקרא מהקאש (בערך עשירית מהמחיר). ״Claude Code · עירום״ = סשן קלוד-קוד headless בלי skills/MCP/זיכרון (נמדד). שימו לב לסקאלה - ההפרש הוא פי אלפים. נכון ל־2026-07.

וידאו אמיתי · נוצר עם HyperFrames

כל הסיפור ב-14 שניות: מ'שלום' בודדת ועד פי-4,800

ושאלה טובה ששווה לענות עליה: איזה LLM לבחור כבייסליין? התשובה המעשית מפתיעה - זה כמעט לא משנה. הפער בין הטוקנייזרים ("שלום" עולה 2 טוקנים ב-Gemini מול 9 ב-Claude) מתגמד לחלוטין מול מס-הפלטפורמה של עשרות אלפי טוקנים. ברמת הפלטפורמה, המעטפת שולטת בחשבון, לא בחירת המודל. את אותה מדידה בדיוק אפשר להריץ על כל סוכן אחר (OpenClaw, Hermes, Codex): קוראים כמה טוקנים המעטפת שלו שולחת, ומחסירים את הבייסליין. את Claude Code מדדנו במדויק כי אנחנו רצים בתוכו; האחרים באותו סדר גודל, אבל לא נזרוק מספרים שלא מדדנו בעצמנו.

ומה מציל את כל זה מלהיות בלתי-אפשרי? קאש. בערך 95% מהטוקנים בכל תור - בממוצע כ-119 אלף - נקראים מהקאש, שעולה בערך עשירית ממחיר קלט רגיל. בלי prompt caching, סוכן שנושא מעטפת של עשרות אלפי טוקנים בכל תור פשוט לא היה כלכלי - הקאש נועד בדיוק למעטפת הזאת.

אז מה עושים עם זה? חמש מסקנות פרקטיות

זה לא רק טריוויה על ״שלום״ - הנה מה שכדאי לעשות עם הממצאים בפועל:

  1. מדדו לפני שאתם בונים, זה חינם. לכל ספק יש ספירת-טוקנים חינמית (count_tokens ב-Anthropic, countTokens ב-Gemini) שנותנת את הקלט המדויק בלי להריץ את המודל. תקצבו עלות מראש במקום לגלות אותה בחשבון.
  2. עברית עולה יותר - תכננו לפי זה. אותו תוכן בעברית עולה בערך 30-90% יותר טוקנים מאנגלית, תלוי מודל. אם העלות קריטית, שקלו לכתוב את הסיסטם-פרומפט והקונטקסט באנגלית ולשמור עברית לתוכן שהמשתמש רואה. הטוקנייזר הכי יעיל לעברית מבין המודרניים הוא של GPT-4o.
  3. כבו חשיבה על משימות פשוטות. מצב חשיבה שורף עשרות עד מאות טוקנים גם על ברכה. למשימות קלות - כבו אותו (thinkingBudget=0, effort נמוך) או בחרו מודל adaptive שמחליט לבד. שמרו את החשיבה למשימות שבאמת דורשות אותה.
  4. בסוכנים, המעטפת שולטת - לא בחירת המודל. ההבדל בין הטוקנייזרים (2 מול 9 טוקנים למילה) מתגמד מול עשרות אלפי טוקני המעטפת של סוכן. בחרו מודל לפי איכות, ומינימיזו את הסיסטם-פרומפט ואת הגדרות הכלים אם אתם בונים סוכן בעצמכם.
  5. prompt caching הוא מה שהופך סוכן לכלכלי. כ-95% מהמעטפת נקראת מהקאש, בעשירית המחיר. אם אתם בונים משהו עם קונטקסט קבוע וחוזר - ודאו שאתם משתמשים בקאש, אחרת אתם משלמים פי-10 מיותר.

שורה תחתונה

אז מה מצאנו, בשורה אחת? המילה "שלום" עצמה זולה עד כדי גיחוך - 2 עד 10 טוקנים. מה שקובע את החשבון זה כל מה שמסביב: התקורה הקבועה, מס-העברית (מ-1.34 ב-GPT-4o ועד כמעט פי-4 בטוקנייזר הישן, ו-1.90 ב-Claude), מצב חשיבה שבברירת מחדל שורף עשרות עד מאות טוקנים בחינם אצל GPT-5 ו-Gemini, ומעטפת-פלטפורמה ששוקלת פי-אלפים מהמילה. בעיניי הלקח האמיתי הוא הרגל: לפני שבונים משהו על LLM - למדוד במקום לנחש. הכלים חינמיים ולוקחים חמש דקות.

יש גם סייג הגון: המדידות הן צילום-מצב של יולי 2026, הטוקנייזרים משתנים בין גרסאות, והפלט לא-דטרמיניסטי - תריצו שוב ותקבלו מספרים מעט שונים. אל תסמכו על המספר הבודד; תסמכו על השיטה. כל הקוד שרץ פה נמצא בריפו, ואפשר להריץ אותו על כל מילה שתרצו.

אז מה איתכם - כמה טוקנים לדעתכם עולה הפרומפט הכי נפוץ שאתם שולחים כל יום, ומתי בפעם האחרונה באמת מדדתם אותו במקום לנחש?

מקורות ואימות

כל טענה עובדתית בכתבה נבדקה מול המקורות הבאים.

  1. Token counting - Claude Platform Docsplatform.claude.com
  2. Prompt caching - Claude Platform Docsplatform.claude.com
  3. Adaptive thinking - Claude Platform Docsplatform.claude.com
  4. openai/tiktoken - BPE tokenizer (o200k_base / cl100k_base)github.com
  5. Understand and count tokens - Gemini APIai.google.dev
  6. Gemini thinking (thoughtsTokenCount, thinkingBudget) - Gemini APIai.google.dev
  7. OpenAI API - reasoning tokens (usage.completion_tokens_details)platform.openai.com
  8. Gemma 2 - open model that shares Gemini's tokenizer (arXiv)arxiv.org

אהבתם את הכתבה? ספרו לי

10 תגובות · התגובה שלכם עוזרת לי לדעת מה לכתוב

הקורס המוביל שלי

Practical AI with Claude

הקורס הכי מקיף בעברית לשליטה מלאה ב-Claude — מ-Claude Desktop לעבודה יומיומית, ועד בניית סוכנים ואוטומציות אמיתיות.

למידע והרשמה

פניות תקשורת

לראיונות, שיתופי פעולה והרצאות, נשמח לדבר.

info@yuv.ai