הכלל שלמדנו בדרך הקשה: אף מודל לא כותב טקסט על המסך

הסרטון שהיה כמעט מושלם, חוץ מהמחיר שכתוב עליו

בתחילת הדרך נתנו למודל הווידאו לייצר גם את הטקסט שעל המסך: מחיר, תאריך מבצע, קופון. הסצנה יצאה יפה, המספרים יצאו שבורים. שבע במקום שמונה, אות שהתחלפה בסימן שלא קיים בשפה, ותאריך שנראה נכון במבט ראשון ומתגלה כשגוי רק כשלקוח מתקשר ושואל למה המבצע כבר לא בתוקף.

זה קרה יותר מפעם אחת. בקמפיין עם תקציב מדיה אמיתי מאחוריו, שגיאה כזאת היא לא "עוד באג", היא כסף שהולך למודעה עם מידע שגוי. משם ואילך קבענו כלל שאנחנו לא זזים ממנו: אף מודל AI לא כותב טקסט שמופיע על המסך, לא בסרטון ולא בתמונה שלנו.

הכלל נשמע מובן מאליו כשמסבירים אותו. בזמן אמת, כשהמודל שיצא השבוע מבטיח "טקסט מושלם בכל שפה", קל להתפתות ולהתפשר עליו. אנחנו לא מתפתים, כי כבר ראינו איך זה נגמר.

הבדיקה שלנו פשוטה: לוקחים עשר גרסאות של אותה סצנה עם אותו טקסט מבוקש, וסופרים כמה מהן יצאו מדויקות לגמרי. מודל חדש שמגיע עם תשעה מתוך עשר עדיין אומר שגרסה אחת עלולה לצאת עם מספר שגוי, ואי אפשר לדעת מראש איזו. תשעים אחוז דיוק זה מספר מרשים בדמו, ובלתי קביל במודעה שמפרסמת מחיר.

למה מודלים גנרטיביים לא אמינים לטקסט

מודל וידאו ומודל תמונה לומדים לצייר צורות שנראות כמו אותיות, לא אותיות. זה עובד סביר באנגלית עם מילים קצרות, ומתפרק בעברית, במספרים מדויקים ובטקסט ארוך. גם כשהתוצאה נראית תקינה בהצצה ראשונה, בדיקה מקרוב חושפת אות חסרה או ספרה שהתחלפה. בעברית הפער בולט עוד יותר: אותיות סופיות צצות באמצע מילה, וגרשיים של ראשי תיבות נעלמים או מוכפלים. מודל שאומן בעיקר על אנגלית לא ראה מספיק עברית כדי לדעת איך זה אמור להיראות.

הבעיה מחריפה כשהטקסט חייב לצאת נכון פעם אחר פעם: מחיר, תאריך תפוגה, מספר טלפון. אין "כמעט נכון" במחיר מוצר. או שהוא נכון, או שהמודעה גורמת נזק.

לזה מתווסף נזק לאמון. לקוח שרואה מודעה עם תאריך שבור מניח שהעסק לא בדק את מה שהוא מפרסם, גם כשהבעיה טכנית לגמרי.

ויש עניין של קנה מידה. מודעה בודדת אפשר לבדוק בעין לפני שהיא יוצאת. קמפיין עם מאות גרסאות שמופצות אוטומטית לפי קהל יעד, גיל או אזור, אי אפשר לבדוק ידנית אחת אחת. ברגע שהמודל לא אמין ב-100 אחוז מהמקרים, כל הפצה רחבה הופכת להימור.

הפתרון: רינדור נפרד, הלבשה מדויקת

מסך מחשב מציג שכבת טקסט חדה מעל רקע סצנה מטושטש

הכלל שקבענו הפך לעיקרון הליבה של מנוע ההפקה שלנו. המודל מייצר את הסצנה החזותית בלבד, בלי טקסט. כל טקסט ומספר מרונדר בנפרד, כמו עמוד אינטרנט, ואז מולבש על הסרטון. המחיר, התאריך והמותג נראים כמו שהוזנו, כי הם לא "נוצרו" מחדש אלא הודפסו.

זה פותר גם את בעיית העקביות. כשצריך עשר גרסאות של אותה מודעה עם תאריכים שונים, מרנדרים את הטקסט מחדש בכל גרסה בלי לגעת בסצנה, במקום להפיק את כל הסרטון מחדש בכל פעם.

טכנית, הפונט, הגודל והמיקום של כל שדה קבועים מראש בתבנית, ורק הערך משתנה. כך המחיר תמיד יושב באותו מקום ובגודל קריא, גם כשהמספר עצמו משתנה מגרסה לגרסה, וגם כשהוא ארוך בספרה אחת מהצפוי.

העיקרון נשען על משהו פשוט: מנוע רינדור של דפדפן יודע לצייר טקסט מדויק כבר עשרים שנה. זו לא בעיה שצריך לפתור מחדש עם מודל AI. הצירוף בין דיוק הרינדור הוותיק לבין החזותיות של מודל הווידאו החדש נותן את שני היתרונות בלי לוותר על אף אחד מהם.

מה הלקוח רואה בסוף

הלקוח לא רואה שכבות. הוא רואה סרטון מודעה עם מחיר קריא, תאריך נכון ולוגו שנראה כמו שצריך. ההפרדה בין רינדור הטקסט לבין הפקת הווידאו היא ההבדל בין קמפיין שרץ בלי בעיה לבין קמפיין שצריך עצירה ותיקון אחרי שכבר יצא לאוויר.

ברשתות קמעונאות שמעדכנות מחיר כל שבוע זה חוסך זמן הפקה משמעותי: משנים ערך אחד בקובץ, לא בונים סרטון חדש. אותו רקע חוזר שבוע אחרי שבוע, ורק שכבת הטקסט מתחלפת. לקוח שרוצה לוודא בעצמו מקבל את קובץ הערכים לצד הסרטון, ורואה שורה מול שורה מה הודפס על המסך.

מה זה מחייב כשנכנס אצלנו כלי חדש

כל תוסף שנכנס למנוע ההפקה נבדק מול העיקרון הזה. אם הוא דורש ממודל AI לצייר טקסט על המסך, הוא לא נכנס. זה חל על Veo, Kling ו-Seedance בווידאו, ועל Nano-Banana Pro ו-Gemini 3 Pro Image בתמונה. המודלים מייצרים את הרקע החזותי ועוצרים שם.

לא תמיד נעים לדבוק בכלל הזה כשמודל חדש נראה מרשים בדמו. אבל בזכותו הלקוחות שלנו לא צריכים לבדוק כל מודעה מקרוב לפני שהיא יוצאת לאוויר. הכלל ישתנה ביום שמודל יראה דיוק מלא, לא כמעט מלא, על טקסט עברי לאורך מאות בדיקות.

אם קמפיין קודם שלכם נתקע בטקסט שגוי בווידאו AI, נשמח לספר איך המנוע שלנו פותר את זה בלי לוותר על מהירות ההפקה הגנרטיבית.

שאלות ותשובות

הם לומדים לצייר צורות שנראות כמו אותיות, לא אותיות מדויקות, ולכן מספרים ומילים בעברית מתעוותים בקלות.

זה מקצר אותו. מעדכנים ערך אחד בקובץ הטקסט במקום להפיק את הסצנה מחדש.

כן. גם ב-Nano-Banana Pro וגם ב-Gemini 3 Pro Image הטקסט לעולם לא נוצר על ידי המודל.

משנים רק את שכבת הטקסט המולבשת, בלי לגעת בסצנה החזותית שכבר הופקה.

כלים רבים כן נותנים למודל לכתוב טקסט, ולכן רואים לא מעט שגיאות כתיב ומספרים שגויים בפרסומות AI ברשת.

אור פיאלקוב

מתמחה בשיווק ופרסום בפייסבוק

פוסטים נוספים: