דילוג לתוכן
עשר אצבעות

עברית יצאה ג׳יבריש? מתקנים את הקידוד

אם במקום עברית מופיעים סימנים כמו ×©×œ×•× או ùìåí, הטקסט נפתח בקידוד הלא נכון, וכמעט תמיד אפשר להחזיר אותו. מדביקים כאן טקסט או פותחים קובץ, והכלי מנסה את הצירופים של UTF-8, Windows-1255 ו־ISO-8859-8 ומציג את העברית הקריאה ביותר. סימני שאלה במקום אותיות אומרים שהמידע כבר אבד.

  • מה שמקלידים לא נשלח לשרת
  • בלי הרשמה ובלי התקנה
  • חינם, בלי פרסומות
מה יש לכם?

דוגמאות:

התוצאה

הטקסט המתוקן יופיע כאן.

איך זה עובד

  1. מדביקים או פותחים קובץ

    טקסט מוזר, קובץ כתוביות או CSV. הקובץ לא עולה לשום מקום.

  2. בוחרים תיקון

    האפשרויות מסודרות מהקריאה ביותר. בדרך כלל הראשונה נכונה.

  3. מעתיקים או שומרים

    את הטקסט, או קובץ חדש ב־UTF-8 שנפתח נכון גם באקסל.

איך נראה כל סוג של ג׳יבריש?

מחשב שומר כל אות כמספרים (בתים), והקידוד הוא הטבלה שאומרת איזה מספר הוא איזו אות. כשתוכנה קוראת את הבתים בטבלה אחרת, יוצאות אותיות אחרות. כל טעות משאירה "טביעת אצבע" משלה, ולכן אפשר לזהות מה קרה:

המילה "שלום" בקידודים שגויים
מה רואיםמה קרהאפשר לתקן?
שלו×UTF-8 שנפתח כ־Windows-1252 (מערב אירופה)כן
ùìåíWindows-1255 (עברית ישנה) שנפתח כ־Windows-1252כן
׳©׳׳•׳UTF-8 שנפתח כ־Windows-1255כן
щменWindows-1255 שנפתח כקיריליתכן
????נשמר בקידוד שאין בו עבריתלא
���בתים שלא התאימו לקידוד הוחלפו בסימן �לא

מקור: WHATWG Encoding Standard

קובץ CSV עם עברית נפתח באקסל כג׳יבריש

באקסל, לחיצה כפולה על CSV שנשמר ב־UTF-8 בלי סימן BOM בתחילתו פותחת אותו בקידוד הישן של Windows, והעברית יוצאת כמו שלו×. יש שלוש דרכים לתקן:

  • כאן: פותחים את הקובץ ושומרים "UTF-8 לאקסל". הקובץ החדש נפתח נכון בלחיצה כפולה.
  • בייבוא: נתונים, מטקסט/CSV, ובשדה "מקור הקובץ" בוחרים 65001: Unicode (UTF-8).
  • בשמירה: שומרים מאקסל בפורמט CSV UTF-8, ולא ב־CSV הרגיל.

מקור: Microsoft: ייבוא קובצי טקסט ו־CSV ל־Excel

כתוביות בעברית יוצאות ג׳יבריש

הרבה קובצי כתוביות (srt) בעברית שמורים ב־Windows-1255, ונגנים שמניחים UTF-8 מציגים אותם כמו ùìåí. פותחים את הקובץ כאן ושומרים עותק ב־UTF-8, שכל נגן וכל טלוויזיה קוראים.

ב־VLC אפשר גם לשנות הגדרה: כלים, העדפות, כתוביות/OSD, ובקידוד ברירת המחדל בוחרים Hebrew (Windows-1255).

למה סימני שאלה אי אפשר לשחזר?

כשטקסט עברי נשמר בקידוד שאין בו עברית, כל אות מוחלפת בסימן שאלה, והאותיות עצמן כבר לא נמצאות בקובץ. אותו דבר עם הסימן �, שמחליף בתים שלא התאימו. במקרים כאלה צריך את הקובץ המקורי, והכלי אומר את זה במקום לנחש.

לפעמים חסרות רק אותיות בודדות, כמו א ו־ם, כשחלק מהבתים נמחקו בדרך. אז הכלי משלים אותן לפי מילון ומסמן שזה ניחוש.

מקור: WHATWG Encoding Standard

שאלות נפוצות

קיבלתי מייל עם עברית מבולגנת. מה עושים?

מעתיקים את הטקסט המוזר ומדביקים כאן. כדי שזה לא יקרה במיילים שלכם ב־Outlook: קובץ, אפשרויות, מתקדם, ובאפשרויות הבינלאומיות בוחרים Unicode (UTF-8) לקידוד הודעות יוצאות.

מה ההבדל בין Windows-1255 ל־ISO-8859-8?

שתיהן שיטות ישנות של בית אחד לכל אות, והאותיות העבריות באותם מספרים בשתיהן. ב־Windows-1255 יש גם ניקוד וסימנים נוספים. היום כמעט הכול ב־UTF-8, שיש בו כל השפות.

הקובץ שלי עולה לשרת?

לא. הקובץ נקרא ומתוקן בדפדפן שלכם, ושום דבר לא נשלח.

העברית יצאה הפוכה, כמו םולש. זה קידוד?

לא, זו בעיית כיוון ולא קידוד. הופכים אותה חזרה באותיות.