נתתי את התשבץ הקריפטי הקשה ביותר שיכולתי למצוא לחבורה של LLMs
אז הבוקר התעוררתי ל חֲדָשׁוֹת שפיירפוקס יוסיף תשבץ יומי המופעל על ידי AI ליותר ויותר עמוס דף כרטיסייה חדשה עשירה בתוכן. הכל טוב ויפה, אבל זה גם גרם לי לחשוב על משהו. אני אוהב תשבץ סתמי טוב, ו… ובכן, אם יש צורה אחת של תשבץ שבינה מלאכותית בוודאי תיאבק איתה, היא התשבץ החשוף ביותר והאנושי ביותר מבין הפאזלים.
אני מתערב שאף אחד מה-LLMs הצרכני לא יכול לעשות שום סוג של אגרוף להתמודד עם קריפטיקה נכונה. יָמִינָה? ובכן, נראה שאני לא היחיד שחושב על זה — ומסתבר גם שאולי אני טועה.
לפני בקושי שבוע, עובד במשהו שנקרא OreateAI כתב פוסט בבלוג על האופן שבו "לפאזלים 'מצופנים' הנפוצים בבריטניה ובנושאים הנלוזים יותר בארה"ב, דגמי שפה גדולים (LLMs) כגון קלוד 3.5 Sonnet ו-GPT-4o הפגינו לאחרונה יכולת מפתיעה להנדס לאחור משחקי מילים שהכשילו דורות קודמים של תוכנות.
נראה על זה. אין לי ספק ש-ChatGPT et al יכול להבין רמז אנגרמה בסיסי, אבל מה לגבי רמזים המסתמכים על הצורות המבולבלות ביותר, עם כוונות רעות, של משחקי מילים? אין ספק שאלו דורשים סוג של עיוות יצירתית שיכולה להיות רק אנושית באופן מהותי?
העמדת לימודי תואר שני במבחן
כדי לבחון את ההשערה הזו, באמת היה רק מקום אחד שיכולתי לפנות אליו: התשבץ החשוף הקשה ביותר של אוסטרליה. למה של אוסטרליה, אתם שואלים? ובכן, למרות ה מיטב המאמצים של חובבים, הקריפטיקה היא עדיין סוג של אמנות נישה כאן בארצות הברית. זה מבוסס יותר בבריטניה, אבל למען האמת, אני נורא בעניין אַפּוֹטרוֹפּוֹס קריפטי בדיוק בגלל שהוא מסתמך על גוף ידע מבוסס שאתה מפנים רק על ידי חיים במדינה, ואני לא גר בבריטניה כבר 25 שנה.
אומנם אוסטרליה… זה המקום שבו נולדתי וגדלתי, המקום בו גרתי עד גיל 19 ואליו חזרתי לסירוגין לאורך השנים – אבל יותר חשוב מכך, זה גם המקום שהקמתי בלוג ארוך שנים מוקדש לעצם התשבץ שאני עומד להטיל על כמה לימודי LLM. באוסטרליה, קובעים הולכים לפי ראשי התיבות שלהם, וה תשבץ קריפטי של יום שישי בשני ה סידני מורנינג הראלד והעיתון האחות שלו במלבורן, העידןנקבע על ידי "ו"אדם שחידותיו כל כך קשות לשמצה עד שאנשים מתבדחים שהראשי תיבות למעשה מייצגים "אל תנסה".
אז כן. חידות DA הן קשות. זה הופך אותם למושלמים למבחן הקטן הזה!
הרמזים שאני רוצה שה-LLMs האלה יפתרו
אז איך יסתדרו לימודי תואר שני עם האתגר האחרון של DA? כדי לבדוק זאת, בחרתי כמה מהרמזים מהפאזל והזנתי אותם לשלושה LLMS: ChatGPT, Claude Sonnet 5, ו-זה נראה רק הוגן-Oreate. הרמזים מתגברים בקושי ככל שהם הולכים, החל מ"קל יחסית" ל"אחי, בחייך". הם כדלקמן:
- בוטנים שבריריים, סוף סוף ללא גלוטן! (3,2)
- גיבוי צובע הפחית את הצירים מדי פעם (2,9)
- פינקי, אתה מבין? (5)
- נאבק שמישהו (לא!) יקבל זמן להתמקד בעצם?! (9,7)
- 15 בינואר 2000? (9)
אם אתה רוצה לנסות לפתור את אלה בעצמך, קדימה. התשובות, יחד עם הציונים השרירותיים לחלוטין שלי מתוך 10 עבור כל רמז עבור כל LLM, להלן. ואם אתה רק רוצה לדעת איך כל AI הצליח, הנה.
כיצד תפקדו ה-LLMs
זה לא ממש ציר זמן חלופי שבו גארי קספרוב הופך פתאום את השולחן על כחול עמוק כדי לצאת מנצח ולרשום ניצחון של אדם על מכונה, אבל עד כה אני חושב שעדיין ליקקנו את Skynet בכל הנוגע לקריפטיקה. זה משהו, נכון?
ChatGPT
ציון: 27/50
עשה טוב בהתחלה, אבל אז התעצבן ועשה בלגן מוחלט של הרמז האחרון.
קלוד
ציון: 7/50
שבר את המיטה ואז רצה כסף. לא ככה זה עובד, קלוד.
אוריאט
ציון: 21/50.
התחיל טוב, אבל נהיה קצת… רמאות, בכנות. כמו כן, איטי כמו שבוע רטוב.
אז הנה יש לנו את זה. יש לי ארבעה רמזים כאלה בעצמי, אז אני נותן לעצמי 40/50 מהדהד. תתבאס, תואר ראשון! שקי הבשר הקטנים האלה עדיין שולטים בפינה הזו לגמרי ובסופו של דבר חסרת תועלת של cruciverbalism! בו-יה! ועוד!
תוצאות לכל רמז עבור כל LLM
להלן, אסביר את התשובות לכל רמז, כולל משחקי המילים המעורבים, כמו גם כמה קרוב כל LLM היה לפתור אותו.
- בוטנים שבריריים, סוף סוף ללא גלוטן! (3,2): אכלתי
הַגדָרָה: "זאב", כלומר אכל במהירות.
מִשְׂחָק מִלִים: "בוטנים שביר" מציין אנגרמה של "בוטן"; "סוף סוף ללא גלוטן" מציין שהתשובה היא "חופשית" מהאות האחרונה של "גלוטן", כלומר "n". זה משאיר אנגרם של "PEAUT", כלומר "זאב"; התשובה היא "אכלתי".
ציון ChatGPT: 7/10. זה קיבל את התשובה הנכונה, אבל דרש קצת הסבר על משחקי המילים.
ציון קלוד: 5/10. זה כמעט קיבל את התשובה הנכונה – "EAT UP" לעומת "ATE UP" – וגם היה צריך להסביר את משחקי המילים.
ציון Oreate: 7/10. תשובה נכונה, ובניגוד ל-ChatGPT, הוא הבין את הרמז בצורה מושלמת מההתחלה. הפשרה: קבלת התשובה לקחה נצח. - גיבוי צובע הפחית את הצירים מדי פעם (2,9): במרווחים
הַגדָרָה: "מדי פעם."
מִשְׂחָק מִלִים: "צובע" = "גוון", כלומר מי שצובע. "[To] עבודה" = "[To] עֶבֶד." "גיבוי" מציין היפוך, כך ש-"SLAVE" הופך ל-"EVALS"; "מופחת" מציין הסרה של מכתב. נשארנו עם "A TINTER VALS", או "AT INTERVALS".
ציון ChatGPT: 5/10. ChatGPT מתחיל להתנהג בצורה מוזרה עם זה, בהתחלה לדחות את התשובה הנכונה בגלל "אורך שגוי" וגם להתעקש בנקודות שונות שציינתי את התשובה כ-(2,8) ו-(2,11), מה שלא היה לי. הרעיון של "צובע" בתור "TINTER" נראה אלכסוני מדי עבור ה-AI של היום; ראה גם….
ציון קלוד: 2/10. קלוד אכן קיבל את התשובה הנכונה, אבל אדוני היקר, האם זה לקח זמן. כנראה יש מאגר איפשהו שהתרוקן לגמרי בגלל זה; אם כן, אני מתנצל בפני כולם בכפר. במיוחד שעדיין הייתי צריך להסביר את התשובה.
ציון Oreate: 6/10. אתה יודע שהדברים גרועים כאשר ה-LLM הכריז על "חשיבה עמוקה שנעשתה" – ואתה בעצמך נרדם ליד השולחן שלך – ובכל זאת שום תשובה לא מגיעה. ובכל זאת, באופן מפתיע, זה הגיע לתשובה! מבין שלושת ה-LLM שניסיתי, זה היה היחיד שהבין את החלק "צובע" = "גוון" ברמז. - נאבק שמישהו (לא!) יקבל זמן להתמקד בעצם?! (9,7): כלכלת תשומת לב
הַגדָרָה: "!" ברמז סתמי מציין שהרמז הוא מה שנקרא &lit. רֶמֶז. זה אומר שכל הרמז הוא גם ההגדרה
מִשְׂחָק מִלִים: זה באמת סיוט ובחרתי בו בעיקר כדי לראות אם LLM יבין את זה, כי אני לא. בכל מקרה: "מאבק [for]" הוא אינדיקטור אנגרמה. המרכיבים של האנגרמה הם "כל אחד שלא הגיע לזמן"… יחד עם "התמקדות בעצם", המציינת את האות האמצעית של "פוקוס", שהיא "C". נשארנו עם אנגרמה של "כל אחד שלא הגיע ל-C", כשההגדרה היא כל הרמז. התשובה: "כלכלת תשומת לב".
ציון ChatGPT: 4/10. זה דרש הרבה הסבר, ש… זאת אומרת, הוגן, גם הייתי צריך קצת זמן לחשוב על זה כשראיתי את התשובה. בסופו של דבר, ChatGPT לא הצליח להמציא את התשובה בעצמו, אז אני די שמח שלא נתתי את זה ל…
ציון קלוד: לא. ביקום מקביל, קלוד עדיין מהרהר בכך. על כוכב מת.
ציון Oreate: לא. כאן נתקלנו בבעיה. אורייט קיבלה את התשובה… אבל היא גם אמרה לי בגאווה שזה "רמז מפוצץ מקריפטיקה של סידני מורנינג הראלד מאת התובע". מה זה! אבל זה בעצם הלך וחיפש בגוגל את התשובה. זה לא אותו דבר כמו לפתור את זה! - זֶרֶת, אתה מבין? (5): ספרה
הַגדָרָה: כפי שקורה לעתים קרובות עם רמזים קצרים כמו זה, שתי המילים נותנות רמז להגדרה.
מִשְׂחָק מִלִים: בחרתי בזה כי זה ההפך מהאנגרמה הטכנית מאוד של ספירת אותיות שקודמת לה. התשובה היא "DIGIT" כי המילה הזו מתייחסת הן לאצבע הקטנה (זרת) והן למילה האיטלקית "Capisce?", שפירושה "הבנת?", או אולי… "לחפור את זה"
ציון ChatGPT: 10/10. ChatGPT מרוסק זֶה. זה החזיר את התשובה תוך כמה שניות, והיא הייתה נכונה ב-100%.
ציון קלוד: לא. נעלם, קלוד. אני לא משלם כדי לראות אותך "חושב".
ציון Oreate: 8/10. קיבלתי גם את התשובה; לקח הרבה יותר זמן מאשר ChatGPT. - 15 בינואר 2000? (9): אמצע הקיץ
הַגדָרָה: שוב, כל הרמז הוא ההגדרה.
מִשְׂחָק מִלִים: זה סוג הרמז שגורם לאנשים או לשנוא את ד"ר או להעריץ אותו. אם אתה סופר לאחור דרך לוחות השנה שלך, כששנת 2000 היא שנה מעוברת, 15 בינואר היה ממש אמצע הקיץ באוסטרליה. אבל 2000 בספרות רומיות הוא גם "MM", הנופל באמצע המילה. תראה, זה יצירתי.
© צילום מסך Gizmodo
ציון ChatGPT: 1/10. נקודה אחת לניסיון, וגם בגלל שאני מוצא את התשובה הנוראה של ChatGPT למען האמת – HEWITT WON היא שתי מילים, בתור התחלה – מסקרנת. זה כל כך בטוח בתשובה הזו. וזה כל כך לא בסדר!
ציון קלוד: עדיין לא
ציון Oreate: אתן לזה 0/10 כאן, כי זה עוֹד אני חושב על הרמז הזה, ואני צריך לאכול ארוחת ערב.