
מתקפת הבינה המלאכותית הגדולה של סין: עם Wan 2.2, עליבאבא שואפת לעקוף את המערב - והופכת הכל לקוד פתוח - תמונה: Xpert.Digital
זהו הפלא החדש של עליבאבא, הבינה המלאכותית Wan2.2: חינמי, חזק יותר מהמתחרים, וזמין לכולם
תשובת הווידאו של סין ל-Sora של OpenAI: הבינה המלאכותית החדשה הזו מייצרת סרטונים באיכות קולנועית - והיא בחינם
ב-29 ביולי 2025, חברת הטכנולוגיה הסינית עליבאבא הוציאה את Wan2.2, גרסה חדשה ומרגשת של מודל יצירת הווידאו בקוד פתוח שלה, אשר משנה באופן מהותי את נוף הבינה המלאכותית להפקת וידאו. טכנולוגיה חדשנית זו מייצגת את מודל יצירת הווידאו בקוד פתוח הראשון בעולם המיישמת ארכיטקטורת תערובת מומחים (MoE), המיועדת הן להפקת סרטים מקצועית והן לשימוש על חומרה מוכנה מראש.
קשור לזה:
- עליבאבא משקיעה מעל 50 מיליארד דולר בבינה מלאכותית ובמחשוב ענן – בינה מלאכותית כללית (AGI) ממלאת תפקיד מרכזי
מהפכה טכנולוגית באמצעות ארכיטקטורת משרד החינוך
Wan2.2 מציגה לראשונה ארכיטקטורת שילוב של מומחים למודלים של דיפוזיה של וידאו, ומייצגת פריצת דרך טכנולוגית משמעותית. ארכיטקטורה חדשנית זו משתמשת במערכת מומחים כפולה המחלקת את תהליך יצירת הווידאו לשני שלבים מיוחדים. המומחה הראשון מתמקד בשלבים המוקדמים של הפחתת רעשים וקובע את פריסת הסצנה הבסיסית, בעוד שהמומחה השני מטפל בשלבים המאוחרים יותר, תוך שיפור פרטים ומרקמים.
למערכת יש סך של 27 מיליארד פרמטרים, אך היא מפעילה רק 14 מיליארד פרמטרים בכל שלב הסקה, מה שמפחית את מאמץ החישוב בעד 50 אחוז מבלי לפגוע באיכות. עלייה זו ביעילות מאפשרת לייצר סרטונים באיכות גבוהה תוך שמירה על עלויות חישוב קבועות ובמקביל להרחבת קיבולת המודל הכוללת.
אסתטיקה קולנועית ושליטה קולנועית
מאפיין בולט של Wan2.2 הוא מערכת בקרת האסתטיקה הקולנועית שלה, המאפשרת למשתמשים להפעיל שליטה מדויקת על ממדים חזותיים שונים. המודל אומן על סמך נתונים אסתטיים שנבחרו בקפידה, כולל תוויות מפורטות לתאורה, קומפוזיציה, ניגודיות, גוון, זווית מצלמה, גודל תמונה, אורך מוקד ופרמטרים קולנועיים אחרים.
פונקציונליות זו מבוססת על מערכת הנחיות בהשראה קולנועית אשר מסווגת ממדים מרכזיים כגון תאורה, תאורה, קומפוזיציה וצבע. זה מאפשר ל-Wan2.2 לפרש וליישם במדויק את כוונותיו האסתטיות של המשתמש במהלך תהליך היצירה, מה שמאפשר יצירת סרטונים עם העדפות קולנועיות הניתנות להתאמה אישית.
נתוני אימון מתקדמים ויצירת תנועה מורכבת
בהשוואה לקודמו, Wan2.1, מערך הנתונים של האימון הורחב משמעותית: 65.6 אחוז יותר נתוני תמונה ו-83.2 אחוז יותר נתוני וידאו. הרחבת נתונים מסיבית זו משפרת משמעותית את יכולות ההכללה של המודל ומגדילה את הגיוון היצירתי על פני ממדים מרובים כגון תנועה, סמנטיקה ואסתטיקה.
המודל מציג שיפורים משמעותיים ביצירת תנועות מורכבות, כולל הבעות פנים מציאותיות, מחוות ידיים דינמיות ותנועות אתלטיות מורכבות. בנוסף, הוא מספק עיבודים ריאליסטיים עם ציות משופר לפקודות ודבקות בחוקי הפיזיקה, וכתוצאה מכך רצפי וידאו טבעיים ומשכנעים יותר.
ניצול יעיל של חומרה ונגישות
Wan2.2 מציעה שלושה גרסאות דגם שונות המכסות דרישות ותצורות חומרה שונות:
- Wan2.2-T2V-A14B: מודל טקסט-לווידאו עם 27 מיליארד פרמטרים (14 מיליארד פעילים) שמייצר סרטונים ברזולוציית 720p ו-16fps.
- Wan2.2-I2V-A14B: מודל תמונה-לסרטון עם אותה ארכיטקטורה להמרת תמונות סטטיות לסרטונים.
- Wan2.2-TI2V-5B: מודל קומפקטי של 5 מיליארד פרמטרים המשלב פונקציות טקסט-לווידאו ותמונה-לווידאו במסגרת מאוחדת.
דגם ה-TI2V-5B הקומפקטי מייצג פריצת דרך משמעותית, שכן הוא יכול לייצר סרטונים של 5 שניות ברזולוציית 720p בפחות מ-9 דקות על גבי כרטיס מסך יחיד לצרכן, כמו ה-RTX 4090. מהירות זו הופכת אותו לאחד מדגמי ה-720p@24fps המהירים ביותר הזמינים, ומאפשר הן ליישומים תעשייתיים והן למחקר אקדמי ליהנות מהטכנולוגיה.
ארכיטקטורת איחוד האמירויות הערביות מתקדמת לדחיסה אופטימלית
מודל ה-TI2V-5B מבוסס על ארכיטקטורת VAE תלת-ממדית יעילה ביותר עם יחס דחיסה של 4×16×16, מה שמגדיל את קצב דחיסת המידע הכולל ל-64. עם שכבת תיקון נוספת, יחס הדחיסה הכולל של ה-TI2V-5B מגיע אפילו ל-4×32×32, מה שמבטיח שחזור וידאו באיכות גבוהה עם דרישות אחסון מינימליות.
טכנולוגיית דחיסה מתקדמת זו מאפשרת למודל לתמוך באופן טבעי הן במשימות טקסט לסרטון והן בתמונה לסרטון במסגרת אחת ומאוחדת, המכסה הן מחקר אקדמי והן יישומים מעשיים.
ביצועי מדד ומיצוב בשוק
Wan2.2 נבדק מול מודלים מובילים של יצירת וידאו מבוססי בינה מלאכותית, כולל Sora, KLING 2.0 ו-Hailuo 02, תוך שימוש בחבילת ההערכה החדשה Wan-Bench 2.0. התוצאות מראות ש-Wan2.2 משיג ביצועים חדישים ברוב הקטגוריות ועולה על מתחריו הגבוהים.
בהשוואות דירוג ישירות, Wan2.2-T2V-A14B זכתה במקום הראשון בארבעה מתוך ששת ממדי המדד המרכזיים, כולל התחומים הקריטיים של איכות אסתטית ודינמיקת תנועה. הישג זה מקבע את Wan2.2 כמובילת שוק הקוד הפתוח החדשה ביצירת וידאו ברזולוציה גבוהה.
זמינות ואינטגרציה של קוד פתוח
Wan2.2 זמינה כתוכנה בקוד פתוח מלא תחת רישיון Apache 2.0 וניתן להוריד אותה מאתרים כמו Hugging Face, GitHub ו-ModelScope. המודלים כבר משולבים במסגרות פופולריות כמו ComfyUI ו-Diffusers, מה שמאפשר שימוש חלק בזרימות עבודה קיימות.
דגם ה-TI2V-5B כולל מרחב פנים מחבק מוכן לשימוש, המאפשר למשתמשים לנסות את הטכנולוגיה באופן מיידי ללא התקנות מורכבות. נגישות זו מאפשרת גישה דמוקרטית לטכנולוגיית יצירת וידאו מתקדמת ומעודדת חדשנות בקהילת המפתחים.
המתקפה האסטרטגית של סין בתחום הבינה המלאכותית
השקת Wan2.2 היא חלק מאסטרטגיה רחבה יותר של בינה מלאכותית בקוד פתוח של סין, שכבר זכתה לתשומת לב בינלאומית עם מודלים כמו DeepSeek. אסטרטגיה זו תואמת את תוכנית הדיגיטציה הרשמית של סין, אשר מקדמת שיתוף פעולה בקוד פתוח כמשאב לאומי מאז 2018 וצופה השקעה ממשלתית מסיבית בתשתית בינה מלאכותית.
עליבאבא כבר רשמה מעל 5.4 מיליון הורדות של מודלי ה-WAN שלה ב-Hugging Face וב-ModelScope, דבר המדגיש את הביקוש הבינלאומי החזק לפתרונות בינה מלאכותית בקוד פתוח סיניים. החברה מתכננת השקעות נוספות של כ-52 מיליארד דולר במחשוב ענן ובתשתיות בינה מלאכותית כדי לחזק את מעמדה בשוק הצומח במהירות זה.
קשור לזה:
Wan2.2 מביא לפריצת דרך בסרטוני בינה מלאכותית: קוד פתוח ברמה מקצועית
Wan2.2 מייצג נקודת מפנה ביצירת וידאו מבוססי בינה מלאכותית, ומציע את האלטרנטיבה הראשונה בקוד פתוח למודלים קנייניים בתשלום שיכולים להתחרות בפתרונות מסחריים. השילוב של איכות קולנועית, ניצול יעיל של חומרה וזמינות מלאה של קוד פתוח מציב את המודל כאלטרנטיבה אטרקטיבית עבור יוצרי תוכן, יוצרי סרטים ומפתחים ברחבי העולם.
סביר להניח שההשקה תגביר את התחרות בתחום יצירת וידאו המונע על ידי בינה מלאכותית ועשויה לעודד חברות אחרות לנקוט באסטרטגיות קוד פתוח דומות. עם יכולתה לפעול על חומרה צרכנית ולספק תוצאות מקצועיות, ל-Wan2.2 יש פוטנציאל להפוך את הפקת הווידאו לדמוקרטית ולפתוח אפשרויות יצירתיות חדשות.
על ידי שילוב טכנולוגיה מתקדמת עם פילוסופיית פיתוח פתוח, עליבאבא קובעת סטנדרטים חדשים ביצירת סרטוני בינה מלאכותית עם Wan2.2 ומבססת את סין ככוח מוביל בחדשנות עולמית בתחום הבינה המלאכותית. ההשלכות מרחיקות הלכת של פיתוח זה ישנו באופן מהותי את האופן שבו סרטונים נוצרים ומופקים בשנים הקרובות.
קשור לזה:
מומחה התעשייה שלך לטרנספורמציה של בינה מלאכותית, שילוב בינה מלאכותית ופלטפורמות בינה מלאכותית
☑️ שפת העסקים שלנו היא אנגלית או גרמנית
☑️ חדש: התכתבות בשפת האם שלך!
אני והצוות שלי שמחים לעמוד לרשותכם כיועצים האישיים שלכם.
ניתן ליצור איתי קשר על ידי מילוי טופס יצירת הקשר כאן wolfenstein@xpert.digital:או פשוט להתקשר אליי למספר 49 7348 4088 965+. כתובת הדוא"ל שלי היא
אני מצפה בקוצר רוח לפרויקט המשותף שלנו.
