
Kinas stora AI-offensiv: Med Wan 2.2 siktar Alibaba på att gå om västvärlden – och gör allt till öppen källkod – Bild: Xpert.Digital
Detta är Alibabas nya underverk AI Wan2.2: Gratis, kraftfullare än konkurrenterna och tillgängligt för alla
Kinas videosvar på OpenAI:s Sora: Denna nya AI genererar videor i biokvalitet – och den är gratis
Den 29 juli 2025 släppte det kinesiska teknikföretaget Alibaba Wan2.2, en spännande ny version av sin videogenereringsmodell med öppen källkod, som fundamentalt förändrar landskapet för artificiell intelligens för videoproduktion. Denna innovativa teknik representerar världens första videogenereringsmodell med öppen källkod som implementerar en Mixture-of-Experts (MoE)-arkitektur, utformad för både professionell filmproduktion och användning på standardhårdvara.
Relaterat till detta:
- Alibaba investerar över 50 miljarder dollar i AI och molntjänster – Artificiell generell intelligens (AGI) spelar en central roll
Teknologisk revolution genom MoE-arkitektur
Wan2.2 introducerar för första gången en arkitektur med en blandning av experter till videodiffusionsmodeller, vilket representerar ett betydande tekniskt genombrott. Denna innovativa arkitektur använder ett dubbelt expertsystem som delar upp videogenereringsprocessen i två specialiserade faser. Den första experten fokuserar på de tidiga stadierna av brusreducering och bestämmer den grundläggande scenlayouten, medan den andra experten hanterar de senare stegen och förfinar detaljer och texturer.
Systemet har totalt 27 miljarder parametrar, men aktiverar bara 14 miljarder parametrar per inferenssteg, vilket minskar beräkningsarbetet med upp till 50 procent utan att kompromissa med kvaliteten. Denna effektivitetsökning gör det möjligt att generera högkvalitativa videor samtidigt som beräkningskostnaderna hålls konstanta och den totala modellkapaciteten utökas.
Filmestetik och filmisk kontroll
En framstående funktion hos Wan2.2 är dess filmiska estetiska kontrollsystem, vilket gör det möjligt för användare att utöva exakt kontroll över olika visuella dimensioner. Modellen tränades på noggrant utvalda estetiska data, inklusive detaljerade etiketter för ljussättning, komposition, kontrast, nyans, kameravinkel, bildstorlek, brännvidd och andra filmiska parametrar.
Denna funktionalitet är baserad på ett filminspirerat promptsystem som kategoriserar viktiga dimensioner som ljussättning, belysning, komposition och färg. Detta gör det möjligt för Wan2.2 att exakt tolka och implementera användarens estetiska avsikter under genereringsprocessen, vilket möjliggör skapandet av videor med anpassningsbara filmiska preferenser.
Avancerad träningsdata och komplex rörelsegenerering
Jämfört med föregångaren Wan2.1 har träningsdatasetet utökats avsevärt: 65,6 procent mer bilddata och 83,2 procent mer videodata. Denna massiva dataexpansion förbättrar modellens generaliseringsmöjligheter avsevärt och ökar den kreativa mångfalden över flera dimensioner som rörelse, semantik och estetik.
Modellen visar betydande förbättringar i att generera komplexa rörelser, inklusive verklighetstrogna ansiktsuttryck, dynamiska handgester och invecklade atletiska rörelser. Dessutom levererar den realistiska renderingar med förbättrad kommandolydnad och efterlevnad av fysiska lagar, vilket resulterar i mer naturliga och övertygande videosekvenser.
Effektiv hårdvaruanvändning och tillgänglighet
Wan2.2 erbjuder tre olika modellvarianter som täcker olika krav och hårdvarukonfigurationer:
- Wan2.2-T2V-A14B: En text-till-video-modell med 27 miljarder parametrar (14 miljarder aktiva) som genererar videor med 720p-upplösning och 16fps.
- Wan2.2-I2V-A14B: En bild-till-video-modell med samma arkitektur för att konvertera statiska bilder till videor.
- Wan2.2-TI2V-5B: En kompakt modell med 5 miljarder parametrar som kombinerar både text-till-video- och bild-till-video-funktioner i ett enhetligt ramverk.
Den kompakta modellen TI2V-5B representerar ett betydande genombrott, eftersom den kan generera 5 sekunder långa 720p-videor på mindre än 9 minuter på en enda konsumentgrafikprocessor som RTX 4090. Denna hastighet gör den till en av de snabbaste 720p@24fps-modellerna som finns, vilket gör att både industriella tillämpningar och akademisk forskning kan dra nytta av tekniken.
Avancerad UAE-arkitektur för optimerad komprimering
TI2V-5B-modellen är baserad på en mycket effektiv 3D VAE-arkitektur med ett komprimeringsförhållande på 4×16×16, vilket ökar den totala informationskomprimeringshastigheten till 64. Med ett extra patchlager når det totala komprimeringsförhållandet för TI2V-5B till och med 4×32×32, vilket säkerställer högkvalitativ videorekonstruktion med minimala lagringskrav.
Denna avancerade komprimeringsteknik gör det möjligt för modellen att direkt stödja både text-till-video- och bild-till-video-uppgifter i ett enda, enhetligt ramverk, som täcker både akademisk forskning och praktiska tillämpningar.
Jämförelse av prestanda och marknadsposition
Wan2.2 testades mot ledande kommersiella AI-videogenereringsmodeller, inklusive Sora, KLING 2.0 och Hailuo 02, med hjälp av den nya utvärderingssviten Wan-Bench 2.0. Resultaten visar att Wan2.2 uppnår toppmodern prestanda i de flesta kategorier och överträffar sina högpresterande konkurrenter.
I direkta jämförelser av rankningar säkrade Wan2.2-T2V-A14B första plats i fyra av sex viktiga riktmärken, inklusive de kritiska områdena estetisk kvalitet och rörelsedynamik. Denna prestation etablerar Wan2.2 som den nya marknadsledaren inom öppen källkod inom högupplöst videogenerering.
Tillgänglighet och integration med öppen källkod
Wan2.2 finns tillgänglig som helt öppen källkodsprogramvara under Apache 2.0-licensen och kan laddas ner från Hugging Face, GitHub och ModelScope. Modellerna är redan integrerade i populära ramverk som ComfyUI och Diffusers, vilket möjliggör sömlös användning i befintliga arbetsflöden.
TI2V-5B-modellen har ett färdigt Hugging Face Space, vilket gör det möjligt för användare att omedelbart testa tekniken utan komplicerade installationer. Denna tillgänglighet demokratiserar tillgången till den senaste videogenereringstekniken och främjar innovation inom utvecklargemenskapen.
Kinas strategiska AI-offensiv
Lanseringen av Wan2.2 är en del av en bredare kinesisk AI-strategi med öppen källkod som redan har fått internationell uppmärksamhet med modeller som DeepSeek. Denna strategi ligger i linje med Kinas officiella digitaliseringsplan, som har främjat samarbete med öppen källkod som en nationell resurs sedan 2018 och förutser massiva statliga investeringar i AI-infrastruktur.
Alibaba har redan registrerat över 5,4 miljoner nedladdningar av sina WAN-modeller på Hugging Face och ModelScope, vilket understryker den starka internationella efterfrågan på kinesiska AI-lösningar med öppen källkod. Företaget planerar ytterligare investeringar på cirka 52 miljarder dollar i molntjänster och AI-infrastruktur för att stärka sin position på denna snabbt växande marknad.
Relaterat till detta:
Wan2.2 medför ett genombrott inom AI-videor: Öppen källkod på professionell nivå
Wan2.2 representerar en vändpunkt inom AI-videogenerering och erbjuder det första alternativet med öppen källkod till betalda, proprietära modeller som kan konkurrera med kommersiella lösningar. Kombinationen av filmisk kvalitet, effektivt hårdvaruutnyttjande och fullständig tillgänglighet med öppen källkod positionerar modellen som ett attraktivt alternativ för innehållsskapare, filmskapare och utvecklare över hela världen.
Lanseringen kommer sannolikt att intensifiera konkurrensen inom AI-driven videogenerering och kan uppmuntra andra företag att följa liknande strategier med öppen källkod. Med sin förmåga att köras på konsumenthårdvara och leverera professionella resultat har Wan2.2 potential att demokratisera videoproduktion och låsa upp nya kreativa möjligheter.
Genom att kombinera avancerad teknik med en öppen utvecklingsfilosofi sätter Alibaba nya standarder för AI-videogenerering med Wan2.2 och etablerar Kina som en ledande kraft inom global AI-innovation. De långtgående konsekvenserna av denna utveckling kommer att fundamentalt förändra hur videor skapas och produceras under de kommande åren.
Relaterat till detta:
Din expert på AI-transformation, AI-integration och AI-plattformsbranschen
☑️ Vårt affärsspråk är engelska eller tyska
☑️ NYTT: Korrespondens på ditt modersmål!
Jag och mitt team står gärna till er förfogande som er personliga rådgivare.
Du kan kontakta mig genom att fylla i kontaktformuläret här wolfenstein@xpert.digital:eller helt enkelt ringa mig på +49 7348 4088 965. Min e-postadress är
Jag ser fram emot vårt gemensamma projekt.
