Wan 3.0 toppar videorankningen – med ett knappt försprång
Artificial Analysis placerar Alibabas modell först för video med ljud. Resultatet hjälper vid modellval, men osäkerheten gör segern mindre självklar.
Alibabas Wan 3.0 ligger först i Artificial Analysis nya jämförelse av AI-modeller som gör video med ljud från en textinstruktion. Men förstaplatsen är knapp. För den som väljer verktyg till nästa film är resultatet en anledning att titta närmare på modellen – inte ett färdigt köpbeslut.
I AA-Video-T2V v2.0, avläst den 30 september, har Wan 3.0 ett Elo-värde på 1 157. Utopai X, som bygger på MiniMax H3, följer med 1 150. Dreamina Seedance 2.5 ligger trea med 1 143.
Elo sammanfattar hur ofta en modell föredras i jämförelser mot andra. Det är ingen procentandel rätt och inget betyg på en absolut skala.
Sju poäng är ett litet försprång
Wans 95-procentiga osäkerhetsintervall är 1 147–1 167. Utopai X ligger mellan 1 139 och 1 161. Intervallen överlappar, vilket gör det vanskligt att beskriva Wan som en självklar vinnare. Rankningen anger också ett möjligt placeringsspann på första till andra plats för Wan.
Det är alltså skillnad mellan att stå överst i tabellen just nu och att ha ett tydligt försprång som håller när fler jämförelser tillkommer.
Vad tittarna faktiskt väljer mellan
Enligt Artificial Analysis beskrivning får en rekryterad panel se två klipp skapade från samma instruktion, utan att veta vilka modeller som ligger bakom. Tittarna väljer det klipp de föredrar. Jämförelsen omfattar bland annat berättande, reklam och animation, samt förmågor som fysik, kamerarörelser och text i bilden.
I ljudversionen används 1 000 instruktioner. Klippen är normalt tio sekunder långa, och modellerna körs upp till 1080p utan att material med lägre upplösning förstoras. Ljudet ingår i bedömningen; modeller utan ljud har en separat lista.
Version 2.0 börjar dessutom om med nya röster. Poängen kan därför inte läsas som en fortsättning på den gamla tabellen. Röster från den öppna Video Arena räknas inte in i den här listan.
En kortlista, inte hela produktionsbeslutet
Alibaba beskriver Wan 3.0 som en modell för upp till 30 sekunders video med ljud, med stöd för bland annat text och referensbilder. Det är leverantörens produktuppgifter. Rankningens tio sekunders klipp visar inte i sig hur väl längre scener eller ett helt arbetsflöde fungerar.
Wan 3.0 toppar Artificial Analysis nya text-till-video-lista med ljud, vid avläsningen den 30 september.
Resultatet ger kreatörer en kandidat att jämföra när de väljer videomodell. Det lilla försprånget gör att förstaplatsen behöver läsas tillsammans med osäkerhetsintervallen.
En topplacering är mest användbar som hjälp att välja nästa jämförelse. Vi skulle lägga större vikt vid ett klipp som fungerar i produktionen än vid sju poäng i en tabell.




