Free YouTube Transcribe

Video transcript

Wan 2.7 ist da: Das kann das neue unzensierte Modell von Alibaba

ZELDOgiq · 1,464 words · 7 min read

Want to search this transcript, jump the video from any line, or download it as TXT, SRT, or VTT?

Open in the transcript tool

Full transcript

Intro

0:00Van 27 ist da und es bringt ein Feature

0:01auf das wir alle gewartet haben.

0:04Außerdem hat Alibaba auch noch Van 27

0:08als Bildmodell gebracht und damit

0:09herzlich willkommen oder Pagen Freunde

0:11zu eurer Topquelle für generative KI

0:15und dem größten Bild und Videelease den

0:17Alibaba Swan hier gemacht hat. Wir gehen

Erste Versuche: Bild-zu-Video

0:19direkt rein. Let's go. Wann nimm dieses

0:21Bild diese Audio und mach mir mal einen

0:24geilen Clip.

0:25Run for your life. Ah,

0:28okay, nicht schlecht. Okay, war jetzt

0:29nimmt dieses Bild. Sie ist am Times

0:31Square und ist ein Hot Dog. Let's go. Na

0:33ja, gut, dar müssen wir noch mal drüber

0:34reden, Freunde. Van 27 ist jetzt da. Das

0:38neue Flagship Modell vom Alibaba Konzern

0:41für Video, aber auch für Fotogenerierung

0:43und ich habe es euch getestet. Viele von

0:45euch kennen waren als Open Source Modell

0:47zuletzt mit Version 2. Damit konnte man

0:50wirklich alles generieren, aber seitdem

0:53gab es kein Open Source Modell. Und

0:54jetzt die Nachricht für alle Open Source

0:56Liebhaber da draußen. Nein, es ist noch

0:58nicht Open Source verfügbar. Trotzdem

1:00testen wir es heute auf Zensur Qualität

1:03und Besonderheiten, denn es hat ein

1:05Feature, was wirklich noch kein anderes

Audio-Sync & Lip-Sync Test

1:07in dieser Form hat. Folgende

1:09Spezialitäten bringt Warn mit. Es kann

1:11Start und A Frame und das krasse ist, es

1:14kann eine Tonspur mit verarbeiten. Ob

1:17das Ganze wirklich so funktioniert wie

1:18gedacht, checken wir jetzt mal. Ich habe

1:20jetzt mal dieses Bild hochgeladen und

1:22diese Tonspur

1:23zu eurer Topquelle für generative KI.

1:26Und jetzt ab nach Bochum

1:28und das dabei herausgekommen

1:30zu eurer Topquelle für generative KI.

1:33Und jetzt ab nach

1:35ziemlich enttäuschend an der Stelle. Ich

1:36versuche jetzt mal mit einem Avatarbild

1:38und schaue, ob es vielleicht auch als

1:40Lipsingmodell dient. Jetzt bin ich mal

1:42gespannt.

1:42Zu eurer Topquelle für generative KI und

1:46jetzt ab nach

1:47Es ist nicht mehr in der Nähe von

1:49Deutsch sprechen. Versuchen wir es mal

1:50mit Englisch. Go. AI now off.

1:56Also es ist nicht mal zeitversetz

1:57asynchron. Es spricht einfach kein

1:59Deutsch und kein Englisch. Denke mal,

2:01das ist für Hintergrunds oder was auch

2:03immer, vielleicht auch Erzähler Sounds,

2:05aber tatsächlich gibt es einen Weg, das

2:07synchron zu machen. Fedticado hat's mit

2:10einem Negativprompt gemacht. Im

2:12Negativprompt Bereich kopierst du

2:13einfach diesen Negativprompt und wenn du

2:15jetzt eine Audio hochlädst, dann

2:17Und hast du dir den Anzug im

2:19Sonderangebot gekauft, von dem ich dir

2:21erzählt habe, den mit den zwei Hosen?

2:24Ja, schon,

2:26aber das mache ich nie wieder. Da

2:27schwitzt man sich ja zu Tode.

2:32Also bei aller Liebe zum Modell, es

2:33glitscht mir immer noch zu viel und es

2:35sieht viel zu künstlich aus. Ich denke

2:37nicht, dass das so in der Form als

2:39Lipsyn Modell taugt. Vielleicht

2:41vielleicht kommt es ja als Open Source

2:43Modell und dann können wir eine

2:44Quantisiteide und eine spezielle Lipsink

2:46Version damit machen. Die Generierung

2:48dauert übrigens ewig. Ich habe mir nicht

2:49ohne Grund den gemütlichen Stuhl geholt.

2:52Inzwischen tat mein Popo schon richtig

2:53weh auf dem Hocker. Bis zu 10 Minuten

2:55Wartezeit für 5 Sekunden. Aber wir

2:57machen weiter und jetzt testen wir mal

Start- und Endframe Analyse

2:59Start und Endframe. Das ist der Start

3:01Frame. Das ist der Endframe mit Nano

3:03Banana 2 generiert und diesmal ohne

3:05Audio. Lass uns mal schauen, ob es jetzt

3:07vielleicht schneller geht und wie das

3:08Ergebnis ist. Und tatsächlich ohne Ton

3:11geht das deutlich schneller. Statt 8

3:12Minuten waren es jetzt nur dreieinhalb

3:14Minuten. Lasst uns schauen, wie das

3:16aussieht.

3:22Also von Cinematic ist hier nicht zu

3:23sehen, aber der Sound wurde generiert.

3:25Ich habe kein Sound hochgeladen. Jetzt

3:27machen wir das gleiche mal mit Cling 3,

3:29um einen direkten Vergleich zu haben.

3:30Das ist das Ergebnis von Kling

3:37ungefähr gleich nur kein Glitch von

3:39Banana Girl, was ich deutlich besser

3:41finde. Also für mich ist Kling 3 hier

3:43gerade besser gewesen. Die testen gleich

3:45die Zensur, aber vorher gibt es noch ein

3:47Feature, was es ganz besonders macht.

Multi-Video Referenz Feature

3:49Eine weitere Spezialität von One 27. Es

3:52kommt mit einem Reference to Video. Es

3:55ist extrem teuer und kostet für 5

3:57Sekunden ganze

3:59aber für euch teste ich das mal. Das

4:01krasse ist, du kannst fünf Videos als

4:03Referenz hinzufügen und dann kannst du

4:05im Prompt sagen: Character from Video

4:07One and Video 2 und so weiter sitzen vom

4:10Fernseher und spielen. Und hier bei dem

4:12Beispiel wurde dieses Video genommen

4:16und das als zweites Video.

4:19Und die beiden sollen jetzt zusammen ein

4:21Videospiel spielen und das Ergebnis.

4:28für 5 Sekunden ist das doppelte von dem,

4:31was wir aktuell für Qualität zahlen.

4:33Aber lass uns mal schauen, ob es sich

4:35lohnt. Zum Glück habe ich viele

4:36Videosegmente. Wir nehmen einmal Letin

4:38Zeldo, den Martin McFly hier,

4:40Hexenbanana Girl und Bosspand

4:42selbstverständlich. Hier sind teilweise

4:44echt auch Drachen dabei und so weiter.

4:46Ich will das Ganze mal ans Limit

4:47bringen. Es tut aber weh, diesen 1 € zu

4:49bezahlen. Machen wir aber trotzdem. Kein

4:51Referenzbild, diese fünf Videos als

4:53Charakter. Wir bleiben mal beim

4:55Videospiel, klicken auf generate, das

4:57tut echt weh. Let's go. Okay, schauen

4:59wir uns mal das Ergebnis an. Es sieht

5:00schon vielversprechend aus

5:06und dafür habe ich jetzt $ bezahlt.

5:08Also, ich habe fünf Videos hochgeladen

5:10und ich habe alle fünf markiert, aber

5:12einer und zwar ich wurde ausgelassen. Na

5:15ja, es ist definitiv kein Eurowert. Da

5:17arbeite ich lieber mit einem Character

5:19Sheet und markiere die Person. So, aber

5:20gut, dass wir es getestet haben. Bevor

5:22wir das Buildmodell testen, kommen wir

5:24mal zu der Stärke von waren. Bisher

Zensur & Unzensierte Möglichkeiten

5:26konnte man hier frei und unzensiertes

5:28Material generieren. Ist das mit 27 in

5:32der Cloud genauso oder nicht? Das testen

5:34wir jetzt mal. Wir nehmen dieses Bild.

5:35Wir haben kein Endframe und kein Ton.

5:37Ich schreib mal etwas, um das zu testen

5:39und dann gucken wir uns das Ergebnis an.

5:41Und sieh da, wenigstens das ist gleich

5:44geblieben. Das Modell hat anscheinend

5:46genau die gleichen Limits, die das

5:47letzte Modell auch hatte. Also, man kann

5:49hier deutlich mehr machen als mit den

5:51anderen großen Modellen. Immerhin ein

5:53Win. Wenn ihr den ganzen Zensurtest

5:55sehen wollt, habe ich euch das Video in

5:58den Community Discord hochgeladen. Der

5:59Link dazu ist im ersten angepinten

6:01Kommentar. Kommen wir jetzt mal zum

6:02Bildmodell. Van 27 hat gleichzeitig auch

Bildmodell

6:04zwei Bildmodelle gebracht. Einmal ein

6:07Pro und einmal ein nicht Pro für

6:09Bildbearbeitung, aber auch Text zu Bild.

6:11Das ganze halte ich mal eher kurz, weil

6:13die Bilder sind gar nicht mal so gut.

6:15Cryptody hat z.B. diese Bilder generiert

6:17und für mich sieht das absolut nach MS

6:19Paint aus. Also mit mehreren Referenzen

6:22ist das nicht so toll. Und das Bild habe

6:24ich ja zum Start generiert und auch hier

6:26ist das Bild recht befremdlich in die

6:28Umgebung reingesetzt. Die Belichtung

6:30wurde nicht verändert. Die Menschen sind

6:32eher ostasiatisch, obwohl das jetzt New

6:34York ist. Auch die Billboards sind

6:36asiatisch und nicht New York. Also, es

6:38hat gar keine Logik, sondern es setzt

6:41einfach Bilder zusammen. Wir sprechen

6:42gleich noch über die Kosten, aber lass

6:43uns jetzt auch mal hier das Bildmodell

6:45auf Zensur testen. Und auch das

6:47Bildmodell erlaubt deutlich mehr. Ich

6:49werde das definitiv auch bei Accura

6:51einbinden und für den Not safe for Work

6:53Prozess freischalten. Wenn man nicht

6:55allzu viel am Bild verändert, ist es

6:57auch tatsächlich ein gutes Ergebnis,

6:58aber wenn man jetzt einfach die Umgebung

7:00verändert, dann werden einfach nur

7:02Bilder zusammengeklatscht. Auch das Bild

7:04findet ihr im Community Discord übrigens

7:06auch die Bildgenerierung dauert gerade

7:08ewig. Vielleicht ist das, weil es neu

7:10ist. Das beobachten wir mal. 127 kostet

Kosten & Verfügbarkeit

7:13für 5 Sekunden Start, Endframe und Ton

7:16in 720p 50 Cent und in Full HD 75 Cent.

7:21Das finde ich ist ein guter Preis dafür,

7:23dass man direkt auch Ton mitbringen

7:25kann. Im Vergleich dazu Kling kostet 50

7:28Cent, Cance kostet auch 50 Cent für 5

7:30Sekunden mit direkter Vertonung. 227

7:33Image kommt mit einer Pro und nicht Pro

7:34Version. Die nicht Pro Version kann ich

7:36überhaupt nicht empfehlen, die ist gar

7:37nicht gut und die Pro Version kostet 7,5

7:40Cent für ein HDBild und man kann bis zu

7:43fünf Referenzen hochladen und daraus ein

7:45Bild generieren. Aktuell könnt ihr alle

7:47W 27 Modelle bei Wavespeed nutzen. Wenn

7:50das Video hochgeladen ist, ist es hier

7:51auch bei Icura unter Videos als Modell

7:54gelistet und bei wann selbst ist es

7:57leider noch nicht drin. Das war der

7:58erste Eindruck von waren 27. Einerseits

Fazit

8:01finde ich super, dass man damit deutlich

8:03freier ist. Andererseits ist die

8:04Qualität etwas enttäuschend. Aber ich

8:06werde jetzt weiter testen und morgen in

8:08den News gibt's noch mal Ergebnisse

8:09dazu. Wenn du keine spektakulären Kests

8:11verpassen möchtest, dann lass ein Sub da

8:13und hat dir das Video gefallen, zeig's

8:14mir gerne mit einem Like. Wir sehen uns

8:16beim nächsten Mal. dein Zeldo.

Recently added transcripts

Browse the whole transcript library

This transcript was generated from the captions YouTube publishes for this video. Get the transcript of any YouTube video atfreeyoutubetranscribe.com, free, unlimited, no sign-up.