Full transcript
Intro
0:00Van 27 ist da und es bringt ein Feature
0:01auf das wir alle gewartet haben.
0:04Außerdem hat Alibaba auch noch Van 27
0:08als Bildmodell gebracht und damit
0:09herzlich willkommen oder Pagen Freunde
0:11zu eurer Topquelle für generative KI
0:15und dem größten Bild und Videelease den
0:17Alibaba Swan hier gemacht hat. Wir gehen
Erste Versuche: Bild-zu-Video
0:19direkt rein. Let's go. Wann nimm dieses
0:21Bild diese Audio und mach mir mal einen
0:24geilen Clip.
0:25Run for your life. Ah,
0:28okay, nicht schlecht. Okay, war jetzt
0:29nimmt dieses Bild. Sie ist am Times
0:31Square und ist ein Hot Dog. Let's go. Na
0:33ja, gut, dar müssen wir noch mal drüber
0:34reden, Freunde. Van 27 ist jetzt da. Das
0:38neue Flagship Modell vom Alibaba Konzern
0:41für Video, aber auch für Fotogenerierung
0:43und ich habe es euch getestet. Viele von
0:45euch kennen waren als Open Source Modell
0:47zuletzt mit Version 2. Damit konnte man
0:50wirklich alles generieren, aber seitdem
0:53gab es kein Open Source Modell. Und
0:54jetzt die Nachricht für alle Open Source
0:56Liebhaber da draußen. Nein, es ist noch
0:58nicht Open Source verfügbar. Trotzdem
1:00testen wir es heute auf Zensur Qualität
1:03und Besonderheiten, denn es hat ein
1:05Feature, was wirklich noch kein anderes
Audio-Sync & Lip-Sync Test
1:07in dieser Form hat. Folgende
1:09Spezialitäten bringt Warn mit. Es kann
1:11Start und A Frame und das krasse ist, es
1:14kann eine Tonspur mit verarbeiten. Ob
1:17das Ganze wirklich so funktioniert wie
1:18gedacht, checken wir jetzt mal. Ich habe
1:20jetzt mal dieses Bild hochgeladen und
1:22diese Tonspur
1:23zu eurer Topquelle für generative KI.
1:26Und jetzt ab nach Bochum
1:28und das dabei herausgekommen
1:30zu eurer Topquelle für generative KI.
1:33Und jetzt ab nach
1:35ziemlich enttäuschend an der Stelle. Ich
1:36versuche jetzt mal mit einem Avatarbild
1:38und schaue, ob es vielleicht auch als
1:40Lipsingmodell dient. Jetzt bin ich mal
1:42gespannt.
1:42Zu eurer Topquelle für generative KI und
1:46jetzt ab nach
1:47Es ist nicht mehr in der Nähe von
1:49Deutsch sprechen. Versuchen wir es mal
1:50mit Englisch. Go. AI now off.
1:56Also es ist nicht mal zeitversetz
1:57asynchron. Es spricht einfach kein
1:59Deutsch und kein Englisch. Denke mal,
2:01das ist für Hintergrunds oder was auch
2:03immer, vielleicht auch Erzähler Sounds,
2:05aber tatsächlich gibt es einen Weg, das
2:07synchron zu machen. Fedticado hat's mit
2:10einem Negativprompt gemacht. Im
2:12Negativprompt Bereich kopierst du
2:13einfach diesen Negativprompt und wenn du
2:15jetzt eine Audio hochlädst, dann
2:17Und hast du dir den Anzug im
2:19Sonderangebot gekauft, von dem ich dir
2:21erzählt habe, den mit den zwei Hosen?
2:24Ja, schon,
2:26aber das mache ich nie wieder. Da
2:27schwitzt man sich ja zu Tode.
2:32Also bei aller Liebe zum Modell, es
2:33glitscht mir immer noch zu viel und es
2:35sieht viel zu künstlich aus. Ich denke
2:37nicht, dass das so in der Form als
2:39Lipsyn Modell taugt. Vielleicht
2:41vielleicht kommt es ja als Open Source
2:43Modell und dann können wir eine
2:44Quantisiteide und eine spezielle Lipsink
2:46Version damit machen. Die Generierung
2:48dauert übrigens ewig. Ich habe mir nicht
2:49ohne Grund den gemütlichen Stuhl geholt.
2:52Inzwischen tat mein Popo schon richtig
2:53weh auf dem Hocker. Bis zu 10 Minuten
2:55Wartezeit für 5 Sekunden. Aber wir
2:57machen weiter und jetzt testen wir mal
Start- und Endframe Analyse
2:59Start und Endframe. Das ist der Start
3:01Frame. Das ist der Endframe mit Nano
3:03Banana 2 generiert und diesmal ohne
3:05Audio. Lass uns mal schauen, ob es jetzt
3:07vielleicht schneller geht und wie das
3:08Ergebnis ist. Und tatsächlich ohne Ton
3:11geht das deutlich schneller. Statt 8
3:12Minuten waren es jetzt nur dreieinhalb
3:14Minuten. Lasst uns schauen, wie das
3:16aussieht.
3:22Also von Cinematic ist hier nicht zu
3:23sehen, aber der Sound wurde generiert.
3:25Ich habe kein Sound hochgeladen. Jetzt
3:27machen wir das gleiche mal mit Cling 3,
3:29um einen direkten Vergleich zu haben.
3:30Das ist das Ergebnis von Kling
3:37ungefähr gleich nur kein Glitch von
3:39Banana Girl, was ich deutlich besser
3:41finde. Also für mich ist Kling 3 hier
3:43gerade besser gewesen. Die testen gleich
3:45die Zensur, aber vorher gibt es noch ein
3:47Feature, was es ganz besonders macht.
Multi-Video Referenz Feature
3:49Eine weitere Spezialität von One 27. Es
3:52kommt mit einem Reference to Video. Es
3:55ist extrem teuer und kostet für 5
3:57Sekunden ganze
3:59aber für euch teste ich das mal. Das
4:01krasse ist, du kannst fünf Videos als
4:03Referenz hinzufügen und dann kannst du
4:05im Prompt sagen: Character from Video
4:07One and Video 2 und so weiter sitzen vom
4:10Fernseher und spielen. Und hier bei dem
4:12Beispiel wurde dieses Video genommen
4:16und das als zweites Video.
4:19Und die beiden sollen jetzt zusammen ein
4:21Videospiel spielen und das Ergebnis.
4:28für 5 Sekunden ist das doppelte von dem,
4:31was wir aktuell für Qualität zahlen.
4:33Aber lass uns mal schauen, ob es sich
4:35lohnt. Zum Glück habe ich viele
4:36Videosegmente. Wir nehmen einmal Letin
4:38Zeldo, den Martin McFly hier,
4:40Hexenbanana Girl und Bosspand
4:42selbstverständlich. Hier sind teilweise
4:44echt auch Drachen dabei und so weiter.
4:46Ich will das Ganze mal ans Limit
4:47bringen. Es tut aber weh, diesen 1 € zu
4:49bezahlen. Machen wir aber trotzdem. Kein
4:51Referenzbild, diese fünf Videos als
4:53Charakter. Wir bleiben mal beim
4:55Videospiel, klicken auf generate, das
4:57tut echt weh. Let's go. Okay, schauen
4:59wir uns mal das Ergebnis an. Es sieht
5:00schon vielversprechend aus
5:06und dafür habe ich jetzt $ bezahlt.
5:08Also, ich habe fünf Videos hochgeladen
5:10und ich habe alle fünf markiert, aber
5:12einer und zwar ich wurde ausgelassen. Na
5:15ja, es ist definitiv kein Eurowert. Da
5:17arbeite ich lieber mit einem Character
5:19Sheet und markiere die Person. So, aber
5:20gut, dass wir es getestet haben. Bevor
5:22wir das Buildmodell testen, kommen wir
5:24mal zu der Stärke von waren. Bisher
Zensur & Unzensierte Möglichkeiten
5:26konnte man hier frei und unzensiertes
5:28Material generieren. Ist das mit 27 in
5:32der Cloud genauso oder nicht? Das testen
5:34wir jetzt mal. Wir nehmen dieses Bild.
5:35Wir haben kein Endframe und kein Ton.
5:37Ich schreib mal etwas, um das zu testen
5:39und dann gucken wir uns das Ergebnis an.
5:41Und sieh da, wenigstens das ist gleich
5:44geblieben. Das Modell hat anscheinend
5:46genau die gleichen Limits, die das
5:47letzte Modell auch hatte. Also, man kann
5:49hier deutlich mehr machen als mit den
5:51anderen großen Modellen. Immerhin ein
5:53Win. Wenn ihr den ganzen Zensurtest
5:55sehen wollt, habe ich euch das Video in
5:58den Community Discord hochgeladen. Der
5:59Link dazu ist im ersten angepinten
6:01Kommentar. Kommen wir jetzt mal zum
6:02Bildmodell. Van 27 hat gleichzeitig auch
Bildmodell
6:04zwei Bildmodelle gebracht. Einmal ein
6:07Pro und einmal ein nicht Pro für
6:09Bildbearbeitung, aber auch Text zu Bild.
6:11Das ganze halte ich mal eher kurz, weil
6:13die Bilder sind gar nicht mal so gut.
6:15Cryptody hat z.B. diese Bilder generiert
6:17und für mich sieht das absolut nach MS
6:19Paint aus. Also mit mehreren Referenzen
6:22ist das nicht so toll. Und das Bild habe
6:24ich ja zum Start generiert und auch hier
6:26ist das Bild recht befremdlich in die
6:28Umgebung reingesetzt. Die Belichtung
6:30wurde nicht verändert. Die Menschen sind
6:32eher ostasiatisch, obwohl das jetzt New
6:34York ist. Auch die Billboards sind
6:36asiatisch und nicht New York. Also, es
6:38hat gar keine Logik, sondern es setzt
6:41einfach Bilder zusammen. Wir sprechen
6:42gleich noch über die Kosten, aber lass
6:43uns jetzt auch mal hier das Bildmodell
6:45auf Zensur testen. Und auch das
6:47Bildmodell erlaubt deutlich mehr. Ich
6:49werde das definitiv auch bei Accura
6:51einbinden und für den Not safe for Work
6:53Prozess freischalten. Wenn man nicht
6:55allzu viel am Bild verändert, ist es
6:57auch tatsächlich ein gutes Ergebnis,
6:58aber wenn man jetzt einfach die Umgebung
7:00verändert, dann werden einfach nur
7:02Bilder zusammengeklatscht. Auch das Bild
7:04findet ihr im Community Discord übrigens
7:06auch die Bildgenerierung dauert gerade
7:08ewig. Vielleicht ist das, weil es neu
7:10ist. Das beobachten wir mal. 127 kostet
Kosten & Verfügbarkeit
7:13für 5 Sekunden Start, Endframe und Ton
7:16in 720p 50 Cent und in Full HD 75 Cent.
7:21Das finde ich ist ein guter Preis dafür,
7:23dass man direkt auch Ton mitbringen
7:25kann. Im Vergleich dazu Kling kostet 50
7:28Cent, Cance kostet auch 50 Cent für 5
7:30Sekunden mit direkter Vertonung. 227
7:33Image kommt mit einer Pro und nicht Pro
7:34Version. Die nicht Pro Version kann ich
7:36überhaupt nicht empfehlen, die ist gar
7:37nicht gut und die Pro Version kostet 7,5
7:40Cent für ein HDBild und man kann bis zu
7:43fünf Referenzen hochladen und daraus ein
7:45Bild generieren. Aktuell könnt ihr alle
7:47W 27 Modelle bei Wavespeed nutzen. Wenn
7:50das Video hochgeladen ist, ist es hier
7:51auch bei Icura unter Videos als Modell
7:54gelistet und bei wann selbst ist es
7:57leider noch nicht drin. Das war der
7:58erste Eindruck von waren 27. Einerseits
Fazit
8:01finde ich super, dass man damit deutlich
8:03freier ist. Andererseits ist die
8:04Qualität etwas enttäuschend. Aber ich
8:06werde jetzt weiter testen und morgen in
8:08den News gibt's noch mal Ergebnisse
8:09dazu. Wenn du keine spektakulären Kests
8:11verpassen möchtest, dann lass ein Sub da
8:13und hat dir das Video gefallen, zeig's
8:14mir gerne mit einem Like. Wir sehen uns
8:16beim nächsten Mal. dein Zeldo.