Free YouTube Transcribe

Video transcript

Reading Club #20 Спец. выпуск: Никита Качаев — VLA против забывания: новый метод выравнивания

AI Talent Hub · 9,560 words · 44 min read

Want to search this transcript, jump the video from any line, or download it as TXT, SRT, or VTT?

Open in the transcript tool

Full transcript

0:00Всем

0:03ещё раз привет, кто пришёл.

0:05А у нас новый очередной

0:10Reading Club. Вот сегодня с нами Никита,

0:13он исследователь из Аири. Вот. Ну и

0:16также магистрат нашего Хаба.

0:19А сегодня расскажет про Visual Visual

0:23action visual language action models.

0:25Вот это, соответственно, то, что драйвит

0:29сейчас и там Physical AI, кому как

0:32нравится.

0:34Ну и да, передаю слово Никите.

0:39>> Так, а супер. Всем привет ещё раз.

0:44Меня зовут, а, Никита Качаев,

0:47инженер-следователь.

0:49А, зер и магистрант

0:52AAхhub. Вот сегодня мы поговорим про

0:57такое довольно популярное горячее

0:59направление

1:00а в

1:02исследованиях. А мы говорим про Visual

1:05Language Action модели. А, и

1:10расскажу про нашу новую статью, а, про

1:13метод, а, равнивание визуальных

1:16представлений для геназации в белой

1:18моделях.

1:20Вот. А, ну, начнём, а, с такого введения

1:23вообще, что было раньше и как мы пришли

1:27а к такой жизни. Вот. А где-то году в

1:322016,

1:33а восемнадцатом люди занимались решением

1:38м довольно таких игрушечных задач. Они

1:41решали их при помощи Реля. А это вот

1:45симулятор Атари там был. А есть такая

1:48среда, э, муджока, где бегали всякие

1:51паучки, мм, всякие а ноги и прочие штуки

1:56ходили. Вот. Ну, это типа на самом деле

1:59далеко а-а всё от реальности. Вот. И,

2:05наверное, с двадцатого-двадца второго

2:07года начали появляться постепенно

2:09работы, в которых говорилось про таких

2:13лист-моделей. Во-первых, начали

2:15использовать трансформеры. А вот и люди

2:20начали задумываться о том, чтобы,

2:21во-первых, решить более сложные задачи,

2:23во-вторых, решать не каждая модель.

2:27решает определённую задачу. А люди

2:30пытались найти метод, а, способ для

2:34обучения такой большой джинлист модели

2:36для решения различных сложных задач.

2:39Вот. Ну, на примере тут Вайма, одна из

2:42таких тоже первых работ, а, интересных.

2:45Вот. М всё это постепенно переросло в

2:49направление, которое сейчас, э,

2:51называется не направление, наверное,

2:54область исследования велой модели. Вот,

2:56по сути, аналогию здесь можно проводить

2:59с тем, как развивался

3:02развивалась область NLP, как она как

3:05появилась такая большая ветвь

3:08large language моделей. Вот здесь в

3:11чём-то было схоже, а и до сих пор

3:13происходят схожие штуки. Вот. А на самом

3:17деле текущий текущие VLмодели

3:19представляют из себя следующее. А на

3:22слайде я привёл картинку из статьи

3:25OpenVLA. Можно сказать, что это хорошая

3:28такая базовая модель в текущий момент,

3:31которая породила ещё множество статей,

3:34которые в двадцать пятом году выходят.

3:35Вот статья двадцать четвёртого года.

3:38Основная идея в чём? Мы аналогично мм

3:43что что мы делаем? Мы хотим, чтобы у нас

3:47была большая модель, которая может

3:49решать много различных работех задач, и

3:52гилизоваться на различные сценарии, на

3:54различные имбадименты, то есть на разных

3:56роботах с минимальными усилиями. Вот на

4:00картинке видите типа Scale OB training

4:02data написано. Вот основная идея в том,

4:05чтобы взять а существующую VLM модель. А

4:09авторы взяли Prmati VLM, по сути это

4:12лама вторая 7B. А, который был прикручен

4:16там Vision Transformer. Вот взяли эту VM

4:19модель и обучали на а различных работех

4:24датасетах, а добычали геировать вместо

4:27текста экшены. Это можно по-разному

4:30делать. Здесь они прямо

4:33в словарь текстовый, а, взяли просто

4:36неиспользуемые слова. И эти слова, а,

4:39эти токены, а, они отвели под

4:42экшн-токены. Вот. А мы можем, ну, action

4:45вектор у нас, допустим, семимерный- это

4:47просто, мм, точка, куда должен при

4:51прийти конечный, а, конечная часть

4:53робота. Дефктор называется. Это X Y, Z

4:56координаты, а, три угла поворота и

5:00открыт гриппер или закрыт, или насколько

5:02он открыт от нуля до единицы. Вот такой

5:03векторок. Вот мы можем этот вектор,

5:07каждую размерность дискретизовать

5:09и, соответственно, предсказывать, а, по

5:13картинке. И по тексту на вход семь

5:16токенов, которые будут за каждую

5:18размерность отвечать, потом эти токены

5:21стекинизировать, получать числа и уже,

5:24а, выполнять их, эти это действия в

5:28среде. Вот Openvate - это такая хорошая

5:30работа. Они взяли вот большую модель 7B,

5:32ещё раз, да, после неё появилось

5:35много-много различных работ и в целом,

5:38наверное, такой хайп в VLA области. Мм,

5:41>> извини, ещё вопрос сразу. А,

5:44>> а вот всё, я вижу, как запрос туда

5:45попадает. Всёвсёвс, сорри,

5:48>> я хотел спросить, как. Ну о'кей, я

5:50понял,

5:51>> да. Вот. Тут ещё ещё раз подробно там,

5:55как устроена эта моделька была. Вот. А

5:59результаты, которые они получили, на

6:00самом деле, они были довольно хорошие.

6:02Они взяли большую модель спретрейна. И

6:05спритрейна - это эта модель, то есть без

6:07а обучения под конкретный сценарий. в их

6:10статье она показывала хорошие результаты

6:13в сравнении с тем, что было раньше. А,

6:15например, там OCT R2 модели - это тоже

6:18большие модели с притрейном. Ну, OpenVA

6:20я считаю, что получилось вот на тот

6:23момент лучше всего. И эту модель начали

6:25сильно использовать другие

6:27исследователи. Вот. А, в частности,

6:29ребята, которые делали Open VLA, они,

6:32часть из них основала свой стартап, а,

6:35который называется Physical

6:37Intelligence, и начали выпускать уже

6:41более, а, чуть более закрытые модели.

6:44Например, а, самая недавняя, а, модель

6:48P05.

6:50Вот. А основная идея здесь идеи все все

6:54те же. Мы хотим генеризоваться, мы хотим

6:57делать притрейнинг. Притрейнинг

7:00настолько хороший, что он поможет нам в

7:03новых средах, а, с полточка заводить

7:06модель без специального дефайтюна.

7:09Вот. И здесь, ну, понемно немножко

7:11по-другому сама моделька устроена, но

7:13смысл там тот же. У нас есть

7:15предобученная VLM, и мы её специальным

7:19образом добычаем, тоже делаем такой

7:22трейн, но уже на работе с данных. Вот. И

7:24в этой в этой работе они тоже показали,

7:27ну, текущий момент, наверное, самая

7:28хорошая, самая лучшая работа, которая

7:31есть, и моделька в Openourсе. А, и они

7:34показали, ну, вот, да, тут архитектура

7:37немножечко другая, они уже начали

7:39использовать всякие diffusion flow

7:41matching стратегии. Ну, в принципе,

7:44смысл от от смысл это особо что-то новое

7:48это особо прямо не вносит. Идея та же.

7:51Вот. А интересно то, что они показали на

7:54графиках.

7:56А это был было было несколько графиков,

7:58но вот самый левый о чём, в принципе, их

8:01статья пим,

8:03что мы можем а таким образом преобучить

8:07и сделать такую V-модель, которая будет

8:09генизоваться. Вот у них статья по сути

8:11про то, что нужно для хорошей генизации

8:13вла моделях. Вот то, что они показали

8:16здесь левый график, он довольно

8:18интересный. А по оси X здесь у нас

8:21количество локаций, то есть разных. Они

8:23ездили по домам Сан-Франциска

8:25по разным локациям и тестировали на там

8:28задаче уборки комнаты свою модель на

8:32одном роботе. Вот по оси X - это

8:34количество различных локаций, а по оси Y

8:38здесь средний performance. Вот. И

8:41значит, что этот график показывает? Ну,

8:42в целом, первый момент - это значит, а

8:46самые правые вот эти столбики. Самый

8:48нижний столбик - это если не делать

8:50притрейнинг. То есть притренинг нам

8:52нужен. Если притренинга нет, то

8:54перформанс очень плохой. М далее

8:58зелёный столбец. А там тоже они уже

9:01взяли in domain data. In the domain data

9:04- это значит они с этих домов, с новых

9:06локаций, они уже подсобирали данные и

9:09дообучили модель на этом всём. Вот. И

9:13если теперь смотреть на левый график, то

9:15оказывается, что у них получилось аа так

9:20а затюнить, точнее так предобучить

9:22модель, что она генерализуется,

9:27а также хорошо, точнее, она показывает

9:30такой же хороший результат, как и

9:32модель, которую тюнят прямо на данных,

9:35собранных в этом домене, в этом доме.

9:38Вот. Я надеюсь, я понятно. А эту

9:42приложение, короче, ну здесь понятно

9:44пояснил. А вот чем, то есть по чем

9:48больше они докидывали себе втрей новых

9:50локаций каких-то, а тем лучше модель

9:53моглазоваться уже на более невидных. Но

9:56здесь заметны заметная вещь и важная

10:00самая по сути, а то, что этот график он,

10:03ну, во-первых, он не доведён там до

10:04конца. А что будет, если 150 локаций,

10:07200 добавить, да? И видно, что он в

10:09целом выходит на плато, и плато - это не

10:12в 100% качества. И задач там было

10:15четыре, которые они тестили. И на самом

10:18деле текущая вот проблема, о которой,

10:21которую хотел поднять здесь, это

10:23проблема связана с тем, что у нас всё

10:25ещё нету момента, а ча момент, как было

10:30с LM VLM моделями. А когда мы когда люди

10:35начали притренить на огромном количестве

10:37данных модели и они начали реализоваться

10:40очень хорошо, а в самых разных доменах

10:44сейчас в работиксе, а, ну вот тоже новая

10:47статья, вышла она совсем недавно, а, я

10:50не знаю, там недели две назад. А, Gen

10:54Zero. А вот это сейчас на данный момент

10:56самая большая модель. Вот можно

11:00посмотреть левый график там сравни с пи

11:0305 вот как раз её размеры, да, и они

11:06показывают тоже своей статье. Если мы

11:08будем скейлить модель, скейлить досет,

11:10то качество у нас там будет расти. Вот

11:12они показывают графики с sc слинглоса.

11:15Чем больше возьмём модель, тем лучше она

11:17будет сходиться. Чем больше данных

11:19используем, тем лучше это будет всё

11:21работать. А, но, но в текущий момент, а,

11:24на самом деле, вот тут есть даже

11:26видосики красивые, как,

11:30извиняюсь, как робот, а, кладёт телефон

11:35в коробку или какие-то вещи. Вот. На

11:37самом деле, а по экспериментам, которые

11:40делаем мы, которые делают люди и постят

11:42в Твиттере про это всё, мм, до сих пор

11:46мы не достигли этого момента, когда

11:48модель из Пайтюна на данный на

11:51конкретный домен, она заведётся. Вот. И

11:55это огромная проблема, до которой до

11:57которой которую ещё предстоит решить.

12:00Проблема в том, что у нас не так много

12:02работекс данных. А если с текстами и

12:05картинками можем скачать весь интернет,

12:07а с роботами мы не имеем интернета для

12:10роботов, и нам нужно собирать данные, а

12:12они слишком дорогие. Вот. А вторую

12:15проблему, которую я хотел бы отметить, а

12:18связана с тем, что, а, соответственно,

12:20вот все Vay модели, которые выходят,

12:23они репортят

12:25точнее нет. Вторая проблема

12:28связана с бенчмарками. Аэ, панчмарки в

12:31основном завязаны на том, насколько там

12:33хорошо экшены выполняют модели. А, но

12:38они не фокусируются на том, а вот

12:40сохранились ли знания, а, в модели. Мы

12:42же взяли VLM-модель, а, до обучили её на

12:45экшн датасете на Robotics, а, и получили

12:49VLA модель. А сохранились ли исходные

12:51знания о мире, о природе, о всём а после

12:55добычения на экшн датасете. Вот м таких

12:58бенчмарков а в текущий момент нету. Вот.

13:01И третья проблема заключается в том, что

13:04мм все результаты, которые репортят в

13:06основном на велой моделях, если это

13:08открытые какие-то результаты, они

13:10используют панчмарки, которые в данный

13:12момент уже сильно оверфитнуты. Мм,

13:15следующая картинка вот справа, это

13:18картинка из статьи. А тут, в принципе,

13:20хороший пул моделей, а, Vй приведён за

13:23вот прошлый, текущий год. И можно

13:27посмотреть на скоры, которые здесь

13:30модели выбивают. И тут уже модели под

13:3399% бьют бенчмарк, но при этом выходят

13:36статьи всё равно новые, в которых новая

13:40очередная велая модель, а, выбивает скор

13:4299,9%.

13:44После этого авторы заявляют, что у нас

13:46лучшая модель. А в то в то же время ещё

13:50помимо того, что они заявляют у нас

13:51суперкрутая модель. М тут слева видно,

13:55значит, large small и tiny, размеры

13:57моделей. Авторы ещё заявляют, что мы

13:59можем на самом деле уменьшить модель

14:01сильно, а, например, там с 7 млрд

14:04параметров до 0,5 млрд параметров и

14:08повысить типа сделать такую хорошую

14:10модель, что она будет бить бенчмарк в

14:13разы лучше, чем семимиллиардные. Вот это

14:16большая проблема, потому что если

14:18запускать вот все эти работы с этими

14:21маленькими моделями, да, ну недавно,

14:22например, там у Хокенфейса у них была

14:25VLM модель Small VLM, а они выпустили

14:29маленькую модельку, которая бьёт

14:30бенчмарки тоже VLмные. Вот оказалось,

14:33что ну её не особо можно нормально

14:35применять. Аналогично велой тоже они

14:38зарелизили, по-моему, летом свой small

14:42V. А на бечмарках она очень хорошие

14:45результаты показывает. Если запускать на

14:47реальном роботе, ну, она никуда не

14:50годится. То есть есть проблема с тем,

14:52как бенчмаркется. Вот. А чтобы решить

14:56решить первую проблему, нам нужно много

14:58данных. Её как бы мы в нашей статье не

15:02решаем пока что а каким-то умным

15:04способом. Чтобы решить две последние

15:07проблемы, а мы предлагаем следующее. Вот

15:10уже переходя к работе. А, во-первых, мы

15:14в работе, а, да, задались вопросом,

15:17можем ли мы, а, измерить, а, насколько

15:20общее знания, а, отлэмки исходной,

15:24которая была, а, сохранились в Vay

15:27модели после Фатюна на работе данных.

15:31Вот для этого мы предложили такой, а,

15:33простой бенчмарк в чём-то. А он

15:36симуляторе. А здесь выложено несколько,

15:40ну, в

15:42в сцене на столе выложено несколько

15:44плашек. На этих плашках появляются

15:47различные рисунки. Здесь у нас есть

15:49несколько категорий. Мы выбрали такие

15:51типа категории, которые обычно не

15:54присутствуют в работе с данных

15:56метасетах, но при этом они важны для

15:58понимания мира. Например, дорожные

16:00знаки, они не во всех рабочих детосетах

16:02есть. или там паблик инфо какое-нибудь,

16:06вот, или там иконки центральной машины.

16:09Вот мы предложили такой бенчмарк,

16:12который направлен на то, чтобы проверить

16:15трансфер знаний. Здесь мы специально

16:17выкрутили на минимум сложность

16:19выполнения экшенов. В нашем сетапе у нас

16:22модель всегда хватала эту морковку. М и

16:25мы хотели сфокусироваться именно на том,

16:28куда она кладёт её. А текстовая

16:30инструкция на вход поступающая. Обычно

16:33имеет вид такой: а положи, например,

16:36морковку на

16:39зелёный, а зелёный объект или положи

16:43морковку на прямоугольник или положи

16:46морковку на значок солнечной погоды.

16:50Вот. И здесь мы проверяем этим

16:52банчмаркам, насколько V модели могут

16:55входной текст мапить в то, что они

16:57видят, и выполнять действия соо в

17:00соответствии с этим. Вот. То, что мы

17:02выявили, то, что мы выявили, будет на,

17:06э, через два слайда ещё. А, а пока что,

17:11ладно, я просто покажу, что мы выявили.

17:13А вот здесь результаты как раз-таки,

17:16которые мы получили. Мы потестировали

17:20V-модели и VLM модели. А

17:25как раз зачем мы велом модели тестили,

17:27чтобы посмотреть вообще какой перформанс

17:29у исходной модели, который ещё не тюнили

17:32на работе данных. Оказалось, вот мы

17:35взяли V Open Vay, самая нижняя строчка.

17:38А Open Vay появилась из Prзмаtic. Эта

17:41строчка чуть выше. А как мы VM тестим?

17:45Мы просто входную картинку, на вход

17:47картинку спрашиваем, видишь ли ты,

17:50допустим, значок солнца. если видишь,

17:52что на какой плашке находится левой

17:54посередине либо правой. Вот. По сути,

17:57нам это позволяет сравнивать VLM модели,

18:00знания в них и VL модели. Вот оказалось,

18:04что трансфера знаний не происходит.

18:07Более того, мм,

18:10а в различных доменах оно ухудшается.

18:13Трансфер знаний мы обнаружили только в

18:16Color домене. Если посмотреть столбик у

18:19Prзмаtic 69, уvй 69, вот, мм, в

18:24остальных доменах

18:26скорее сильно просаживаются. Это значит,

18:27это говорит нам о том, что когда мы

18:29добучаем велая модель на

18:33action dataset, то есть генерировать

18:35действия, а модели начинают забывать

18:38исходные знания, которые в них были. И

18:41возникает вопрос тогда, а в чём тогда у

18:44нас тинилизация будет? За счёт чего?

18:46Если мы забываем при файтюне на экшн-

18:49датасетах, потому что нам важно помнить

18:52и мы очень бы хотели как раз-таки идея

18:54генизации в ве моделях за счёт VLM

18:57притрейна хорошего. Вот помимо этого мы

19:01провели ещё анализ, а как раз-таки мы

19:04использовали Open Vay, а провели анализ

19:07того, что происходит с внутренними

19:09представлениями модели при Файоне до

19:12обучения на экшена. А то, что мы

19:15выявили, во-первых, следующий момент,

19:18если посмотреть наtion карты, то есть мы

19:21подаём картинку в Vay, Open Vay, а, и

19:24спрашиваем: "Видишь ли ты гамбургер?"

19:27Ну, у нас сцена там, где несколько

19:28объектов, виден робота. М спрашиваем:

19:32"Видишь ли ты этот объект? Видишь ли тот

19:33объект?" Вот. Оказалось, что если

19:37посмотреть наtion карты, вот средняя

19:39строчка - это Open Vay, а то эти карты,

19:45а они очень сильно замылены и, например,

19:50ну, они не активируются, но на

19:52таргет-объектах, про которые мы

19:53спрашиваем.

19:55Вот. Мм, это большая проблема. Мм, тут

19:59немножко затравка на будущее. Если

20:01посмотреть нижнюю строчку, это уже

20:03модель обученная с наш с нашим методом

20:06выравнивания. У неё с attention картами

20:08всё сильно получше. То есть они прямо

20:11чётко фокусируются на тех объектах,

20:13которые про которые мы спрашиваем. И

20:16сверху привезён пример для референса. Мы

20:19взяли квен, и у него, в принципе, тоже

20:21нет таких проблем. Вот. А здесь

20:24проведены средние слои. Естественно,

20:27почему мы взяли именно их? Потому что

20:28они обычно как раз отвечают за связь,

20:30текста и картинки. А вот если смотреть

20:34другие, то там менее менее осмысленные

20:36какие-то attтенtion карты получаются.

20:38Вот.

20:39Мм вторая проблема, значит, эта проблема

20:43называется attention sy, когда у нас

20:45attтенtion утекает вообще куда-то на фон

20:47расплывается по всей картинке, но не на

20:49нужном объекте, когда мы спрашиваем про

20:51объект.

20:53Ещё одну проблему, которую мы заметили,

20:55называется Representation Collapse.

20:58Это следующая история. Если взять

21:02какой-то,

21:04допустим, классификационный сет, мы

21:07взяли довольно сложный коко, а вот мы

21:10взяли просто для иллюстрации три класса

21:13оттуда. Это кружка, бутылка и ножик.

21:16Вот. А и просто делали, наё

21:20визуализацию.

21:22этих картинок. Мы подаём на вход

21:25картинку

21:26в вело модель вело модель. Вот. И

21:30достаём оттуда скрытые представления

21:33текста, которые уже посмотрели и на

21:35картинку тоже с какого-то слоя. Здесь мы

21:37брали вот разные слои, первый, десятый и

21:38двадцатый. Вот оказывается, что если,

21:42ну, визуализировать латентное

21:43пространство, построено таким образом,

21:46то у Квина

21:48и у Prзмаticк VLM

21:51а кластеры получаются, ну, довольно

21:52разделимые. Вот у VL модели, Open VLA

21:56эти кластеры очень сильно между собой

21:59перемежаются.

22:01Вот это говорит о том, что у нас в

22:03какой-то момент тоже прифатюни на

22:05экшенах слова представления.

22:09происходит коллапс. Вот. Ну, здесь как

22:13бы заметка, что он для визуализации, не

22:16используется для доказа для доказания,

22:18потому что, ну, можно его потюнить

22:20как-то и как бы на у нас в статье это

22:23было чисто как визуализация проблемы.

22:26Вот, соответственно, есть, да, три

22:29проблемы, которые мы поднимаем нашей

22:30статье. Это коллапс представлений,

22:34attention

22:36и domain forgetting, то есть забывание.

22:40Вот. А, хорошо, проблему мы подняли. Как

22:44их можно решать?

22:47чтобы, значит, чтобы поговорить о их

22:49решении, мы немножко абстрагируемся и

22:54перейдём к

22:56довольно интересной идее, которая была

22:58поднята в positioning papпере на SLR

23:01двадца четвёртого года, которая

23:03называется Platonic Representation

23:05Hypothesis. Вот о чём эта статья. Мм,

23:08наши авторы, э,

23:12в далёком, как они говорят, там, в

23:14шестнадцатом, в семнадцатом году ещё

23:16делали эксперименты с обучением просто,

23:19а, по-моему, у них были свёрточные сетки

23:21или трансформеры, может быть. Вот они

23:24обучали модель на классификацию а

23:28картинок.

23:29Вот. Также они ещё обучали модель на

23:33м колоризацию картинок. Вот они заметили

23:36такую примечательную особенность, что на

23:40самом деле независи, ну, модели-то

23:42учились на разные задачи и на разных

23:44тасетах, но они заметили в них, а,

23:47значит, нейроны, которые активируются на

23:49схожие паттерны, например, там нейрон,

23:52который активируется на лица собачек или

23:55на птичек. Вот. А эта идея привела их к

24:00более масштабной такому масштабному

24:03утверждению.

24:05которая называется как раз-таки Platonic

24:07Representation Gypes

24:09о том, что а

24:12значит

24:14модели независимо от training objective

24:18их независимо от данных от модальности

24:22они сходятся

24:24м чем больше моделей, чем больше на

24:27большем количестве данных они были

24:28обучены, они будут сходиться к общему

24:31представлению статистическому мира.

24:34Вот. А это довольно сильное утверждение.

24:37Вот в их статье они проводят, ну,

24:40достаточно экспериментов, которые

24:43подтверждают их гипотезу. Вот. Мм, что

24:47они делают? Ну, во-первых, они

24:49используют меру схожести между разными

24:52моделями. Ну, я вернусь на этот слайд

24:54попозже,

24:56да. Вот они задаются вопросом: есть ли

24:59схожесть алаймонт между, например, а

25:02визуальными моделями и между разными

25:05визуальными моделями? По мере того, как

25:08мы увеличиваем качество моделей, типа

25:12больше на большихтах, да, обученные

25:14модели.

25:16А первая гипотеза, на самом деле, много

25:19разных способов есть

25:21получать хорошие скоры или обучить

25:25модель. И они могут быть модели обучены

25:29совершенно разными методами, разными

25:31лосфункциями, разной архитектуры иметь.

25:34Вот второе утверждение, которое не

25:35вдгают, что если что, в общем, а все

25:38сильные модели, они будут

25:41их представления внутренние будут схожи.

25:45Вот. А чтобы подтвердить свой свои тж,

25:50они что делают? Они использовали в своей

25:54статье там 78 различных vision моделей с

25:57разными архитектурами, разными

25:59функциями, на которых их обучали,

26:01разными даты, разными данными. Вот. И

26:05взяли такой, а, бенчмарк VUAP. Вот

26:09график, который они получили, он

26:11довольно интересный. А поси по оси X у

26:15нас, можно сказать, качество, то есть

26:19там процент решённых задач на Vтап м по

26:23Y, а схожесть моделей, то есть они

26:27разбили, грубо говоря, взяли 78 моделей,

26:31а заинтересили их на Vтап, получили

26:34скары и разбили там эти скары там на

26:37бакеты. То есть там модели, которые

26:40решают с 80% до 100, а, и так далее.

26:45Вот. И в этих пакетах они посчитали

26:48алайнмент, то есть меру схожести а этих

26:52моделей. Вот.

26:54>> А можно ещё раз А мера схожести моделей?

26:57Ну, она примерно это вообще я вот что-то

26:59не особо

27:00>> Угу. Да. Вот меры схожести моделей.

27:03Теперь вернёмся к этому слайду.

27:06А они предлагают делать следующее:

27:09мчитать.

27:11Мм,

27:13значит, у нас есть какая-то функция,

27:15наша модель, которая из набора данных,

27:18а, даёт нам а вектор какое-то

27:20представление внутреннее. Вот. А мы

27:24авторы предлагают схоже считать, а, в

27:26терминах, а, крnлов.

27:29Вот. А, то есть - это

27:32внутреннее произведение этих векторочков

27:35из разных моделей. Вот. А,

27:39м, да. То есть в статьи они вводят, они,

27:43по-моему, там предлагают

27:45меру схожести ещё одну. И, в принципе,

27:49показывают, что и прошлые меры схожести

27:51они вполне подходят. Вот. Но мы будем

27:54считать схожесть между моделями

27:56посредством

27:58а схожести

28:00сейчас, как это сказать?

28:03А,

28:06да, они считают ядровые, если по-русски

28:08это говорить, а, ядровые метрики. Вот к

28:14этому можно будет, я думаю, вернуться

28:16чуть попозже, если это непонятно.

28:20Вот. М.

28:23О'кей.

28:25Теперь давайте посмотрим дальше.

28:32Мне кажется, всё-таки я не очень понятно

28:33объяснил, но я ещё раз могу повторить.

28:36Давайте пока продолжим.

28:39Мм, да, ещё один график, который они

28:41получают. Э, следующий следующий график.

28:44А они просто сделали AP, визуализацию,

28:48а, для внутренних представлений моделек.

28:51Вот это п. Он тоже показывает, что, а,

28:56значит, цвет у нас соответствует

28:58количеству там решённых задач на этом

29:01чмарке. Вот. А более красные модели,

29:05модели, которые хуже перформят, а более

29:08синие модели, модели с лучшим качеством.

29:11Вот. И здесь легенду, если посмотреть,

29:13здесь значит разные лос они используют и

29:17разные обжективы. Вот. И видно, что

29:21независимо от лоссов и объжективов,

29:23хорошие модели, они кучкуются в одном

29:25месте. То есть вот синие синие модельки,

29:28мм, плохие модели, они довольно сильно

29:31там довольно

29:34такое вот большое облако получается, и

29:37они тоже где-то там находятся вдалеке.

29:41Вот это как раз в чём-то, ну, является

29:45подтверждением их гипотезы. Вот. Дальше

29:48они как раз-таки смотрели разные

29:51метрики, а схожести у моделей. Мм, по X

29:57у нас Performance, на англичас. Надо

29:59посмотреть, что я уже не помню на самом

30:01деле, что за бенч они взяли. Ну, о'кей,

30:05допустим, этот бенч отражает качество

30:08моделей. Вот по оси Y у нас как раз-таки

30:12мера схожести. Они взяли V2, это Vision

30:16модель. Вот. и изобразили аа языковые

30:21модели. Если посмотреть, то чем лучше у

30:25нас качество на этом графике у языковых

30:29моделей, тем больше у них растёт мир,

30:32тем больше у них схожесть снова 2 их

30:35внутренних представлений.

30:38Вот. И этот график он, значит, эту

30:43статью тоже уже проверяли. И недавно

30:48вышла тоже статья от моей моменты, не

30:50знаю, кто там. А вот они они потестили

30:53уже более свежие модели, потому что на

30:55прошлом графике у них там были Blom, а

30:58Лама первая, ну, как бы сейчас уже более

31:01современные модели появились. Вот они,

31:04э, значит, немножко уточнили этот тренд,

31:06что, да, схожесть растёт.

31:09А, но тут важное замечание, что мы нам

31:11недостаточно просто размер модели

31:13увеличивать. Нам нужно использовать

31:14достаточно разнообразные данные. Но в

31:16целом, да, эта тенденция, она

31:19сохраняется, что чем выше, тем чем лучше

31:22у нас модели становятся, тем больше

31:25схожесть их внутренних представлений.

31:27Вот. А, о'кей. Мм, теперь краткий

31:33экскурс. Я постараюсь бы быстро дать мм

31:37такую интуицию, которую они тоже у себя

31:39в статье дают. Это можно будет почитать.

31:42Я привёл ссылки внизу.

31:44А почему почему это так? Типа почему у

31:47нас

31:47схожесть внутренних представлений будет

31:49расти по мере того, у нас

31:52как модели будут становиться лучше? Вот.

31:55А первая идея, а называется мультиask

31:59Scalingпотеза.

32:00Мм, у нас есть какое-то пространство

32:02решений. для разных задач. Ну, слева

32:05график здесь типа один оваут

32:08пространство решений задачи один, второй

32:11овал пространство решений задачид. И тут

32:13наглядная картинка. Чем больше модель

32:16учится решать разных задач, тем меньше

32:19пространство решений, а, тем меньшее

32:22пространство решений оно должно

32:23зафититься.

32:25Вот.

32:26Соответственно, больше модель, а более

32:30ралист модель, она будет сходиться, они

32:32будут все сходиться, будут все лежать

32:34уже в меньшем пространстве решении. Вот.

32:38А, ну тут есть

32:42картинки

32:43красивые, показывающие это и в других

32:45статьях тоже. Вот вторая история - это

32:50capacity гипотеes чем больше сale

32:52моделей, тем больше вероятность

32:58там тем больше вероятность того, что а

33:01сейчас,

33:04да, чем больше размер моделей, тем

33:07больше вероятность того, что, а,

33:10пространство решений, которое она

33:11выучит, она будет

33:14пересекаться с пространством решений

33:15других задач.

33:17А маленькие модели, они

33:20выучивают довольно простые, а, выучивают

33:24довольно простые функции для решения

33:26определённых задач. Чем больше размер

33:29моделей, тем больше вероятность того,

33:32что она выучит решать не только задачу,

33:34которая она, которая была в тренда

33:36datтасе.

33:41Вот.

33:44Третья история про Simplicity B. А

33:48значит,

33:50история о том, что опять же у нас есть

33:52пространство функций для решения

33:54какой-то задачи. А до этого тоже был был

33:58были выходили статьи

34:01как раз про следующую историю. Мм, а чем

34:06больше у нас модель и вообще как бы

34:10короче заметили закономерность, большие

34:12модели, а у них есть тенденция

34:16для решения задачи, а выучивать простые

34:19функции, а это называется simplicity B.

34:24Вот. М и если мы выучим простые функции,

34:28а значит у нас довольно маленькое

34:31какое-то пространство решения есть.

34:34А, и мы сходимся в какую-то меньшую

34:36окрестность. Ну, как здесь на картинке,

34:39в принципе, у нас много функций, которые

34:40могут решить задачу, но простых функций,

34:43которые решают эту задачу, их меньше.

34:45Вот. А, ну, авторы дают вот такие

34:50интуитивные, а, обоснования. Вот.

34:54Значит, что дальше? Ну, о'кей. А, да,

34:58статью можно почитать ещё. А у них это

35:01более подробно рассказано.

35:03А, о'кей. Значит, есть вот такая идея.

35:06Platonic representation GPS.

35:10Эта статья, как я уже сказал, это была

35:12position paper, то есть просто статья

35:15про то, а что авторы заметили мм во всём

35:21развитии, допустим,

35:23VLM, а там LM реча. Вот эта статья

35:27породила, на самом деле, а

35:32довольно большое количество, а, новых

35:34статей, которые как раз-таки

35:37использовали эту гипотезу, а, только уже

35:40в более практическом, а, смысле. О'кей.

35:44У нас есть,

35:46а, идея о том, что хорошие, большие

35:50модели, они будут иметь схожие

35:52представления. Значит, так. Я надеюсь,

35:55тут видно весь слайд.

35:57А одна из таких хороших ключевых статей,

36:01а репаentation

36:04align for generation. А авторы

36:07предлагают делать следующее. А давайте,

36:10ну хорошо, мы учим. Авторы, значит,

36:12обучают diffusion трансформеры.

36:15А, о'кей. А они задаются вопросом: "А

36:18как можно ускорить обучение этих

36:20моделей?" Вот. И на основании прошлой

36:23идеи они предлагают следующее. Но у нас

36:27Fusion Transformer учится расшумлять

36:30сквозь несколько блоков а картинку.

36:34М, хорошо, давайте мы будем, а, вот эти

36:37вот шумбные представления в каких на

36:39каком-то слое, а, проецировать при

36:41помощи МЛП, а, и выравнивать с уже

36:47хорошими фичами от Vision Encodдеров.

36:50Они брали 2, насколько я помню. Вот они

36:54проецировали вот эти вот зашумлённые

36:57фичи, частично уже расшумлённые. Я не

36:59помню, с какого блока они брали,

37:01возможно, там двадцатый, пятнадцатый,

37:03что-то такое. А diffusion трансформера и

37:07добавляли такой

37:09AUX LOS, дополнительный помимо основного

37:12обжектива. Вот. И оказалось по их

37:15результатам, что это помогло им в разы

37:17просто ускорить

37:21хождение моделей. То есть правый график,

37:23ну, тут прямо 17.5xф.

37:27Вот. Но приросты они получили хорошие.

37:30Эта статья уже так довольно неплохо

37:33отсела от сообщество

37:35и породило с собой ещё много разных

37:39работ. Значит, следующая идея. Мы можем

37:42м теперь брать,

37:46значит, мультимодальные лмки и а

37:52добавлять в них

37:55на 3D foundation модели. А для чего? Для

38:00того, чтобы, например, а добавить им

38:02visual groundдинг, чтобы решать

38:05различные spatial tas таasки, таски на

38:07понимание 3D сцен. Вот аналогичная идея.

38:11А я не смотрел, с какого слоя они там

38:14вытаскивают, что, потому что эту статью

38:16уже нашёл, когда мы делали свою работу,

38:19и она довольно свежая. Аналогичная

38:21работа есть с Video diffusion models, а

38:25тоже алайнит на ВГТ. Здесь Visual

38:28Geometry Ground Transformer, то есть

38:30какого-то слоя diffusion трансформера

38:32достают представления и выравнивают их

38:36на представление из бэкбона. хорошего

38:39ВГДТ. Вот. А, о'кей. Соответственно, то,

38:43что делаем мы, то, что предлагаем мы в

38:47своей работе, оно в чём-то схоже,

38:51а, с тем, что

38:53показали, например, в Репа. Вот. И оно

38:56основано также на Platonic

38:58Representation Gypothesy. Аэ, значит,

39:03так. Ну, давайте посмотрим на эти

39:04слайды. Мы предлагаем делать следующее.

39:08Ну, мы предлагаем делать vision

39:11representation alignment. Что это такое?

39:14У нас есть Vay модель. А на вход она

39:17получает картинку текст. Generate

39:19action. Мм,

39:22хорошо. А до этого я отметил три важные

39:27проблемы, которые возникают при обучении

39:28V моделей. А, про забывание, про мм

39:33attention Syn, про коллапс

39:35представлений. А эти все проблемы, они

39:38про то, что а учить V модели только на

39:41экшн модальности, то есть учить VLM

39:44модели только на экшн модальности плохо.

39:48Мы теряем все прошлые праеры, которые

39:51помогали нам, а, решать сложные задачи,

39:54генеризоваться на новые сцены, на новые

39:56объекты и понимать, что происходит.

39:59О'кей. А как мы можем это пофиксить? А

40:02здесь есть несколько вариантов. Мы можем

40:04делать котрейнинг, можем из велой модели

40:07предсказывать не только экшены, но и

40:09текст, например, и параллельно учить её,

40:12а, делать какое-то описание сцены. А

40:15такие подходы есть, мм, такие подходы

40:20работают, но они довольно затратные. Мы

40:24в данной нашей работе мы фокусируемся на

40:27истории, когда у нас уже есть V модель

40:30какая-то, и нам нужно вот адаптировать

40:32её под конкретный домен, под конкретного

40:34робота, потому что у велой модели с этим

40:37проблемы. В смысле, мы не можем взять мм

40:40модель, которую мы предприняли на

40:42большом количестве разных работе данных,

40:45и просто запустить evaluation на новом

40:48роботе. Нам нужно собрать сколько-то

40:50траекторий и получить ещё раз доучить

40:53эту модель на новый баддимент, например.

40:56А вот обычно собирают не так много

41:00траекторий. А и здесь возникает

41:04проблема. У нас очень мало траекторий.

41:06Мы предсказываем экшены. Это траектория

41:08просто на на предсказание а действий.

41:12Вот. И оказывается, что такое маленькое

41:14количество траекторий и типа такой

41:18на новый домен, он сильно ломает, а

41:21представления, заложенные, хорошие

41:23представления, которые были раньше. Все

41:25те картинки и проблемы, которые я

41:26показывал, мы смотрели именно на ITE

41:30чекпоинтах.

41:31А вот, соответственно, мы предлагаем

41:33следующее. Давайте мы

41:37будем наша белая модель, помимо того,

41:39что мы пропускаем loss через экшены,

41:41просто на тон, насколько хорошо она

41:43может генерировать действия, давайте мы

41:45будем выравнивать её представление,

41:48чтобы модель м обучаясь генерировать,

41:52адаптироваться к новому роботу, новому

41:55новой сцене, а не забывала, а и не

41:58теряла свои хорошие представления,

42:00которые были заложены в ней раньше в LM

42:02модели. Вот для этого мы как раз-таки

42:05следуя гипотезеation

42:09гипотеза сделаем следующее. Мы берём, а,

42:13достаём внутренние представления Vay. Мы

42:15используем Vision

42:17внутренние представления картиночные. Мы

42:20достаём из мы достаём их из средних

42:22слоёв

42:24а модели. Вот. И берём хороший Vision,

42:30хорошую Vision foundation, Vision

42:32Teacher. А что происходит? Мы подаём

42:36модели картинку текст, а достаём из неё

42:40скрытые представления, подаём эту же

42:43картинку Vision учителя, получаем набор

42:48бедин от Vision учителя, набор

42:51эмбедингов от VA. Нам нужно эти

42:53эмбединги спроецировать на общую

42:56размерность. Мы проецируем с размерности

42:59велой на размерность учителя. При этом

43:02мы делаем рандомную проекцию. Это тоже

43:05довольно забавная история. А вот после

43:08чего мы считаем лос а схожести между

43:14фичами учителя и внутренними фичами

43:16белой модели. Вот. И форсим этот лос

43:22быть меньше. В данном случае у нас

43:24косинусная схожесть. А стате мы делали

43:28делали довольно много блейшенов,

43:30и они показали, что косинус лучше всего

43:33работает. Вот. М, в общем, такая идея

43:36помогла нам довольно неплохо пустануть

43:40генизацию велой модели на различных AUD

43:44сценариях. А про AUD сценарии. Так,

43:49сейчас,

43:51ну, допустим, допустим, я ещё раз

43:55повторю, да, что я сказал. А весь

43:58пайплайн, он довольно дешёвый. Э,

44:02и вся идея, ну, сама идея, она довольно

44:05простая. А в реализации у нас есть V

44:09модель, она сильно переобучается

44:12и теряет свои навыки исходные пониманию

44:16среды и текста, и картинок.

44:19Всё, что нужно сделать для того, чтобы

44:22сохранить эти навыки в какой-то мере,

44:25это просто на картинке, да, слева, а,

44:30взять ваш датасет, прогнать, достать

44:33картинки, прогнать через vision учителя,

44:35получить её фичики

44:38в trend dataset val. Всё, у нас

44:40появилось новое поле. Помимо картинок

44:42текст, картинки текстэкшены, у нас есть

44:44ещё vision фичи. А, о'кей. Дальше на

44:49этапе файтюна мы пропускаемс не только

44:51через экшены, но и достаём из VLA

44:54внутренние представление

44:56картиночные её с средних слоёв и алайним

45:01эти представления на фичи, которые

45:03которые мы которым мы уже разметили

45:06datтасет. А и считаем регулизационный

45:09лос. Вот справа картинка C, она, в

45:13принципе, тоже показывает идею того, что

45:16мы делаем. Здесь loss landscape

45:19изображён для решения vision language

45:22задач. А такое белое пятно это

45:26пространство решений для задач

45:29работотехнических экшн задач. Вот. А

45:33изначальная VLM модель, она хорошо

45:35затюнена. Для того, чтобы решать visual

45:38language tasки, мы где-то в минимуме

45:39сидим. А фиолетовая точка начальная. Вот

45:43как только мы начинаем тюнить на экшн

45:44данных, мы мы как-то отходим от этой

45:49исходной точки. Мы можем идти разными

45:51путями. Мы можем м мы можем прийти в вот

45:55это белое пространство решений action

45:57tasк м таким образом, что мы слишком

46:00далеко уйдём от решения пространств, от

46:03пространства решения vision language

46:04задач, и тогда у нас модель развалится в

46:07понимании текста и картинок. Мы же

46:09пытаемся дополнительным лоссом заставить

46:12модель как бы адаптироваться к новой

46:14модальности, к эк, решать экшн задачи,

46:18при этом сохраняя свои прежние свойства,

46:20то есть не уходя далеко от

46:24от области решения visual language

46:26задач. Как бы пытаемся найти такое

46:29пространство для решения и тех, и тех

46:31задач, пересечения, попасть туда. Вот

46:34как бы основная идея в этом. А в чём-то

46:37я хотел сказать?

46:41А, ну бенчмарки, да, мы, во-первых,

46:45чмаркаем нашу модель, но, ну, я не знаю,

46:47может, кому-то кто-то увидел превьюшки

46:49или сейчас просто увидел картинки и и

46:52могло показаться, что, ну, там типа

46:54скары в 0,75 или 0 061, это как бы не

46:59слишком большие скоры, а, чтобы про эту

47:01статью писать, а, или прироста 10%. Вот.

47:05А, на самом деле мы, а, во-первых,

47:08сетап, э, мы используем специально

47:10довольно реалистичный,

47:12а, мы берём симулятор. Во-первых,

47:16simpler, он довольно известен в там

47:18кругах работе CVLA. Он

47:23есть статья, которая говорит о том, что

47:25перформанance насж на одно и той же

47:28задачи в реальном мире. Там и в их

47:30симуляторе авторы показывают, что она

47:32коррелирует. То есть мы можем сделать из

47:35realм и зайвалить модель не на реальном

47:38роботе, а в симуляторе и показать

47:41successрей в симуляторе. Это будет

47:43правтивый successрей. Он будет сходиться

47:45с тем, что будет в реальном мире на

47:46реальном роботе. Мы взяли этот симулятор

47:50и взяли довольно сложный сетап. А здесь

47:53в таблице как раз мы меряем генизацию.

47:56То есть мы получили модель на 1.400

48:00траекториях. А эти траектории включали в

48:04себя вариации 16 различных объектов мы

48:07использовали и различных а бэкграундов.

48:11Вот. То есть там где-то пять траекторий

48:14на фиксированную

48:17фиксированный объект и бэкграунд. Это, в

48:19принципе, нурмальный сет. И он схож с

48:22тем, что обычно делают, когда хотят

48:24адаптировать белые модель к реальному

48:27роботу для применения. Вот. А, и мы

48:30померили дальше утилизацию по трём осям.

48:34Semantic, vision, execution. А каждый из

48:36этих осей включает различные таски. А

48:40исходная задача у нас была placeй, а,

48:42схватить объект, положить его в тарелку.

48:46А, и здесь мы делаем различные

48:48перетурбации на evaluation, вносим в эту

48:51задачу.

48:53Например, в секрет мы варьируем объекты,

48:56добавляем, а, target объект, меняем на

48:58тот объект. которую модель вообще не

49:00видела никогда на обучении. Вместо

49:03морковки мы берём стеклянный бокал,

49:05который не был у неё в fon датасете. А

49:09мы варьируем инструкцию, добавляем вот

49:12следующий, третий столбец multтиcaret -

49:15это мм мы добавляем distrctive объекты

49:18на фон, а distractive target объекты. То

49:22есть нам нужно положить тарелку, мы

49:23добавляем две разных цветов или разных

49:25видов или шахматную доску. А, и смотрим,

49:30как модель себя в этих условиях ведёт. А

49:34то, что результаты показывают, ну,

49:36во-первых, дефолтный чекпоинт, он на

49:38этом сильно ломается. Вот. А наш метод

49:42помогает повысить скоры, а, вот во всех

49:45трёх осяхлизации.

49:47Ну, в первую очередь это семантика

49:49вижению. А вот повышение качества здесь

49:56не 100%.

49:58А потому что, во-первых, задачи сложные,

50:00во-вторых, мы не заскелили это ещё всё

50:02нормально, например, до большого

50:04количества траекторий. Или мы можем

50:05делать al не на файтнее, а на этапе,

50:09когда мы получили VLM модель и учим её

50:13на большом количестве работе данным.

50:15Вот. Но тем не менее эти приросты, они

50:18довольно хорошие. А, и то, что в таблице

50:22пока что нету и в статье тоже, но

50:26буквально сегодня

50:28как раз-таки эти эксперименты мы провели

50:30мм с реальным роботом и с пиделью,

50:36которая на данный момент э перформит

50:39лучше всех и в области она считается

50:43хорошей и признанной. А эксперименты с

50:46P05 на реальном роботе а показали, что

50:50наш метод 40% успешности, а помогает до

50:5590 95 повысить скоры. Вот. А в ситуациях

51:01аналогичных тому, что мы банчмаркаем

51:03здесь, это какие-то протурбации,

51:06например, со светом. Если взять и

51:08засветить сцену синим светом, красным,

51:11зелёным или начать какую-то дискотеку

51:15устраивать рядом с роботом. Вот. А тут

51:20демки в симуляторе.

51:22Вот можно увидеть evaluation setup и

51:24сравнение того, как работает наша модель

51:27и модели просто с обычным файтюном.

51:31Вот.

51:37И как раз здесь показаны различные

51:39протурбации. Вот. Я надеюсь, люди не

51:41ушли во время моего рассказа. А в

51:45принципе тут, ну да, последние слайды. А

51:48следующие результаты мы получили для нир

51:52проби. Мм, не только lineнир, но и

51:56attention maping. Я я показывал

51:58attention маap ещё раньше, что они

52:00улучшились.

52:02Также мы потестили сами внутренние

52:05представления. Мы сделали linear проби,

52:07то есть насколько хорошо линейный слой

52:11только опираясь на вот hidden

52:12представления визуальные с модели может

52:15научиться классифицировать imagnet. Это

52:18довольно распространённая практика. Тоже

52:20её делают в Dinov 2. Dinov 3 reportedт

52:24сры. А 3, кстати, не знаю, нова 2

52:27репортат скоры. А нербинга. Вот

52:30результаты тоже показывают следующее. А

52:34лучше всего

52:36EQU у радио V3. Это как раз модель на

52:40Vision модель, на которой мы

52:41выравнивались. А дальше по качеству идёт

52:44а модель Openvay, как раз-таки

52:47выровненная нашим методом. Дальше идёт

52:50прийp

52:52и ещё хуже справляется

52:54просто дообучный дооченная Open Vay на

52:58вот этих 400 траекториях без какого-либо

53:01алаймонта регулизации.

53:03Вот. А, ну, значит,

53:08дальше мы помечмаркали наш чекпоинт

53:12залайненный на синке насинке. Вот

53:16результаты показали следующее. А в color

53:19public shape просто есть. Причём в color

53:23он типа

53:25а скоore выше, чем типа баound исходной

53:29велэмки призмак.

53:32Мм в остальных доменах пока что

53:35улучшений нету. И как раз-таки это

53:37направление для дальнейшей работы. А

53:41здесь уже нужно говорить не про

53:42алайнмент, а про сохранение знаний. То

53:47есть можно говорить про сохранение

53:49пониманий сцены, а можно говорить про

53:52сохранение знаний. Это немножко разные

53:55штуки, я считаю. Вот. И как раз-таки вот

53:58эту штуку, я думаю, можно решать тем,

53:59что алайнить модель на моменте того, как

54:03мы из VLM делаем VLA, а не на моменте,

54:05когда мы тюним на малом количестве

54:07траекторий модель. Вот. Ну, мой рассказ

54:10подошёл к концу. А значит, что можно тут

54:14рассказать? Ну да, статью можете

54:16почитать.

54:18Я дал ссылку. А мы её релизнули довольно

54:22недавно. Вот она уже, в принципе,

54:26довольно неплохо так привлекла внимание

54:30людей. Аа в твиттере нам написали авторы

54:36Open VLA.

54:38А чувак, который делает один из главных

54:42авторов Platonic Representation Gпотеes

54:46и много таких тоже классных людей из

54:49Стипмайда, а

54:52оценили нашу работу. Вот в общем

54:57какие-то такие результаты мы планируем

54:59это всё доразвивать текущие там 2

55:02месяца. Ну вот эксперименты с роботом,

55:05то, что мы добавляем, и там есть ещё

55:09идеи, которые можно попробовать. И как

55:12раз это то, что мы планируем делать. Вот

55:14здесь QR-коды, GitHub, Gameface, а ещё

55:18слева снизу страничка статьи. Вот можете

55:23отсканить, зайти и посмотреть.

55:26А здесь мои контакты, слева моя

55:29страничка, справа мой Telegram.

55:33Вот. А значит, можете, если у вас

55:37появились вопросы и вдруг сегодня мы не

55:38успеем на них ответить, а можете зайти в

55:42телегу, написать мне, можем пообщаться.

55:45Вот. Также я думаю, что а к зиме,

55:50зимний пул проектов мы

55:52выдвинем, предложим предложим какие-то

55:54свои проекты. Они будут связаны с

55:56филайками. Вот. Потому что у нас есть

55:57много направлений как раз, которые мы

55:59тоже многопос, которые мы планируем

56:01тестировать.

56:02Вот тоже по этому поводу можно написать

56:06мне в личку. Вот. Да. Ну, помимо этого

56:11есть стажировки МФТ, которые там с нами

56:13сотрудничает. А, в принципе, у меня всё.

56:17Вот. А я теперь открыт к вопросам. Я

56:20надеюсь, всё это время меня было слышно.

56:23>> Да, спасибо большое.

56:25Так, а можно я пока вопрос задам? Пока

56:28вот я не вижу. А вот смотри. Ну,

56:30понятное дело, что вы хотите условно

56:32алайнить представления визуальные,

56:34которые типа вот, ну, для изображений и

56:38внутри велейки вашей. А,

56:42а были ли, ну, не знаю, статьи

56:43эксперименты, которые вот, ну, в целом

56:45просто на добавление,

56:47а, короче, допустим, вот как вот,

56:51допустим, чтобы сохранить вот улэмки

56:53типа текст текст only как качество,

56:56можно можно подавать текст onlyтек и

56:59типа сравнивать выходы. Ну, типа даже

57:01без картинки. А вот в работе, ну вот в

57:03LA, допустим, подавать типа условно

57:06просто текст и какой-нибудь на выходе

57:08экшены, которые можно как текст условно

57:12представлять и тем самым как будто бы,

57:15ну, как добавлять данные, не знаю, в

57:17притре, там, в SFT, чтобы моделька не

57:19разучилась там, условно вот для текста,

57:22типа General Knowledge какой-то, а для

57:23картинки типа вот картинку смотреть, а

57:26не только,

57:27>> ну, вот

57:29>> вообще делает или как?

57:31>> Да. Да. А сейчас много работ, связанных

57:34с тем, что делают VA. То есть, как я уже

57:38сказал, там в Open VA, например, у нас

57:41пространство экшенов,

57:43экшн-то токены, они лежат в общем

57:47словаре с текстом. Можем предсказывать

57:49не только экшн токены, но и текст. И там

57:52есть как раз статья тех же авторов,

57:54которые называется ecotд relay embos.

58:00в которой модель перед тем, как экшнски

58:02ерить, она делает какой-то ризинг. Она

58:04сначала предсказывает текстовые токены.

58:06Допустим, я вижу, что на столе находится

58:08кружка, рядом с ней слева находится

58:11тарелка, а зелёного цвета. Мне нужно

58:13поднять кружку, положить на тарелку. Вот

58:17такие работы есть, да, но текущая

58:19текущий текущее ограничение их в том,

58:21что мм на текст текст токены вместе с

58:25экшн-то токенами генерить очень долго.

58:28Вот. А-э,

58:31эту проблему можно решать. Можем типа

58:33делать, а, как там различные синкингing

58:37токены, когда модель будет сама решать,

58:39когда ей подумать, а не на каждом степе.

58:42Вот пи она как раз-таки и, короче, она

58:46как раз-таки и предсказывает текст, а,

58:49из мбона своего, помимо того, что она

58:52предсказывает экшены. Вот. А, и это

58:55помогает, да. Но

58:58а здесь возникает, короче, много

58:59проблем. Нам нужно будет собирать

59:01данные. То есть мы не можем взять теперь

59:03просто с робота. Мы должны ещё

59:04каким-нибудь чейносад это разметь. Ну, в

59:07принципе, ну, какой-то хорошей моделью

59:09это можно разметить. Вот. И как раз, ну,

59:11в этом направлении тоже идётся. А можно

59:13вот такую такой рулет, пожалуйста,

59:16>> ещё раз?

59:20>> А, слышу,

59:22>> да? Ну, о'кей. Ты можешь продолжать,

59:27походу. Ну, короче, я понял. То есть в

59:29целом в эту сторону тоже смотрит, но

59:32>> типа это тяжеловесно, чем условно ваш,

59:35который можно уже Ну, я понял.

59:38>> А, то есть, ну, вот представим, у нас

59:40есть мы как раз говорим про историю,

59:44когда у нас есть уже вот велая модель.

59:47Мы хотим, допустим, на складе, на

59:49складе, чтобы она там сортировала

59:51бутылки или какие-нибудь объекты, просто

59:53из коробок доставала, раскладывал по

59:55полкам. Мы хотим её дообучить просто до

59:59нового какого-то места, типа склад,

1:00:01чтобы она к нему привыкла, к новому

1:00:03роботу, который на складе ездит. Вот. А

1:00:05для этого обычно берут мало траекторий.

1:00:08Вот.

1:00:09И там, допустим, какая-нибудь компания

1:00:12покупает себе робота, берёт велая модель

1:00:15и хочет хочет использовать его на

1:00:18складе. Они берут просто телеоперации,

1:00:20там собирают датасет. Примеров

1:00:23несколько, как класть там бутылки,

1:00:25допустим, на полки, на разные полки,

1:00:27разные бутылки. Вот. Но как бы было бы

1:00:30странно, если бы этой компании, э,

1:00:33какому-нибудь бизнесу нужно было ещё

1:00:35думать о том, а вот

1:00:38о том, типа, на каких данных ещё

1:00:40котрейнинг делать. То есть котренинг, в

1:00:42принципе, можно делать, а, предсказывать

1:00:44текст и так далее. Вот. Но эту

1:00:47топ-разметку очень странно себе

1:00:50представить на малых датасетах. То есть,

1:00:53мм, и мы как раз на этом фокусируемся.

1:00:55Мы, я сказал, что можно делать на этапе

1:00:59с типа работей alignment. Ну вот cor

1:01:02пока что история у нас с файтюном

1:01:04именно, где мы видим приросты вот

1:01:07хорошие. И мы тестируем модель. Вот.

1:01:09>> Спасибо.

1:01:12>> Да, у Александра вопрос следующий.

1:01:15>> Да, спасибо большое за доклад. Мне очень

1:01:18интересно, сталкиваетесь ли вы с

1:01:21проблемой так называемого модариджинга,

1:01:23когда у нас действия как раз-таки из-за

1:01:25того, что в ибониках,

1:01:28э, слопываются все представления, у нас

1:01:29действия для какого-нибудь а задания

1:01:32становятся усреднёнными на если на

1:01:34каком-нибудь эпизоде. И там, допустим,

1:01:36если, ну, вот у вас там был на каком-то

1:01:38слайде, честно говоря, не помню номер, и

1:01:40вы разные дестёр, вот вот на этом сайте,

1:01:42да, вот на этом было, где четыре

1:01:45картинки, вы там разные шумы добавляли,

1:01:47там визуальные и так далее. А,

1:01:51>> да. И там, допустим, у вас робот брал,

1:01:53да, вот здесь, там, где no object,

1:01:55допустим, он берёт он какую-то, суть по

1:01:58всему, картошку кладёт её куда-то.

1:02:01Допустим, если картошки будут две, то,

1:02:03ну, опыт, допустим, моей работы с эчан

1:02:06трансформером и прочей архиртектурой

1:02:08показывает то, что он придёт в в среднюю

1:02:10точку между двумя картошками и будет

1:02:12пытаться её что-то сделать с ними. А

1:02:14решает ли ваш подход вот эту вот

1:02:18проблему? И если нет, то как вот её в

1:02:20принципе можно решить?

1:02:24А по поводу вот этой истории с тем, что

1:02:26у нас Ну, ну я я понял, про что вы

1:02:30говорите. А а ещё раз получается

1:02:36мы типа собираем датасет для imitation

1:02:38learningнга. Ну, на у нас смотрите куча,

1:02:41где у нас есть тестовые демонстрации

1:02:43того, как взаимодействовать с

1:02:44какими-нибудь объектами.

1:02:46>> Мм,

1:02:48>> а я, допустим, сейчас работаю не с VLA

1:02:51моделью, а с там Action Charking

1:02:54Transformer - это, ну, тоже есть в

1:02:56репозитории, там, где робот, это там,

1:02:57первых такая конецная модель, когда она

1:02:59просто там клонирует поведение.

1:03:02>> А, но на такой же продинг тебя

1:03:03получаются и другие V уже модели. То

1:03:06есть у нас есть какой-то

1:03:09датасет, где у нас есть эпизоды. В

1:03:11каждом эпизоде у нас есть какая-то

1:03:12картинка, где мы сможем какую-то фичмапу

1:03:14вытащить с картинки обработанную, а ино

1:03:17фичма изгенерировать там

1:03:18последовательность действий.

1:03:20>> А и у нас на фичмапе вот, допустим,

1:03:22может лежать фича картошки там и фича

1:03:26круга, куда нужно картошку положить. И

1:03:28мы там, если клали эту картошку в этот

1:03:30круг там 10 раз,

1:03:32>> а тот там запомнит, как подходить к фиче

1:03:35картошки, как класть её в фичуфи фичу

1:03:36круга. Но если картошки две, то, э,

1:03:40допустим,

1:03:41>> если размерность кодер маленькая, то а

1:03:45он придёт просто в середину между двумя

1:03:47картошками и ничего не сможет сделать.

1:03:48Это будет он окажется в состоянии,

1:03:50которое вот в статьях сейчас называется

1:03:53это Out of Distribution Inference.

1:03:55По-моему, они проводили как раз-таки в

1:03:56питй inference, а, два типа, там in

1:04:00distribution и out of distribution

1:04:01inference. Другой вопрос был связан,

1:04:03проводили ли вы out of distribution

1:04:05inference и in distribution inference и

1:04:06смотрели, как вот ваша

1:04:08>> подход это всё меняет. Короче говоря,

1:04:10всё выка

1:04:12работает ли ваш подход с к с решением

1:04:16вот этого вот усреднения мода AGAG. А,

1:04:19да, да, понял. Ну, как раз-таки вот это

1:04:21все результаты, которые я показываю, в

1:04:23принципе, это всё out of distribution

1:04:25inference. Ну, то есть, а, и на трейне у

1:04:29модели была только задача с морковкой и

1:04:34ещё там какими-то четырнадцати разными

1:04:37объектами, но вот те объекты, которые

1:04:39здесь представлены, например, их не

1:04:41было. И там всегда был один объект для

1:04:43сватывания, один таргет объект, всегда

1:04:45была одна тарелка. Вот здесь как

1:04:48раз-таки примеры, где там помимо

1:04:49картошки есть ложка или ещё какой-то

1:04:52другой объект.

1:04:54Вот это первый момент. То есть это все

1:04:56результаты, то, что мы репортим вот

1:04:58здесь снизу, это перформанс на OD.

1:05:02Вот мы показываем там тут бы на паузу

1:05:07поставить гифку, но вот эта вот сеточка

1:05:09это,

1:05:11>> ну, типа это со стандартным уклонением,

1:05:12да,

1:05:13>> дроп, типа мы в interbution померили

1:05:16качество, оно подросло м относительно

1:05:19там базового метода. И мы потом смотрим

1:05:21ещё дроп в сравнении с тем же базовым

1:05:24методом, насколько он большой, типа в

1:05:26out of distribution. Мне кажется, что

1:05:28дроп в out of distribution сетинге у нас

1:05:30поменьше. Вот типа модель обобщается

1:05:34лучше на новые сетапы. Ну вот касаемо

1:05:37там action chanking transформе, да? Ну

1:05:41вот там пи, ну, я не помню, какая из

1:05:44версий0 или может Openvt, а её можно

1:05:48рассматривать как action chanking

1:05:50transformer, а только с хорошим

1:05:53притрейном. То, что я знаю, ну, то, что

1:05:55мы там тестировали акт, это же, ну,

1:05:57довольно мале маленький трансформеры. И

1:06:00здесь возникают проблемы с генизацией

1:06:03просто потому, что, ну, у нас как бы нет

1:06:06притрейна, и очень сложно, а, без

1:06:11большой модели предобученной, а,

1:06:15обобщаться хорошо на новый сетапы

1:06:17полностью. Вот.

1:06:20Ну, то есть у нас, например, там в наших

1:06:22экспериментах

1:06:24мы изначально там смотрим всё, там у нас

1:06:27были эксперименты как раз для велой.

1:06:29с до обучением при помощи реля. Мы

1:06:32сначала просто взяли этрафантрансформе,

1:06:36вот потом подцепили ему на вход VLM

1:06:41hidden с него и просто подаём их. Вот.

1:06:44Ну, кстати, я не знаю, вот вы, если не

1:06:46пробовали или пробовали, можете

1:06:48попробовать или я не знаю, как бы какие

1:06:50ограничения задачи использовать

1:06:51маленькую на

1:06:54подать с другого какой-то модельки.

1:06:59Може можно взять, а, можно взять лмку,

1:07:02например, там и оттуда

1:07:05или последние фичинт

1:07:09transформе вместо там бейзингов из

1:07:12Нкодера подавать эти бейдинги с вимки.

1:07:15Вот то, что мы делали. И такая вилейка

1:07:18получается, которая уже лучше работает.

1:07:21А она лучше работает, допустим, там

1:07:23через чем Open VLA или ну какой-то

1:07:25аналог просто, по-моему, получается

1:07:27аналог просто Open VLA какой-то и

1:07:29>> Да, да, это

1:07:31Да.

1:07:33>> А лучше хуже это зависит от того, там,

1:07:35ну, сколько у вас данных будет, какие

1:07:37модели будут. То есть я вот, честно

1:07:39говоря, я именно экшн

1:07:42занимался. У нас там ребята просто у них

1:07:44были ограничения на размер модели. Вот

1:07:49обучения вот.

1:07:53Спасибо.

1:08:01>> Следующий Григорий, вопрос.

1:08:04Спасибо. Очень интересный рассказ, очень

1:08:08интересная статья. Ээ, в общем, меня

1:08:11очень удивил феномен того, что лучший

1:08:14результат показал проектор, который есть

1:08:16замороженный МЛП.

1:08:18Вот. Ээ, там, кстати, ну, там, ээ, есть

1:08:22какие-то небольшие комментарии по этому

1:08:24поводу. Вот хочется поподробнее узнать,

1:08:27насколько там большой МЛП, если он

1:08:29замороженный, например, то можно ли

1:08:30просто линейный слой

1:08:32>> взять какой-нибудь, который просто

1:08:33размерности там приведёт друг к другу.

1:08:35Вот. И интересно, почему при тогда такой

1:08:38разрыв, например, с просто косинусом,

1:08:42ээ, который, ну, как бы там тоже ничего

1:08:46не тренируется, то есть когда МЛП

1:08:48вырождается до тождественных функций.

1:08:51>> Угу. О'кей. Спасибо за вопрос. А, в

1:08:55общем, на самом деле вот эта история с

1:08:57тем, что мы

1:08:59в статьи есть там аблейшены разные,

1:09:02можно посмотреть. Мы как раз смотрели на

1:09:06разные способы делать с проекцией. Нам

1:09:08по сути нужно созмерности VAй

1:09:11внутренней, это 4096 там у улама 2

1:09:15внутренней фичи на размерность Vision

1:09:17Techчера. Это типа 786

1:09:20там где-то размерность. Спроецировать.

1:09:23Это, во-первых, довольно большой гэп в

1:09:25размерностях. То есть мы м большой

1:09:28бединг

1:09:29проецируем в более маленький бединг. А

1:09:33это первый момент, э, который нужно

1:09:36иметь в виду. Второй момент, значит, ну,

1:09:40поводу проектора, да, мы смотрели там

1:09:42разные способы проекции, но первый

1:09:45вопрос, который возникает, ну, допустим,

1:09:47возьмём МЛП, а мы можем заморозить или

1:09:52не заморозить его? На удивление, вот то,

1:09:55что пока что не покрыто в статье,

1:09:57теоретически, почему вообще у нас лучшие

1:10:00результаты получились замороженным

1:10:01проектором. Вот здесь как бы есть

1:10:04эмпирические обоснования, а связаны с

1:10:06тем, что мм если проектор не

1:10:09замораживать, а то

1:10:12у нас

1:10:14лос будет этот проектор, в общем, из

1:10:18из-за из-за опять же большой разности в

1:10:20размерностях.

1:10:22А эта млпэшка будет не такой уж и

1:10:24маленькой прямо. Вот. и она сможет

1:10:26выучиться таким образом, чтобы а эти

1:10:30фечи

1:10:32не за счёт, ну, в общем, модель

1:10:35уменьшит свой alignment loss, не за счёт

1:10:37того, что она стала умнее или сохранила

1:10:40там представление визуально и текствы,

1:10:42за счёт того, что вот этот МЛП, а,

1:10:44довольно жирный, он подстроился просто

1:10:47проецировать хорошо. А

1:10:52с чьей велой? Так, а, Григорий, руку ещё

1:10:55поднимаете. Ещё вопросы?

1:10:59>> Я случайно забыл опустить.

1:11:03>> А вот это первый момент. И если

1:11:05заморозить и рандомно инициализировать

1:11:08вот это LP проектор, а, то забавно. Ну,

1:11:13как бы казалось бы, а что там у нас MLP

1:11:15проектор тогда проецирует? Ну, какую

1:11:18информацию он сохраняет. Вот. Но

1:11:20казалось, что это работает лучше всего.

1:11:22А на эту статью есть теоретические

1:11:24обоснования, ну, точнее, у нас есть как

1:11:26бы идея, в какую сторону двигаться. Есть

1:11:28такая, а, штука, как Subspace

1:11:32Regression. Вот, по сути, мы, делая

1:11:34рандомную проекцию, считая косинус между

1:11:37а этими фичами, мы

1:11:41а по сути считаем а

1:11:46разни, короче, схожесть между

1:11:48подпространствами различными. А типа у

1:11:51нас есть как бы глобальное пространство,

1:11:53которое там говорится в Platonic

1:11:54Representation HPES. Это немного научно

1:11:57популярные скорее термины, а, но есть

1:12:00какое-то латентное generalized а

1:12:03пространство, а, в котором лежат хорошие

1:12:06фичи. Вот. А каждая модель, по сути,

1:12:10с различной модальностью, она выучивает

1:12:12отображение этого пространства. А она

1:12:16его выучивает свои параметры. Вот. А

1:12:19когда мы а делаем рандомную проекцию и

1:12:22считаем косинус между а двумя разными

1:12:26моделями, по сути, мы берём эти два

1:12:28разных под пространства,

1:12:30две разных этих проекций вот этого

1:12:32большого пространства и делаем между

1:12:36ними регрессию. Вот. А, то есть мы как

1:12:38бы, ну, в случае с Велой у нас там, а,

1:12:43вот этот LН Space, он очень сильно сжат,

1:12:46потому что у нас там возникает коллапс.

1:12:48Просто модель, а, перестаёт разчать там

1:12:51эмбединги

1:12:53с различными картинками. Она считает там

1:12:57в своих параметрах, а, что это что-то

1:13:00схожее, например. Вот. А, и мы как бы,

1:13:03когда делаем вот этот алаймот, мы

1:13:05обратно пытаемся растянуть там вот это

1:13:07пространство, а,

1:13:11сохранив вечи, сохранив там кластеры,

1:13:13которые могут быть, если там заимбидить

1:13:16какой-нибудь большой сет. Вот. Я не

1:13:19знаю, насколько как бы я ответил на

1:13:20вопрос, но у нас есть идея в эту сторону

1:13:22двигать, а, с точки зрения

1:13:25теоретического обоснования. Ну, тут,

1:13:26конечно, ну, типа, это не закрытый

1:13:28вопрос.

1:13:30Вот. А по поводу лоса, ну, мы пробовали

1:13:32косинус L2, а что инфо C что-то такое

1:13:37пробовали. Вот косинус лучше всего. Ну,

1:13:40скорее всего, из-за того, что косинус

1:13:42как бы он не смотрит на то, что у нас в

1:13:45цифрах конкретно содержится. Он алайнет

1:13:47направление, как раз выравнивает их.

1:13:50Вот. Ну и то, что в прошлых работах

1:13:52везде у них тоже было показано, что

1:13:54косинс лучше всего работает. Вот.

1:13:58>> Спасибо.

1:14:04А так я, наверное, да, последнее

1:14:07финализирую. А, то есть условно мы берём

1:14:10просто МЛПшку со случайными весами и

1:14:14замораживаем её. И у нас

1:14:18лмка просто, ну, Вилэмка условно учит

1:14:22подстраивать импединги так, чтобы

1:14:23проходя через вот эту вот МЛПшку, они

1:14:26нормально проецировались.

1:14:31Да. Да.

1:14:33>> Ну, типа того, да.

1:14:35>> О'кей. И тогда ещё последний вопрос. Мне

1:14:38показалось, что вот когда вы

1:14:40рассказывали, вы там говорили по поводу

1:14:42а там случайной проекции, она мне, ну,

1:14:46мне показалось или она или она

1:14:49действительно случайное? Тогда в чём

1:14:50случайность

1:14:53>> здесь? Я я это назвал типа рандомные

1:14:56проекции. А рандомно здесь скорее в том,

1:14:59что мы исходно, во-первых,

1:15:02инициализировали

1:15:04эту МЛП рандом весами и не учим их

1:15:06никак. Во-вторых, мы ещё вставляем

1:15:08дропауты в эту МЛП.

1:15:13И с дропаутами она чуть ещё получше

1:15:16работает. Вот.

1:15:18>> А, понял. Спасибо большое.

1:15:22>> Здесь принципиально, что это МП или это

1:15:24может быть просто проектор, просто

1:15:26линейный свой?

1:15:28Мы смотрели, нет, линейный слой вообще

1:15:30не работает. Ну, если там открыть

1:15:32статью, посмотреть, самый последний там

1:15:35раздел, вот, то там мы пробовали

1:15:39несколько видов там проекции, начиная от

1:15:42обучаемого какого-нибудь там спектраль,

1:15:45ну, короче, мы пробовали там

1:15:46спектральное разложение, там

1:15:48фурьерансформ какой-то делать. Ну,

1:15:49короче, разные функции потестили,

1:15:51которым можно, а, разные проекторы. Вот.

1:15:55А, и в том числе просто линейный слой.

1:15:57Ну, линейного обычного слоя оказалось

1:16:00недостаточно.

1:16:02Там есть ещё такой интересный результат,

1:16:04что если делать йнинг

1:16:07проекцию, то это тоже, в принципе,

1:16:09довольно неплохо работает.

1:16:12Wtingнing проекция - это с теория

1:16:15оптимизации штуки. Вот. Но типа тут,

1:16:19короче, чтобы это пояснить, нужно, мне

1:16:21кажется, жёстко закопаться в теорию пока

1:16:24что. Ну реально вот нет прям очевидного

1:16:27понимания, почему типа вот с рандом

1:16:30проекцией сработала из вайтингом. И ну

1:16:33прикол-то в том, что у нас это завелось

1:16:35не просто в симуляторе, а как бы

1:16:37реальном роботе тоже. Вот ладно бы там

1:16:40просто на симуляторе мы получили эти

1:16:42результаты, но такие жерезы с реальным

1:16:46роботом работают. И тут как бы

1:16:50work, я бы сказал.

1:16:53Вот поясните, почему это так и какую

1:16:55нужно делать правильную проекцию. У

1:16:57кого-то там в статье получалось, что у

1:17:00них сильно лучше свёртки работали, как

1:17:04проекция. Вот. И тут

1:17:08я думаю, можно это пояснить. Надо

1:17:10подумать хорошо просто.

1:17:14>> Ну да. Можно ещё вопросик в сторону

1:17:16вообще в целом по пайплайну типа

1:17:18алайнмента. То есть понятно, вот есть

1:17:20какая-то Vay, мы берём её, она типа

1:17:22запретрей, ну, берём её как чекпоинт. И

1:17:26вот у нас есть задача, у нас есть робот,

1:17:28а мы даём типа на алайнмент только

1:17:30траектории или ещё как-то параметры

1:17:33робота, его конфигурацию, там

1:17:34что-нибудь. Это это, короче, не

1:17:38учитывается, да?

1:17:41Малаймите. Ну, по сути, вот у нас

1:17:42картинка, да, как меняется наш пайплайн.

1:17:46А вот исходно, я не знаю, видно мою

1:17:48мышку или нет.

1:17:48>> Да, видно.

1:17:49>> Исходно у нас было обучение. Вот типа мы

1:17:52картинки текст, подсказываем экшены,

1:17:54считаем action loss по ground экшенам из

1:17:57датасета. Вот. А мы что делаем? По сути,

1:18:02просто втосеset ээ берём имиджи,

1:18:05картинки, переразмечаем datсеset

1:18:08фичами с vision учителя. Вот у нас

1:18:11теперь новый стек появился фичей.

1:18:14Короче, новое поле появилось досетите.

1:18:16Вот. И дальше мы просто, когда учим

1:18:19модель, у нас, конечно, у нас есть веса

1:18:21модели, а у нас лежат они напу. Мы через

1:18:24негратенты кидаем. Вот. А мы просто лос

1:18:28теперь не только через экшены

1:18:30прокидываем в эти веса, но ещё и через

1:18:33проектор, точнее. Ну да, лос лос течёт

1:18:36теперь через косинусный вот этот лос и

1:18:40затекает через вот эти внутренние vision

1:18:42фичи.

1:18:43Вот.

1:18:47>> Ну о'кей, короче, не учитывается. Я

1:18:48понял. Сил.

1:18:57>> Так, ну я думаю, всё. Все, кто хотел

1:19:02задать вопрос, спросили. Если что,

1:19:05приходите к Никитезно

1:19:07в личку.

1:19:09Вот.

1:19:10Да. Всем спасибо, что сегодня были. И

1:19:12тебе, Никита, тоже спасибо большое.

Recently added transcripts

Browse the whole transcript library

This transcript was generated from the captions YouTube publishes for this video. Get the transcript of any YouTube video atfreeyoutubetranscribe.com, free, unlimited, no sign-up.