Full transcript
0:00Всем
0:03ещё раз привет, кто пришёл.
0:05А у нас новый очередной
0:10Reading Club. Вот сегодня с нами Никита,
0:13он исследователь из Аири. Вот. Ну и
0:16также магистрат нашего Хаба.
0:19А сегодня расскажет про Visual Visual
0:23action visual language action models.
0:25Вот это, соответственно, то, что драйвит
0:29сейчас и там Physical AI, кому как
0:32нравится.
0:34Ну и да, передаю слово Никите.
0:39>> Так, а супер. Всем привет ещё раз.
0:44Меня зовут, а, Никита Качаев,
0:47инженер-следователь.
0:49А, зер и магистрант
0:52AAхhub. Вот сегодня мы поговорим про
0:57такое довольно популярное горячее
0:59направление
1:00а в
1:02исследованиях. А мы говорим про Visual
1:05Language Action модели. А, и
1:10расскажу про нашу новую статью, а, про
1:13метод, а, равнивание визуальных
1:16представлений для геназации в белой
1:18моделях.
1:20Вот. А, ну, начнём, а, с такого введения
1:23вообще, что было раньше и как мы пришли
1:27а к такой жизни. Вот. А где-то году в
1:322016,
1:33а восемнадцатом люди занимались решением
1:38м довольно таких игрушечных задач. Они
1:41решали их при помощи Реля. А это вот
1:45симулятор Атари там был. А есть такая
1:48среда, э, муджока, где бегали всякие
1:51паучки, мм, всякие а ноги и прочие штуки
1:56ходили. Вот. Ну, это типа на самом деле
1:59далеко а-а всё от реальности. Вот. И,
2:05наверное, с двадцатого-двадца второго
2:07года начали появляться постепенно
2:09работы, в которых говорилось про таких
2:13лист-моделей. Во-первых, начали
2:15использовать трансформеры. А вот и люди
2:20начали задумываться о том, чтобы,
2:21во-первых, решить более сложные задачи,
2:23во-вторых, решать не каждая модель.
2:27решает определённую задачу. А люди
2:30пытались найти метод, а, способ для
2:34обучения такой большой джинлист модели
2:36для решения различных сложных задач.
2:39Вот. Ну, на примере тут Вайма, одна из
2:42таких тоже первых работ, а, интересных.
2:45Вот. М всё это постепенно переросло в
2:49направление, которое сейчас, э,
2:51называется не направление, наверное,
2:54область исследования велой модели. Вот,
2:56по сути, аналогию здесь можно проводить
2:59с тем, как развивался
3:02развивалась область NLP, как она как
3:05появилась такая большая ветвь
3:08large language моделей. Вот здесь в
3:11чём-то было схоже, а и до сих пор
3:13происходят схожие штуки. Вот. А на самом
3:17деле текущий текущие VLмодели
3:19представляют из себя следующее. А на
3:22слайде я привёл картинку из статьи
3:25OpenVLA. Можно сказать, что это хорошая
3:28такая базовая модель в текущий момент,
3:31которая породила ещё множество статей,
3:34которые в двадцать пятом году выходят.
3:35Вот статья двадцать четвёртого года.
3:38Основная идея в чём? Мы аналогично мм
3:43что что мы делаем? Мы хотим, чтобы у нас
3:47была большая модель, которая может
3:49решать много различных работех задач, и
3:52гилизоваться на различные сценарии, на
3:54различные имбадименты, то есть на разных
3:56роботах с минимальными усилиями. Вот на
4:00картинке видите типа Scale OB training
4:02data написано. Вот основная идея в том,
4:05чтобы взять а существующую VLM модель. А
4:09авторы взяли Prmati VLM, по сути это
4:12лама вторая 7B. А, который был прикручен
4:16там Vision Transformer. Вот взяли эту VM
4:19модель и обучали на а различных работех
4:24датасетах, а добычали геировать вместо
4:27текста экшены. Это можно по-разному
4:30делать. Здесь они прямо
4:33в словарь текстовый, а, взяли просто
4:36неиспользуемые слова. И эти слова, а,
4:39эти токены, а, они отвели под
4:42экшн-токены. Вот. А мы можем, ну, action
4:45вектор у нас, допустим, семимерный- это
4:47просто, мм, точка, куда должен при
4:51прийти конечный, а, конечная часть
4:53робота. Дефктор называется. Это X Y, Z
4:56координаты, а, три угла поворота и
5:00открыт гриппер или закрыт, или насколько
5:02он открыт от нуля до единицы. Вот такой
5:03векторок. Вот мы можем этот вектор,
5:07каждую размерность дискретизовать
5:09и, соответственно, предсказывать, а, по
5:13картинке. И по тексту на вход семь
5:16токенов, которые будут за каждую
5:18размерность отвечать, потом эти токены
5:21стекинизировать, получать числа и уже,
5:24а, выполнять их, эти это действия в
5:28среде. Вот Openvate - это такая хорошая
5:30работа. Они взяли вот большую модель 7B,
5:32ещё раз, да, после неё появилось
5:35много-много различных работ и в целом,
5:38наверное, такой хайп в VLA области. Мм,
5:41>> извини, ещё вопрос сразу. А,
5:44>> а вот всё, я вижу, как запрос туда
5:45попадает. Всёвсёвс, сорри,
5:48>> я хотел спросить, как. Ну о'кей, я
5:50понял,
5:51>> да. Вот. Тут ещё ещё раз подробно там,
5:55как устроена эта моделька была. Вот. А
5:59результаты, которые они получили, на
6:00самом деле, они были довольно хорошие.
6:02Они взяли большую модель спретрейна. И
6:05спритрейна - это эта модель, то есть без
6:07а обучения под конкретный сценарий. в их
6:10статье она показывала хорошие результаты
6:13в сравнении с тем, что было раньше. А,
6:15например, там OCT R2 модели - это тоже
6:18большие модели с притрейном. Ну, OpenVA
6:20я считаю, что получилось вот на тот
6:23момент лучше всего. И эту модель начали
6:25сильно использовать другие
6:27исследователи. Вот. А, в частности,
6:29ребята, которые делали Open VLA, они,
6:32часть из них основала свой стартап, а,
6:35который называется Physical
6:37Intelligence, и начали выпускать уже
6:41более, а, чуть более закрытые модели.
6:44Например, а, самая недавняя, а, модель
6:48P05.
6:50Вот. А основная идея здесь идеи все все
6:54те же. Мы хотим генеризоваться, мы хотим
6:57делать притрейнинг. Притрейнинг
7:00настолько хороший, что он поможет нам в
7:03новых средах, а, с полточка заводить
7:06модель без специального дефайтюна.
7:09Вот. И здесь, ну, понемно немножко
7:11по-другому сама моделька устроена, но
7:13смысл там тот же. У нас есть
7:15предобученная VLM, и мы её специальным
7:19образом добычаем, тоже делаем такой
7:22трейн, но уже на работе с данных. Вот. И
7:24в этой в этой работе они тоже показали,
7:27ну, текущий момент, наверное, самая
7:28хорошая, самая лучшая работа, которая
7:31есть, и моделька в Openourсе. А, и они
7:34показали, ну, вот, да, тут архитектура
7:37немножечко другая, они уже начали
7:39использовать всякие diffusion flow
7:41matching стратегии. Ну, в принципе,
7:44смысл от от смысл это особо что-то новое
7:48это особо прямо не вносит. Идея та же.
7:51Вот. А интересно то, что они показали на
7:54графиках.
7:56А это был было было несколько графиков,
7:58но вот самый левый о чём, в принципе, их
8:01статья пим,
8:03что мы можем а таким образом преобучить
8:07и сделать такую V-модель, которая будет
8:09генизоваться. Вот у них статья по сути
8:11про то, что нужно для хорошей генизации
8:13вла моделях. Вот то, что они показали
8:16здесь левый график, он довольно
8:18интересный. А по оси X здесь у нас
8:21количество локаций, то есть разных. Они
8:23ездили по домам Сан-Франциска
8:25по разным локациям и тестировали на там
8:28задаче уборки комнаты свою модель на
8:32одном роботе. Вот по оси X - это
8:34количество различных локаций, а по оси Y
8:38здесь средний performance. Вот. И
8:41значит, что этот график показывает? Ну,
8:42в целом, первый момент - это значит, а
8:46самые правые вот эти столбики. Самый
8:48нижний столбик - это если не делать
8:50притрейнинг. То есть притренинг нам
8:52нужен. Если притренинга нет, то
8:54перформанс очень плохой. М далее
8:58зелёный столбец. А там тоже они уже
9:01взяли in domain data. In the domain data
9:04- это значит они с этих домов, с новых
9:06локаций, они уже подсобирали данные и
9:09дообучили модель на этом всём. Вот. И
9:13если теперь смотреть на левый график, то
9:15оказывается, что у них получилось аа так
9:20а затюнить, точнее так предобучить
9:22модель, что она генерализуется,
9:27а также хорошо, точнее, она показывает
9:30такой же хороший результат, как и
9:32модель, которую тюнят прямо на данных,
9:35собранных в этом домене, в этом доме.
9:38Вот. Я надеюсь, я понятно. А эту
9:42приложение, короче, ну здесь понятно
9:44пояснил. А вот чем, то есть по чем
9:48больше они докидывали себе втрей новых
9:50локаций каких-то, а тем лучше модель
9:53моглазоваться уже на более невидных. Но
9:56здесь заметны заметная вещь и важная
10:00самая по сути, а то, что этот график он,
10:03ну, во-первых, он не доведён там до
10:04конца. А что будет, если 150 локаций,
10:07200 добавить, да? И видно, что он в
10:09целом выходит на плато, и плато - это не
10:12в 100% качества. И задач там было
10:15четыре, которые они тестили. И на самом
10:18деле текущая вот проблема, о которой,
10:21которую хотел поднять здесь, это
10:23проблема связана с тем, что у нас всё
10:25ещё нету момента, а ча момент, как было
10:30с LM VLM моделями. А когда мы когда люди
10:35начали притренить на огромном количестве
10:37данных модели и они начали реализоваться
10:40очень хорошо, а в самых разных доменах
10:44сейчас в работиксе, а, ну вот тоже новая
10:47статья, вышла она совсем недавно, а, я
10:50не знаю, там недели две назад. А, Gen
10:54Zero. А вот это сейчас на данный момент
10:56самая большая модель. Вот можно
11:00посмотреть левый график там сравни с пи
11:0305 вот как раз её размеры, да, и они
11:06показывают тоже своей статье. Если мы
11:08будем скейлить модель, скейлить досет,
11:10то качество у нас там будет расти. Вот
11:12они показывают графики с sc слинглоса.
11:15Чем больше возьмём модель, тем лучше она
11:17будет сходиться. Чем больше данных
11:19используем, тем лучше это будет всё
11:21работать. А, но, но в текущий момент, а,
11:24на самом деле, вот тут есть даже
11:26видосики красивые, как,
11:30извиняюсь, как робот, а, кладёт телефон
11:35в коробку или какие-то вещи. Вот. На
11:37самом деле, а по экспериментам, которые
11:40делаем мы, которые делают люди и постят
11:42в Твиттере про это всё, мм, до сих пор
11:46мы не достигли этого момента, когда
11:48модель из Пайтюна на данный на
11:51конкретный домен, она заведётся. Вот. И
11:55это огромная проблема, до которой до
11:57которой которую ещё предстоит решить.
12:00Проблема в том, что у нас не так много
12:02работекс данных. А если с текстами и
12:05картинками можем скачать весь интернет,
12:07а с роботами мы не имеем интернета для
12:10роботов, и нам нужно собирать данные, а
12:12они слишком дорогие. Вот. А вторую
12:15проблему, которую я хотел бы отметить, а
12:18связана с тем, что, а, соответственно,
12:20вот все Vay модели, которые выходят,
12:23они репортят
12:25точнее нет. Вторая проблема
12:28связана с бенчмарками. Аэ, панчмарки в
12:31основном завязаны на том, насколько там
12:33хорошо экшены выполняют модели. А, но
12:38они не фокусируются на том, а вот
12:40сохранились ли знания, а, в модели. Мы
12:42же взяли VLM-модель, а, до обучили её на
12:45экшн датасете на Robotics, а, и получили
12:49VLA модель. А сохранились ли исходные
12:51знания о мире, о природе, о всём а после
12:55добычения на экшн датасете. Вот м таких
12:58бенчмарков а в текущий момент нету. Вот.
13:01И третья проблема заключается в том, что
13:04мм все результаты, которые репортят в
13:06основном на велой моделях, если это
13:08открытые какие-то результаты, они
13:10используют панчмарки, которые в данный
13:12момент уже сильно оверфитнуты. Мм,
13:15следующая картинка вот справа, это
13:18картинка из статьи. А тут, в принципе,
13:20хороший пул моделей, а, Vй приведён за
13:23вот прошлый, текущий год. И можно
13:27посмотреть на скоры, которые здесь
13:30модели выбивают. И тут уже модели под
13:3399% бьют бенчмарк, но при этом выходят
13:36статьи всё равно новые, в которых новая
13:40очередная велая модель, а, выбивает скор
13:4299,9%.
13:44После этого авторы заявляют, что у нас
13:46лучшая модель. А в то в то же время ещё
13:50помимо того, что они заявляют у нас
13:51суперкрутая модель. М тут слева видно,
13:55значит, large small и tiny, размеры
13:57моделей. Авторы ещё заявляют, что мы
13:59можем на самом деле уменьшить модель
14:01сильно, а, например, там с 7 млрд
14:04параметров до 0,5 млрд параметров и
14:08повысить типа сделать такую хорошую
14:10модель, что она будет бить бенчмарк в
14:13разы лучше, чем семимиллиардные. Вот это
14:16большая проблема, потому что если
14:18запускать вот все эти работы с этими
14:21маленькими моделями, да, ну недавно,
14:22например, там у Хокенфейса у них была
14:25VLM модель Small VLM, а они выпустили
14:29маленькую модельку, которая бьёт
14:30бенчмарки тоже VLмные. Вот оказалось,
14:33что ну её не особо можно нормально
14:35применять. Аналогично велой тоже они
14:38зарелизили, по-моему, летом свой small
14:42V. А на бечмарках она очень хорошие
14:45результаты показывает. Если запускать на
14:47реальном роботе, ну, она никуда не
14:50годится. То есть есть проблема с тем,
14:52как бенчмаркется. Вот. А чтобы решить
14:56решить первую проблему, нам нужно много
14:58данных. Её как бы мы в нашей статье не
15:02решаем пока что а каким-то умным
15:04способом. Чтобы решить две последние
15:07проблемы, а мы предлагаем следующее. Вот
15:10уже переходя к работе. А, во-первых, мы
15:14в работе, а, да, задались вопросом,
15:17можем ли мы, а, измерить, а, насколько
15:20общее знания, а, отлэмки исходной,
15:24которая была, а, сохранились в Vay
15:27модели после Фатюна на работе данных.
15:31Вот для этого мы предложили такой, а,
15:33простой бенчмарк в чём-то. А он
15:36симуляторе. А здесь выложено несколько,
15:40ну, в
15:42в сцене на столе выложено несколько
15:44плашек. На этих плашках появляются
15:47различные рисунки. Здесь у нас есть
15:49несколько категорий. Мы выбрали такие
15:51типа категории, которые обычно не
15:54присутствуют в работе с данных
15:56метасетах, но при этом они важны для
15:58понимания мира. Например, дорожные
16:00знаки, они не во всех рабочих детосетах
16:02есть. или там паблик инфо какое-нибудь,
16:06вот, или там иконки центральной машины.
16:09Вот мы предложили такой бенчмарк,
16:12который направлен на то, чтобы проверить
16:15трансфер знаний. Здесь мы специально
16:17выкрутили на минимум сложность
16:19выполнения экшенов. В нашем сетапе у нас
16:22модель всегда хватала эту морковку. М и
16:25мы хотели сфокусироваться именно на том,
16:28куда она кладёт её. А текстовая
16:30инструкция на вход поступающая. Обычно
16:33имеет вид такой: а положи, например,
16:36морковку на
16:39зелёный, а зелёный объект или положи
16:43морковку на прямоугольник или положи
16:46морковку на значок солнечной погоды.
16:50Вот. И здесь мы проверяем этим
16:52банчмаркам, насколько V модели могут
16:55входной текст мапить в то, что они
16:57видят, и выполнять действия соо в
17:00соответствии с этим. Вот. То, что мы
17:02выявили, то, что мы выявили, будет на,
17:06э, через два слайда ещё. А, а пока что,
17:11ладно, я просто покажу, что мы выявили.
17:13А вот здесь результаты как раз-таки,
17:16которые мы получили. Мы потестировали
17:20V-модели и VLM модели. А
17:25как раз зачем мы велом модели тестили,
17:27чтобы посмотреть вообще какой перформанс
17:29у исходной модели, который ещё не тюнили
17:32на работе данных. Оказалось, вот мы
17:35взяли V Open Vay, самая нижняя строчка.
17:38А Open Vay появилась из Prзмаtic. Эта
17:41строчка чуть выше. А как мы VM тестим?
17:45Мы просто входную картинку, на вход
17:47картинку спрашиваем, видишь ли ты,
17:50допустим, значок солнца. если видишь,
17:52что на какой плашке находится левой
17:54посередине либо правой. Вот. По сути,
17:57нам это позволяет сравнивать VLM модели,
18:00знания в них и VL модели. Вот оказалось,
18:04что трансфера знаний не происходит.
18:07Более того, мм,
18:10а в различных доменах оно ухудшается.
18:13Трансфер знаний мы обнаружили только в
18:16Color домене. Если посмотреть столбик у
18:19Prзмаtic 69, уvй 69, вот, мм, в
18:24остальных доменах
18:26скорее сильно просаживаются. Это значит,
18:27это говорит нам о том, что когда мы
18:29добучаем велая модель на
18:33action dataset, то есть генерировать
18:35действия, а модели начинают забывать
18:38исходные знания, которые в них были. И
18:41возникает вопрос тогда, а в чём тогда у
18:44нас тинилизация будет? За счёт чего?
18:46Если мы забываем при файтюне на экшн-
18:49датасетах, потому что нам важно помнить
18:52и мы очень бы хотели как раз-таки идея
18:54генизации в ве моделях за счёт VLM
18:57притрейна хорошего. Вот помимо этого мы
19:01провели ещё анализ, а как раз-таки мы
19:04использовали Open Vay, а провели анализ
19:07того, что происходит с внутренними
19:09представлениями модели при Файоне до
19:12обучения на экшена. А то, что мы
19:15выявили, во-первых, следующий момент,
19:18если посмотреть наtion карты, то есть мы
19:21подаём картинку в Vay, Open Vay, а, и
19:24спрашиваем: "Видишь ли ты гамбургер?"
19:27Ну, у нас сцена там, где несколько
19:28объектов, виден робота. М спрашиваем:
19:32"Видишь ли ты этот объект? Видишь ли тот
19:33объект?" Вот. Оказалось, что если
19:37посмотреть наtion карты, вот средняя
19:39строчка - это Open Vay, а то эти карты,
19:45а они очень сильно замылены и, например,
19:50ну, они не активируются, но на
19:52таргет-объектах, про которые мы
19:53спрашиваем.
19:55Вот. Мм, это большая проблема. Мм, тут
19:59немножко затравка на будущее. Если
20:01посмотреть нижнюю строчку, это уже
20:03модель обученная с наш с нашим методом
20:06выравнивания. У неё с attention картами
20:08всё сильно получше. То есть они прямо
20:11чётко фокусируются на тех объектах,
20:13которые про которые мы спрашиваем. И
20:16сверху привезён пример для референса. Мы
20:19взяли квен, и у него, в принципе, тоже
20:21нет таких проблем. Вот. А здесь
20:24проведены средние слои. Естественно,
20:27почему мы взяли именно их? Потому что
20:28они обычно как раз отвечают за связь,
20:30текста и картинки. А вот если смотреть
20:34другие, то там менее менее осмысленные
20:36какие-то attтенtion карты получаются.
20:38Вот.
20:39Мм вторая проблема, значит, эта проблема
20:43называется attention sy, когда у нас
20:45attтенtion утекает вообще куда-то на фон
20:47расплывается по всей картинке, но не на
20:49нужном объекте, когда мы спрашиваем про
20:51объект.
20:53Ещё одну проблему, которую мы заметили,
20:55называется Representation Collapse.
20:58Это следующая история. Если взять
21:02какой-то,
21:04допустим, классификационный сет, мы
21:07взяли довольно сложный коко, а вот мы
21:10взяли просто для иллюстрации три класса
21:13оттуда. Это кружка, бутылка и ножик.
21:16Вот. А и просто делали, наё
21:20визуализацию.
21:22этих картинок. Мы подаём на вход
21:25картинку
21:26в вело модель вело модель. Вот. И
21:30достаём оттуда скрытые представления
21:33текста, которые уже посмотрели и на
21:35картинку тоже с какого-то слоя. Здесь мы
21:37брали вот разные слои, первый, десятый и
21:38двадцатый. Вот оказывается, что если,
21:42ну, визуализировать латентное
21:43пространство, построено таким образом,
21:46то у Квина
21:48и у Prзмаticк VLM
21:51а кластеры получаются, ну, довольно
21:52разделимые. Вот у VL модели, Open VLA
21:56эти кластеры очень сильно между собой
21:59перемежаются.
22:01Вот это говорит о том, что у нас в
22:03какой-то момент тоже прифатюни на
22:05экшенах слова представления.
22:09происходит коллапс. Вот. Ну, здесь как
22:13бы заметка, что он для визуализации, не
22:16используется для доказа для доказания,
22:18потому что, ну, можно его потюнить
22:20как-то и как бы на у нас в статье это
22:23было чисто как визуализация проблемы.
22:26Вот, соответственно, есть, да, три
22:29проблемы, которые мы поднимаем нашей
22:30статье. Это коллапс представлений,
22:34attention
22:36и domain forgetting, то есть забывание.
22:40Вот. А, хорошо, проблему мы подняли. Как
22:44их можно решать?
22:47чтобы, значит, чтобы поговорить о их
22:49решении, мы немножко абстрагируемся и
22:54перейдём к
22:56довольно интересной идее, которая была
22:58поднята в positioning papпере на SLR
23:01двадца четвёртого года, которая
23:03называется Platonic Representation
23:05Hypothesis. Вот о чём эта статья. Мм,
23:08наши авторы, э,
23:12в далёком, как они говорят, там, в
23:14шестнадцатом, в семнадцатом году ещё
23:16делали эксперименты с обучением просто,
23:19а, по-моему, у них были свёрточные сетки
23:21или трансформеры, может быть. Вот они
23:24обучали модель на классификацию а
23:28картинок.
23:29Вот. Также они ещё обучали модель на
23:33м колоризацию картинок. Вот они заметили
23:36такую примечательную особенность, что на
23:40самом деле независи, ну, модели-то
23:42учились на разные задачи и на разных
23:44тасетах, но они заметили в них, а,
23:47значит, нейроны, которые активируются на
23:49схожие паттерны, например, там нейрон,
23:52который активируется на лица собачек или
23:55на птичек. Вот. А эта идея привела их к
24:00более масштабной такому масштабному
24:03утверждению.
24:05которая называется как раз-таки Platonic
24:07Representation Gypes
24:09о том, что а
24:12значит
24:14модели независимо от training objective
24:18их независимо от данных от модальности
24:22они сходятся
24:24м чем больше моделей, чем больше на
24:27большем количестве данных они были
24:28обучены, они будут сходиться к общему
24:31представлению статистическому мира.
24:34Вот. А это довольно сильное утверждение.
24:37Вот в их статье они проводят, ну,
24:40достаточно экспериментов, которые
24:43подтверждают их гипотезу. Вот. Мм, что
24:47они делают? Ну, во-первых, они
24:49используют меру схожести между разными
24:52моделями. Ну, я вернусь на этот слайд
24:54попозже,
24:56да. Вот они задаются вопросом: есть ли
24:59схожесть алаймонт между, например, а
25:02визуальными моделями и между разными
25:05визуальными моделями? По мере того, как
25:08мы увеличиваем качество моделей, типа
25:12больше на большихтах, да, обученные
25:14модели.
25:16А первая гипотеза, на самом деле, много
25:19разных способов есть
25:21получать хорошие скоры или обучить
25:25модель. И они могут быть модели обучены
25:29совершенно разными методами, разными
25:31лосфункциями, разной архитектуры иметь.
25:34Вот второе утверждение, которое не
25:35вдгают, что если что, в общем, а все
25:38сильные модели, они будут
25:41их представления внутренние будут схожи.
25:45Вот. А чтобы подтвердить свой свои тж,
25:50они что делают? Они использовали в своей
25:54статье там 78 различных vision моделей с
25:57разными архитектурами, разными
25:59функциями, на которых их обучали,
26:01разными даты, разными данными. Вот. И
26:05взяли такой, а, бенчмарк VUAP. Вот
26:09график, который они получили, он
26:11довольно интересный. А поси по оси X у
26:15нас, можно сказать, качество, то есть
26:19там процент решённых задач на Vтап м по
26:23Y, а схожесть моделей, то есть они
26:27разбили, грубо говоря, взяли 78 моделей,
26:31а заинтересили их на Vтап, получили
26:34скары и разбили там эти скары там на
26:37бакеты. То есть там модели, которые
26:40решают с 80% до 100, а, и так далее.
26:45Вот. И в этих пакетах они посчитали
26:48алайнмент, то есть меру схожести а этих
26:52моделей. Вот.
26:54>> А можно ещё раз А мера схожести моделей?
26:57Ну, она примерно это вообще я вот что-то
26:59не особо
27:00>> Угу. Да. Вот меры схожести моделей.
27:03Теперь вернёмся к этому слайду.
27:06А они предлагают делать следующее:
27:09мчитать.
27:11Мм,
27:13значит, у нас есть какая-то функция,
27:15наша модель, которая из набора данных,
27:18а, даёт нам а вектор какое-то
27:20представление внутреннее. Вот. А мы
27:24авторы предлагают схоже считать, а, в
27:26терминах, а, крnлов.
27:29Вот. А, то есть - это
27:32внутреннее произведение этих векторочков
27:35из разных моделей. Вот. А,
27:39м, да. То есть в статьи они вводят, они,
27:43по-моему, там предлагают
27:45меру схожести ещё одну. И, в принципе,
27:49показывают, что и прошлые меры схожести
27:51они вполне подходят. Вот. Но мы будем
27:54считать схожесть между моделями
27:56посредством
27:58а схожести
28:00сейчас, как это сказать?
28:03А,
28:06да, они считают ядровые, если по-русски
28:08это говорить, а, ядровые метрики. Вот к
28:14этому можно будет, я думаю, вернуться
28:16чуть попозже, если это непонятно.
28:20Вот. М.
28:23О'кей.
28:25Теперь давайте посмотрим дальше.
28:32Мне кажется, всё-таки я не очень понятно
28:33объяснил, но я ещё раз могу повторить.
28:36Давайте пока продолжим.
28:39Мм, да, ещё один график, который они
28:41получают. Э, следующий следующий график.
28:44А они просто сделали AP, визуализацию,
28:48а, для внутренних представлений моделек.
28:51Вот это п. Он тоже показывает, что, а,
28:56значит, цвет у нас соответствует
28:58количеству там решённых задач на этом
29:01чмарке. Вот. А более красные модели,
29:05модели, которые хуже перформят, а более
29:08синие модели, модели с лучшим качеством.
29:11Вот. И здесь легенду, если посмотреть,
29:13здесь значит разные лос они используют и
29:17разные обжективы. Вот. И видно, что
29:21независимо от лоссов и объжективов,
29:23хорошие модели, они кучкуются в одном
29:25месте. То есть вот синие синие модельки,
29:28мм, плохие модели, они довольно сильно
29:31там довольно
29:34такое вот большое облако получается, и
29:37они тоже где-то там находятся вдалеке.
29:41Вот это как раз в чём-то, ну, является
29:45подтверждением их гипотезы. Вот. Дальше
29:48они как раз-таки смотрели разные
29:51метрики, а схожести у моделей. Мм, по X
29:57у нас Performance, на англичас. Надо
29:59посмотреть, что я уже не помню на самом
30:01деле, что за бенч они взяли. Ну, о'кей,
30:05допустим, этот бенч отражает качество
30:08моделей. Вот по оси Y у нас как раз-таки
30:12мера схожести. Они взяли V2, это Vision
30:16модель. Вот. и изобразили аа языковые
30:21модели. Если посмотреть, то чем лучше у
30:25нас качество на этом графике у языковых
30:29моделей, тем больше у них растёт мир,
30:32тем больше у них схожесть снова 2 их
30:35внутренних представлений.
30:38Вот. И этот график он, значит, эту
30:43статью тоже уже проверяли. И недавно
30:48вышла тоже статья от моей моменты, не
30:50знаю, кто там. А вот они они потестили
30:53уже более свежие модели, потому что на
30:55прошлом графике у них там были Blom, а
30:58Лама первая, ну, как бы сейчас уже более
31:01современные модели появились. Вот они,
31:04э, значит, немножко уточнили этот тренд,
31:06что, да, схожесть растёт.
31:09А, но тут важное замечание, что мы нам
31:11недостаточно просто размер модели
31:13увеличивать. Нам нужно использовать
31:14достаточно разнообразные данные. Но в
31:16целом, да, эта тенденция, она
31:19сохраняется, что чем выше, тем чем лучше
31:22у нас модели становятся, тем больше
31:25схожесть их внутренних представлений.
31:27Вот. А, о'кей. Мм, теперь краткий
31:33экскурс. Я постараюсь бы быстро дать мм
31:37такую интуицию, которую они тоже у себя
31:39в статье дают. Это можно будет почитать.
31:42Я привёл ссылки внизу.
31:44А почему почему это так? Типа почему у
31:47нас
31:47схожесть внутренних представлений будет
31:49расти по мере того, у нас
31:52как модели будут становиться лучше? Вот.
31:55А первая идея, а называется мультиask
31:59Scalingпотеза.
32:00Мм, у нас есть какое-то пространство
32:02решений. для разных задач. Ну, слева
32:05график здесь типа один оваут
32:08пространство решений задачи один, второй
32:11овал пространство решений задачид. И тут
32:13наглядная картинка. Чем больше модель
32:16учится решать разных задач, тем меньше
32:19пространство решений, а, тем меньшее
32:22пространство решений оно должно
32:23зафититься.
32:25Вот.
32:26Соответственно, больше модель, а более
32:30ралист модель, она будет сходиться, они
32:32будут все сходиться, будут все лежать
32:34уже в меньшем пространстве решении. Вот.
32:38А, ну тут есть
32:42картинки
32:43красивые, показывающие это и в других
32:45статьях тоже. Вот вторая история - это
32:50capacity гипотеes чем больше сale
32:52моделей, тем больше вероятность
32:58там тем больше вероятность того, что а
33:01сейчас,
33:04да, чем больше размер моделей, тем
33:07больше вероятность того, что, а,
33:10пространство решений, которое она
33:11выучит, она будет
33:14пересекаться с пространством решений
33:15других задач.
33:17А маленькие модели, они
33:20выучивают довольно простые, а, выучивают
33:24довольно простые функции для решения
33:26определённых задач. Чем больше размер
33:29моделей, тем больше вероятность того,
33:32что она выучит решать не только задачу,
33:34которая она, которая была в тренда
33:36datтасе.
33:41Вот.
33:44Третья история про Simplicity B. А
33:48значит,
33:50история о том, что опять же у нас есть
33:52пространство функций для решения
33:54какой-то задачи. А до этого тоже был был
33:58были выходили статьи
34:01как раз про следующую историю. Мм, а чем
34:06больше у нас модель и вообще как бы
34:10короче заметили закономерность, большие
34:12модели, а у них есть тенденция
34:16для решения задачи, а выучивать простые
34:19функции, а это называется simplicity B.
34:24Вот. М и если мы выучим простые функции,
34:28а значит у нас довольно маленькое
34:31какое-то пространство решения есть.
34:34А, и мы сходимся в какую-то меньшую
34:36окрестность. Ну, как здесь на картинке,
34:39в принципе, у нас много функций, которые
34:40могут решить задачу, но простых функций,
34:43которые решают эту задачу, их меньше.
34:45Вот. А, ну, авторы дают вот такие
34:50интуитивные, а, обоснования. Вот.
34:54Значит, что дальше? Ну, о'кей. А, да,
34:58статью можно почитать ещё. А у них это
35:01более подробно рассказано.
35:03А, о'кей. Значит, есть вот такая идея.
35:06Platonic representation GPS.
35:10Эта статья, как я уже сказал, это была
35:12position paper, то есть просто статья
35:15про то, а что авторы заметили мм во всём
35:21развитии, допустим,
35:23VLM, а там LM реча. Вот эта статья
35:27породила, на самом деле, а
35:32довольно большое количество, а, новых
35:34статей, которые как раз-таки
35:37использовали эту гипотезу, а, только уже
35:40в более практическом, а, смысле. О'кей.
35:44У нас есть,
35:46а, идея о том, что хорошие, большие
35:50модели, они будут иметь схожие
35:52представления. Значит, так. Я надеюсь,
35:55тут видно весь слайд.
35:57А одна из таких хороших ключевых статей,
36:01а репаentation
36:04align for generation. А авторы
36:07предлагают делать следующее. А давайте,
36:10ну хорошо, мы учим. Авторы, значит,
36:12обучают diffusion трансформеры.
36:15А, о'кей. А они задаются вопросом: "А
36:18как можно ускорить обучение этих
36:20моделей?" Вот. И на основании прошлой
36:23идеи они предлагают следующее. Но у нас
36:27Fusion Transformer учится расшумлять
36:30сквозь несколько блоков а картинку.
36:34М, хорошо, давайте мы будем, а, вот эти
36:37вот шумбные представления в каких на
36:39каком-то слое, а, проецировать при
36:41помощи МЛП, а, и выравнивать с уже
36:47хорошими фичами от Vision Encodдеров.
36:50Они брали 2, насколько я помню. Вот они
36:54проецировали вот эти вот зашумлённые
36:57фичи, частично уже расшумлённые. Я не
36:59помню, с какого блока они брали,
37:01возможно, там двадцатый, пятнадцатый,
37:03что-то такое. А diffusion трансформера и
37:07добавляли такой
37:09AUX LOS, дополнительный помимо основного
37:12обжектива. Вот. И оказалось по их
37:15результатам, что это помогло им в разы
37:17просто ускорить
37:21хождение моделей. То есть правый график,
37:23ну, тут прямо 17.5xф.
37:27Вот. Но приросты они получили хорошие.
37:30Эта статья уже так довольно неплохо
37:33отсела от сообщество
37:35и породило с собой ещё много разных
37:39работ. Значит, следующая идея. Мы можем
37:42м теперь брать,
37:46значит, мультимодальные лмки и а
37:52добавлять в них
37:55на 3D foundation модели. А для чего? Для
38:00того, чтобы, например, а добавить им
38:02visual groundдинг, чтобы решать
38:05различные spatial tas таasки, таски на
38:07понимание 3D сцен. Вот аналогичная идея.
38:11А я не смотрел, с какого слоя они там
38:14вытаскивают, что, потому что эту статью
38:16уже нашёл, когда мы делали свою работу,
38:19и она довольно свежая. Аналогичная
38:21работа есть с Video diffusion models, а
38:25тоже алайнит на ВГТ. Здесь Visual
38:28Geometry Ground Transformer, то есть
38:30какого-то слоя diffusion трансформера
38:32достают представления и выравнивают их
38:36на представление из бэкбона. хорошего
38:39ВГДТ. Вот. А, о'кей. Соответственно, то,
38:43что делаем мы, то, что предлагаем мы в
38:47своей работе, оно в чём-то схоже,
38:51а, с тем, что
38:53показали, например, в Репа. Вот. И оно
38:56основано также на Platonic
38:58Representation Gypothesy. Аэ, значит,
39:03так. Ну, давайте посмотрим на эти
39:04слайды. Мы предлагаем делать следующее.
39:08Ну, мы предлагаем делать vision
39:11representation alignment. Что это такое?
39:14У нас есть Vay модель. А на вход она
39:17получает картинку текст. Generate
39:19action. Мм,
39:22хорошо. А до этого я отметил три важные
39:27проблемы, которые возникают при обучении
39:28V моделей. А, про забывание, про мм
39:33attention Syn, про коллапс
39:35представлений. А эти все проблемы, они
39:38про то, что а учить V модели только на
39:41экшн модальности, то есть учить VLM
39:44модели только на экшн модальности плохо.
39:48Мы теряем все прошлые праеры, которые
39:51помогали нам, а, решать сложные задачи,
39:54генеризоваться на новые сцены, на новые
39:56объекты и понимать, что происходит.
39:59О'кей. А как мы можем это пофиксить? А
40:02здесь есть несколько вариантов. Мы можем
40:04делать котрейнинг, можем из велой модели
40:07предсказывать не только экшены, но и
40:09текст, например, и параллельно учить её,
40:12а, делать какое-то описание сцены. А
40:15такие подходы есть, мм, такие подходы
40:20работают, но они довольно затратные. Мы
40:24в данной нашей работе мы фокусируемся на
40:27истории, когда у нас уже есть V модель
40:30какая-то, и нам нужно вот адаптировать
40:32её под конкретный домен, под конкретного
40:34робота, потому что у велой модели с этим
40:37проблемы. В смысле, мы не можем взять мм
40:40модель, которую мы предприняли на
40:42большом количестве разных работе данных,
40:45и просто запустить evaluation на новом
40:48роботе. Нам нужно собрать сколько-то
40:50траекторий и получить ещё раз доучить
40:53эту модель на новый баддимент, например.
40:56А вот обычно собирают не так много
41:00траекторий. А и здесь возникает
41:04проблема. У нас очень мало траекторий.
41:06Мы предсказываем экшены. Это траектория
41:08просто на на предсказание а действий.
41:12Вот. И оказывается, что такое маленькое
41:14количество траекторий и типа такой
41:18на новый домен, он сильно ломает, а
41:21представления, заложенные, хорошие
41:23представления, которые были раньше. Все
41:25те картинки и проблемы, которые я
41:26показывал, мы смотрели именно на ITE
41:30чекпоинтах.
41:31А вот, соответственно, мы предлагаем
41:33следующее. Давайте мы
41:37будем наша белая модель, помимо того,
41:39что мы пропускаем loss через экшены,
41:41просто на тон, насколько хорошо она
41:43может генерировать действия, давайте мы
41:45будем выравнивать её представление,
41:48чтобы модель м обучаясь генерировать,
41:52адаптироваться к новому роботу, новому
41:55новой сцене, а не забывала, а и не
41:58теряла свои хорошие представления,
42:00которые были заложены в ней раньше в LM
42:02модели. Вот для этого мы как раз-таки
42:05следуя гипотезеation
42:09гипотеза сделаем следующее. Мы берём, а,
42:13достаём внутренние представления Vay. Мы
42:15используем Vision
42:17внутренние представления картиночные. Мы
42:20достаём из мы достаём их из средних
42:22слоёв
42:24а модели. Вот. И берём хороший Vision,
42:30хорошую Vision foundation, Vision
42:32Teacher. А что происходит? Мы подаём
42:36модели картинку текст, а достаём из неё
42:40скрытые представления, подаём эту же
42:43картинку Vision учителя, получаем набор
42:48бедин от Vision учителя, набор
42:51эмбедингов от VA. Нам нужно эти
42:53эмбединги спроецировать на общую
42:56размерность. Мы проецируем с размерности
42:59велой на размерность учителя. При этом
43:02мы делаем рандомную проекцию. Это тоже
43:05довольно забавная история. А вот после
43:08чего мы считаем лос а схожести между
43:14фичами учителя и внутренними фичами
43:16белой модели. Вот. И форсим этот лос
43:22быть меньше. В данном случае у нас
43:24косинусная схожесть. А стате мы делали
43:28делали довольно много блейшенов,
43:30и они показали, что косинус лучше всего
43:33работает. Вот. М, в общем, такая идея
43:36помогла нам довольно неплохо пустануть
43:40генизацию велой модели на различных AUD
43:44сценариях. А про AUD сценарии. Так,
43:49сейчас,
43:51ну, допустим, допустим, я ещё раз
43:55повторю, да, что я сказал. А весь
43:58пайплайн, он довольно дешёвый. Э,
44:02и вся идея, ну, сама идея, она довольно
44:05простая. А в реализации у нас есть V
44:09модель, она сильно переобучается
44:12и теряет свои навыки исходные пониманию
44:16среды и текста, и картинок.
44:19Всё, что нужно сделать для того, чтобы
44:22сохранить эти навыки в какой-то мере,
44:25это просто на картинке, да, слева, а,
44:30взять ваш датасет, прогнать, достать
44:33картинки, прогнать через vision учителя,
44:35получить её фичики
44:38в trend dataset val. Всё, у нас
44:40появилось новое поле. Помимо картинок
44:42текст, картинки текстэкшены, у нас есть
44:44ещё vision фичи. А, о'кей. Дальше на
44:49этапе файтюна мы пропускаемс не только
44:51через экшены, но и достаём из VLA
44:54внутренние представление
44:56картиночные её с средних слоёв и алайним
45:01эти представления на фичи, которые
45:03которые мы которым мы уже разметили
45:06datтасет. А и считаем регулизационный
45:09лос. Вот справа картинка C, она, в
45:13принципе, тоже показывает идею того, что
45:16мы делаем. Здесь loss landscape
45:19изображён для решения vision language
45:22задач. А такое белое пятно это
45:26пространство решений для задач
45:29работотехнических экшн задач. Вот. А
45:33изначальная VLM модель, она хорошо
45:35затюнена. Для того, чтобы решать visual
45:38language tasки, мы где-то в минимуме
45:39сидим. А фиолетовая точка начальная. Вот
45:43как только мы начинаем тюнить на экшн
45:44данных, мы мы как-то отходим от этой
45:49исходной точки. Мы можем идти разными
45:51путями. Мы можем м мы можем прийти в вот
45:55это белое пространство решений action
45:57tasк м таким образом, что мы слишком
46:00далеко уйдём от решения пространств, от
46:03пространства решения vision language
46:04задач, и тогда у нас модель развалится в
46:07понимании текста и картинок. Мы же
46:09пытаемся дополнительным лоссом заставить
46:12модель как бы адаптироваться к новой
46:14модальности, к эк, решать экшн задачи,
46:18при этом сохраняя свои прежние свойства,
46:20то есть не уходя далеко от
46:24от области решения visual language
46:26задач. Как бы пытаемся найти такое
46:29пространство для решения и тех, и тех
46:31задач, пересечения, попасть туда. Вот
46:34как бы основная идея в этом. А в чём-то
46:37я хотел сказать?
46:41А, ну бенчмарки, да, мы, во-первых,
46:45чмаркаем нашу модель, но, ну, я не знаю,
46:47может, кому-то кто-то увидел превьюшки
46:49или сейчас просто увидел картинки и и
46:52могло показаться, что, ну, там типа
46:54скары в 0,75 или 0 061, это как бы не
46:59слишком большие скоры, а, чтобы про эту
47:01статью писать, а, или прироста 10%. Вот.
47:05А, на самом деле мы, а, во-первых,
47:08сетап, э, мы используем специально
47:10довольно реалистичный,
47:12а, мы берём симулятор. Во-первых,
47:16simpler, он довольно известен в там
47:18кругах работе CVLA. Он
47:23есть статья, которая говорит о том, что
47:25перформанance насж на одно и той же
47:28задачи в реальном мире. Там и в их
47:30симуляторе авторы показывают, что она
47:32коррелирует. То есть мы можем сделать из
47:35realм и зайвалить модель не на реальном
47:38роботе, а в симуляторе и показать
47:41successрей в симуляторе. Это будет
47:43правтивый successрей. Он будет сходиться
47:45с тем, что будет в реальном мире на
47:46реальном роботе. Мы взяли этот симулятор
47:50и взяли довольно сложный сетап. А здесь
47:53в таблице как раз мы меряем генизацию.
47:56То есть мы получили модель на 1.400
48:00траекториях. А эти траектории включали в
48:04себя вариации 16 различных объектов мы
48:07использовали и различных а бэкграундов.
48:11Вот. То есть там где-то пять траекторий
48:14на фиксированную
48:17фиксированный объект и бэкграунд. Это, в
48:19принципе, нурмальный сет. И он схож с
48:22тем, что обычно делают, когда хотят
48:24адаптировать белые модель к реальному
48:27роботу для применения. Вот. А, и мы
48:30померили дальше утилизацию по трём осям.
48:34Semantic, vision, execution. А каждый из
48:36этих осей включает различные таски. А
48:40исходная задача у нас была placeй, а,
48:42схватить объект, положить его в тарелку.
48:46А, и здесь мы делаем различные
48:48перетурбации на evaluation, вносим в эту
48:51задачу.
48:53Например, в секрет мы варьируем объекты,
48:56добавляем, а, target объект, меняем на
48:58тот объект. которую модель вообще не
49:00видела никогда на обучении. Вместо
49:03морковки мы берём стеклянный бокал,
49:05который не был у неё в fon датасете. А
49:09мы варьируем инструкцию, добавляем вот
49:12следующий, третий столбец multтиcaret -
49:15это мм мы добавляем distrctive объекты
49:18на фон, а distractive target объекты. То
49:22есть нам нужно положить тарелку, мы
49:23добавляем две разных цветов или разных
49:25видов или шахматную доску. А, и смотрим,
49:30как модель себя в этих условиях ведёт. А
49:34то, что результаты показывают, ну,
49:36во-первых, дефолтный чекпоинт, он на
49:38этом сильно ломается. Вот. А наш метод
49:42помогает повысить скоры, а, вот во всех
49:45трёх осяхлизации.
49:47Ну, в первую очередь это семантика
49:49вижению. А вот повышение качества здесь
49:56не 100%.
49:58А потому что, во-первых, задачи сложные,
50:00во-вторых, мы не заскелили это ещё всё
50:02нормально, например, до большого
50:04количества траекторий. Или мы можем
50:05делать al не на файтнее, а на этапе,
50:09когда мы получили VLM модель и учим её
50:13на большом количестве работе данным.
50:15Вот. Но тем не менее эти приросты, они
50:18довольно хорошие. А, и то, что в таблице
50:22пока что нету и в статье тоже, но
50:26буквально сегодня
50:28как раз-таки эти эксперименты мы провели
50:30мм с реальным роботом и с пиделью,
50:36которая на данный момент э перформит
50:39лучше всех и в области она считается
50:43хорошей и признанной. А эксперименты с
50:46P05 на реальном роботе а показали, что
50:50наш метод 40% успешности, а помогает до
50:5590 95 повысить скоры. Вот. А в ситуациях
51:01аналогичных тому, что мы банчмаркаем
51:03здесь, это какие-то протурбации,
51:06например, со светом. Если взять и
51:08засветить сцену синим светом, красным,
51:11зелёным или начать какую-то дискотеку
51:15устраивать рядом с роботом. Вот. А тут
51:20демки в симуляторе.
51:22Вот можно увидеть evaluation setup и
51:24сравнение того, как работает наша модель
51:27и модели просто с обычным файтюном.
51:31Вот.
51:37И как раз здесь показаны различные
51:39протурбации. Вот. Я надеюсь, люди не
51:41ушли во время моего рассказа. А в
51:45принципе тут, ну да, последние слайды. А
51:48следующие результаты мы получили для нир
51:52проби. Мм, не только lineнир, но и
51:56attention maping. Я я показывал
51:58attention маap ещё раньше, что они
52:00улучшились.
52:02Также мы потестили сами внутренние
52:05представления. Мы сделали linear проби,
52:07то есть насколько хорошо линейный слой
52:11только опираясь на вот hidden
52:12представления визуальные с модели может
52:15научиться классифицировать imagnet. Это
52:18довольно распространённая практика. Тоже
52:20её делают в Dinov 2. Dinov 3 reportedт
52:24сры. А 3, кстати, не знаю, нова 2
52:27репортат скоры. А нербинга. Вот
52:30результаты тоже показывают следующее. А
52:34лучше всего
52:36EQU у радио V3. Это как раз модель на
52:40Vision модель, на которой мы
52:41выравнивались. А дальше по качеству идёт
52:44а модель Openvay, как раз-таки
52:47выровненная нашим методом. Дальше идёт
52:50прийp
52:52и ещё хуже справляется
52:54просто дообучный дооченная Open Vay на
52:58вот этих 400 траекториях без какого-либо
53:01алаймонта регулизации.
53:03Вот. А, ну, значит,
53:08дальше мы помечмаркали наш чекпоинт
53:12залайненный на синке насинке. Вот
53:16результаты показали следующее. А в color
53:19public shape просто есть. Причём в color
53:23он типа
53:25а скоore выше, чем типа баound исходной
53:29велэмки призмак.
53:32Мм в остальных доменах пока что
53:35улучшений нету. И как раз-таки это
53:37направление для дальнейшей работы. А
53:41здесь уже нужно говорить не про
53:42алайнмент, а про сохранение знаний. То
53:47есть можно говорить про сохранение
53:49пониманий сцены, а можно говорить про
53:52сохранение знаний. Это немножко разные
53:55штуки, я считаю. Вот. И как раз-таки вот
53:58эту штуку, я думаю, можно решать тем,
53:59что алайнить модель на моменте того, как
54:03мы из VLM делаем VLA, а не на моменте,
54:05когда мы тюним на малом количестве
54:07траекторий модель. Вот. Ну, мой рассказ
54:10подошёл к концу. А значит, что можно тут
54:14рассказать? Ну да, статью можете
54:16почитать.
54:18Я дал ссылку. А мы её релизнули довольно
54:22недавно. Вот она уже, в принципе,
54:26довольно неплохо так привлекла внимание
54:30людей. Аа в твиттере нам написали авторы
54:36Open VLA.
54:38А чувак, который делает один из главных
54:42авторов Platonic Representation Gпотеes
54:46и много таких тоже классных людей из
54:49Стипмайда, а
54:52оценили нашу работу. Вот в общем
54:57какие-то такие результаты мы планируем
54:59это всё доразвивать текущие там 2
55:02месяца. Ну вот эксперименты с роботом,
55:05то, что мы добавляем, и там есть ещё
55:09идеи, которые можно попробовать. И как
55:12раз это то, что мы планируем делать. Вот
55:14здесь QR-коды, GitHub, Gameface, а ещё
55:18слева снизу страничка статьи. Вот можете
55:23отсканить, зайти и посмотреть.
55:26А здесь мои контакты, слева моя
55:29страничка, справа мой Telegram.
55:33Вот. А значит, можете, если у вас
55:37появились вопросы и вдруг сегодня мы не
55:38успеем на них ответить, а можете зайти в
55:42телегу, написать мне, можем пообщаться.
55:45Вот. Также я думаю, что а к зиме,
55:50зимний пул проектов мы
55:52выдвинем, предложим предложим какие-то
55:54свои проекты. Они будут связаны с
55:56филайками. Вот. Потому что у нас есть
55:57много направлений как раз, которые мы
55:59тоже многопос, которые мы планируем
56:01тестировать.
56:02Вот тоже по этому поводу можно написать
56:06мне в личку. Вот. Да. Ну, помимо этого
56:11есть стажировки МФТ, которые там с нами
56:13сотрудничает. А, в принципе, у меня всё.
56:17Вот. А я теперь открыт к вопросам. Я
56:20надеюсь, всё это время меня было слышно.
56:23>> Да, спасибо большое.
56:25Так, а можно я пока вопрос задам? Пока
56:28вот я не вижу. А вот смотри. Ну,
56:30понятное дело, что вы хотите условно
56:32алайнить представления визуальные,
56:34которые типа вот, ну, для изображений и
56:38внутри велейки вашей. А,
56:42а были ли, ну, не знаю, статьи
56:43эксперименты, которые вот, ну, в целом
56:45просто на добавление,
56:47а, короче, допустим, вот как вот,
56:51допустим, чтобы сохранить вот улэмки
56:53типа текст текст only как качество,
56:56можно можно подавать текст onlyтек и
56:59типа сравнивать выходы. Ну, типа даже
57:01без картинки. А вот в работе, ну вот в
57:03LA, допустим, подавать типа условно
57:06просто текст и какой-нибудь на выходе
57:08экшены, которые можно как текст условно
57:12представлять и тем самым как будто бы,
57:15ну, как добавлять данные, не знаю, в
57:17притре, там, в SFT, чтобы моделька не
57:19разучилась там, условно вот для текста,
57:22типа General Knowledge какой-то, а для
57:23картинки типа вот картинку смотреть, а
57:26не только,
57:27>> ну, вот
57:29>> вообще делает или как?
57:31>> Да. Да. А сейчас много работ, связанных
57:34с тем, что делают VA. То есть, как я уже
57:38сказал, там в Open VA, например, у нас
57:41пространство экшенов,
57:43экшн-то токены, они лежат в общем
57:47словаре с текстом. Можем предсказывать
57:49не только экшн токены, но и текст. И там
57:52есть как раз статья тех же авторов,
57:54которые называется ecotд relay embos.
58:00в которой модель перед тем, как экшнски
58:02ерить, она делает какой-то ризинг. Она
58:04сначала предсказывает текстовые токены.
58:06Допустим, я вижу, что на столе находится
58:08кружка, рядом с ней слева находится
58:11тарелка, а зелёного цвета. Мне нужно
58:13поднять кружку, положить на тарелку. Вот
58:17такие работы есть, да, но текущая
58:19текущий текущее ограничение их в том,
58:21что мм на текст текст токены вместе с
58:25экшн-то токенами генерить очень долго.
58:28Вот. А-э,
58:31эту проблему можно решать. Можем типа
58:33делать, а, как там различные синкингing
58:37токены, когда модель будет сама решать,
58:39когда ей подумать, а не на каждом степе.
58:42Вот пи она как раз-таки и, короче, она
58:46как раз-таки и предсказывает текст, а,
58:49из мбона своего, помимо того, что она
58:52предсказывает экшены. Вот. А, и это
58:55помогает, да. Но
58:58а здесь возникает, короче, много
58:59проблем. Нам нужно будет собирать
59:01данные. То есть мы не можем взять теперь
59:03просто с робота. Мы должны ещё
59:04каким-нибудь чейносад это разметь. Ну, в
59:07принципе, ну, какой-то хорошей моделью
59:09это можно разметить. Вот. И как раз, ну,
59:11в этом направлении тоже идётся. А можно
59:13вот такую такой рулет, пожалуйста,
59:16>> ещё раз?
59:20>> А, слышу,
59:22>> да? Ну, о'кей. Ты можешь продолжать,
59:27походу. Ну, короче, я понял. То есть в
59:29целом в эту сторону тоже смотрит, но
59:32>> типа это тяжеловесно, чем условно ваш,
59:35который можно уже Ну, я понял.
59:38>> А, то есть, ну, вот представим, у нас
59:40есть мы как раз говорим про историю,
59:44когда у нас есть уже вот велая модель.
59:47Мы хотим, допустим, на складе, на
59:49складе, чтобы она там сортировала
59:51бутылки или какие-нибудь объекты, просто
59:53из коробок доставала, раскладывал по
59:55полкам. Мы хотим её дообучить просто до
59:59нового какого-то места, типа склад,
1:00:01чтобы она к нему привыкла, к новому
1:00:03роботу, который на складе ездит. Вот. А
1:00:05для этого обычно берут мало траекторий.
1:00:08Вот.
1:00:09И там, допустим, какая-нибудь компания
1:00:12покупает себе робота, берёт велая модель
1:00:15и хочет хочет использовать его на
1:00:18складе. Они берут просто телеоперации,
1:00:20там собирают датасет. Примеров
1:00:23несколько, как класть там бутылки,
1:00:25допустим, на полки, на разные полки,
1:00:27разные бутылки. Вот. Но как бы было бы
1:00:30странно, если бы этой компании, э,
1:00:33какому-нибудь бизнесу нужно было ещё
1:00:35думать о том, а вот
1:00:38о том, типа, на каких данных ещё
1:00:40котрейнинг делать. То есть котренинг, в
1:00:42принципе, можно делать, а, предсказывать
1:00:44текст и так далее. Вот. Но эту
1:00:47топ-разметку очень странно себе
1:00:50представить на малых датасетах. То есть,
1:00:53мм, и мы как раз на этом фокусируемся.
1:00:55Мы, я сказал, что можно делать на этапе
1:00:59с типа работей alignment. Ну вот cor
1:01:02пока что история у нас с файтюном
1:01:04именно, где мы видим приросты вот
1:01:07хорошие. И мы тестируем модель. Вот.
1:01:09>> Спасибо.
1:01:12>> Да, у Александра вопрос следующий.
1:01:15>> Да, спасибо большое за доклад. Мне очень
1:01:18интересно, сталкиваетесь ли вы с
1:01:21проблемой так называемого модариджинга,
1:01:23когда у нас действия как раз-таки из-за
1:01:25того, что в ибониках,
1:01:28э, слопываются все представления, у нас
1:01:29действия для какого-нибудь а задания
1:01:32становятся усреднёнными на если на
1:01:34каком-нибудь эпизоде. И там, допустим,
1:01:36если, ну, вот у вас там был на каком-то
1:01:38слайде, честно говоря, не помню номер, и
1:01:40вы разные дестёр, вот вот на этом сайте,
1:01:42да, вот на этом было, где четыре
1:01:45картинки, вы там разные шумы добавляли,
1:01:47там визуальные и так далее. А,
1:01:51>> да. И там, допустим, у вас робот брал,
1:01:53да, вот здесь, там, где no object,
1:01:55допустим, он берёт он какую-то, суть по
1:01:58всему, картошку кладёт её куда-то.
1:02:01Допустим, если картошки будут две, то,
1:02:03ну, опыт, допустим, моей работы с эчан
1:02:06трансформером и прочей архиртектурой
1:02:08показывает то, что он придёт в в среднюю
1:02:10точку между двумя картошками и будет
1:02:12пытаться её что-то сделать с ними. А
1:02:14решает ли ваш подход вот эту вот
1:02:18проблему? И если нет, то как вот её в
1:02:20принципе можно решить?
1:02:24А по поводу вот этой истории с тем, что
1:02:26у нас Ну, ну я я понял, про что вы
1:02:30говорите. А а ещё раз получается
1:02:36мы типа собираем датасет для imitation
1:02:38learningнга. Ну, на у нас смотрите куча,
1:02:41где у нас есть тестовые демонстрации
1:02:43того, как взаимодействовать с
1:02:44какими-нибудь объектами.
1:02:46>> Мм,
1:02:48>> а я, допустим, сейчас работаю не с VLA
1:02:51моделью, а с там Action Charking
1:02:54Transformer - это, ну, тоже есть в
1:02:56репозитории, там, где робот, это там,
1:02:57первых такая конецная модель, когда она
1:02:59просто там клонирует поведение.
1:03:02>> А, но на такой же продинг тебя
1:03:03получаются и другие V уже модели. То
1:03:06есть у нас есть какой-то
1:03:09датасет, где у нас есть эпизоды. В
1:03:11каждом эпизоде у нас есть какая-то
1:03:12картинка, где мы сможем какую-то фичмапу
1:03:14вытащить с картинки обработанную, а ино
1:03:17фичма изгенерировать там
1:03:18последовательность действий.
1:03:20>> А и у нас на фичмапе вот, допустим,
1:03:22может лежать фича картошки там и фича
1:03:26круга, куда нужно картошку положить. И
1:03:28мы там, если клали эту картошку в этот
1:03:30круг там 10 раз,
1:03:32>> а тот там запомнит, как подходить к фиче
1:03:35картошки, как класть её в фичуфи фичу
1:03:36круга. Но если картошки две, то, э,
1:03:40допустим,
1:03:41>> если размерность кодер маленькая, то а
1:03:45он придёт просто в середину между двумя
1:03:47картошками и ничего не сможет сделать.
1:03:48Это будет он окажется в состоянии,
1:03:50которое вот в статьях сейчас называется
1:03:53это Out of Distribution Inference.
1:03:55По-моему, они проводили как раз-таки в
1:03:56питй inference, а, два типа, там in
1:04:00distribution и out of distribution
1:04:01inference. Другой вопрос был связан,
1:04:03проводили ли вы out of distribution
1:04:05inference и in distribution inference и
1:04:06смотрели, как вот ваша
1:04:08>> подход это всё меняет. Короче говоря,
1:04:10всё выка
1:04:12работает ли ваш подход с к с решением
1:04:16вот этого вот усреднения мода AGAG. А,
1:04:19да, да, понял. Ну, как раз-таки вот это
1:04:21все результаты, которые я показываю, в
1:04:23принципе, это всё out of distribution
1:04:25inference. Ну, то есть, а, и на трейне у
1:04:29модели была только задача с морковкой и
1:04:34ещё там какими-то четырнадцати разными
1:04:37объектами, но вот те объекты, которые
1:04:39здесь представлены, например, их не
1:04:41было. И там всегда был один объект для
1:04:43сватывания, один таргет объект, всегда
1:04:45была одна тарелка. Вот здесь как
1:04:48раз-таки примеры, где там помимо
1:04:49картошки есть ложка или ещё какой-то
1:04:52другой объект.
1:04:54Вот это первый момент. То есть это все
1:04:56результаты, то, что мы репортим вот
1:04:58здесь снизу, это перформанс на OD.
1:05:02Вот мы показываем там тут бы на паузу
1:05:07поставить гифку, но вот эта вот сеточка
1:05:09это,
1:05:11>> ну, типа это со стандартным уклонением,
1:05:12да,
1:05:13>> дроп, типа мы в interbution померили
1:05:16качество, оно подросло м относительно
1:05:19там базового метода. И мы потом смотрим
1:05:21ещё дроп в сравнении с тем же базовым
1:05:24методом, насколько он большой, типа в
1:05:26out of distribution. Мне кажется, что
1:05:28дроп в out of distribution сетинге у нас
1:05:30поменьше. Вот типа модель обобщается
1:05:34лучше на новые сетапы. Ну вот касаемо
1:05:37там action chanking transформе, да? Ну
1:05:41вот там пи, ну, я не помню, какая из
1:05:44версий0 или может Openvt, а её можно
1:05:48рассматривать как action chanking
1:05:50transformer, а только с хорошим
1:05:53притрейном. То, что я знаю, ну, то, что
1:05:55мы там тестировали акт, это же, ну,
1:05:57довольно мале маленький трансформеры. И
1:06:00здесь возникают проблемы с генизацией
1:06:03просто потому, что, ну, у нас как бы нет
1:06:06притрейна, и очень сложно, а, без
1:06:11большой модели предобученной, а,
1:06:15обобщаться хорошо на новый сетапы
1:06:17полностью. Вот.
1:06:20Ну, то есть у нас, например, там в наших
1:06:22экспериментах
1:06:24мы изначально там смотрим всё, там у нас
1:06:27были эксперименты как раз для велой.
1:06:29с до обучением при помощи реля. Мы
1:06:32сначала просто взяли этрафантрансформе,
1:06:36вот потом подцепили ему на вход VLM
1:06:41hidden с него и просто подаём их. Вот.
1:06:44Ну, кстати, я не знаю, вот вы, если не
1:06:46пробовали или пробовали, можете
1:06:48попробовать или я не знаю, как бы какие
1:06:50ограничения задачи использовать
1:06:51маленькую на
1:06:54подать с другого какой-то модельки.
1:06:59Може можно взять, а, можно взять лмку,
1:07:02например, там и оттуда
1:07:05или последние фичинт
1:07:09transформе вместо там бейзингов из
1:07:12Нкодера подавать эти бейдинги с вимки.
1:07:15Вот то, что мы делали. И такая вилейка
1:07:18получается, которая уже лучше работает.
1:07:21А она лучше работает, допустим, там
1:07:23через чем Open VLA или ну какой-то
1:07:25аналог просто, по-моему, получается
1:07:27аналог просто Open VLA какой-то и
1:07:29>> Да, да, это
1:07:31Да.
1:07:33>> А лучше хуже это зависит от того, там,
1:07:35ну, сколько у вас данных будет, какие
1:07:37модели будут. То есть я вот, честно
1:07:39говоря, я именно экшн
1:07:42занимался. У нас там ребята просто у них
1:07:44были ограничения на размер модели. Вот
1:07:49обучения вот.
1:07:53Спасибо.
1:08:01>> Следующий Григорий, вопрос.
1:08:04Спасибо. Очень интересный рассказ, очень
1:08:08интересная статья. Ээ, в общем, меня
1:08:11очень удивил феномен того, что лучший
1:08:14результат показал проектор, который есть
1:08:16замороженный МЛП.
1:08:18Вот. Ээ, там, кстати, ну, там, ээ, есть
1:08:22какие-то небольшие комментарии по этому
1:08:24поводу. Вот хочется поподробнее узнать,
1:08:27насколько там большой МЛП, если он
1:08:29замороженный, например, то можно ли
1:08:30просто линейный слой
1:08:32>> взять какой-нибудь, который просто
1:08:33размерности там приведёт друг к другу.
1:08:35Вот. И интересно, почему при тогда такой
1:08:38разрыв, например, с просто косинусом,
1:08:42ээ, который, ну, как бы там тоже ничего
1:08:46не тренируется, то есть когда МЛП
1:08:48вырождается до тождественных функций.
1:08:51>> Угу. О'кей. Спасибо за вопрос. А, в
1:08:55общем, на самом деле вот эта история с
1:08:57тем, что мы
1:08:59в статьи есть там аблейшены разные,
1:09:02можно посмотреть. Мы как раз смотрели на
1:09:06разные способы делать с проекцией. Нам
1:09:08по сути нужно созмерности VAй
1:09:11внутренней, это 4096 там у улама 2
1:09:15внутренней фичи на размерность Vision
1:09:17Techчера. Это типа 786
1:09:20там где-то размерность. Спроецировать.
1:09:23Это, во-первых, довольно большой гэп в
1:09:25размерностях. То есть мы м большой
1:09:28бединг
1:09:29проецируем в более маленький бединг. А
1:09:33это первый момент, э, который нужно
1:09:36иметь в виду. Второй момент, значит, ну,
1:09:40поводу проектора, да, мы смотрели там
1:09:42разные способы проекции, но первый
1:09:45вопрос, который возникает, ну, допустим,
1:09:47возьмём МЛП, а мы можем заморозить или
1:09:52не заморозить его? На удивление, вот то,
1:09:55что пока что не покрыто в статье,
1:09:57теоретически, почему вообще у нас лучшие
1:10:00результаты получились замороженным
1:10:01проектором. Вот здесь как бы есть
1:10:04эмпирические обоснования, а связаны с
1:10:06тем, что мм если проектор не
1:10:09замораживать, а то
1:10:12у нас
1:10:14лос будет этот проектор, в общем, из
1:10:18из-за из-за опять же большой разности в
1:10:20размерностях.
1:10:22А эта млпэшка будет не такой уж и
1:10:24маленькой прямо. Вот. и она сможет
1:10:26выучиться таким образом, чтобы а эти
1:10:30фечи
1:10:32не за счёт, ну, в общем, модель
1:10:35уменьшит свой alignment loss, не за счёт
1:10:37того, что она стала умнее или сохранила
1:10:40там представление визуально и текствы,
1:10:42за счёт того, что вот этот МЛП, а,
1:10:44довольно жирный, он подстроился просто
1:10:47проецировать хорошо. А
1:10:52с чьей велой? Так, а, Григорий, руку ещё
1:10:55поднимаете. Ещё вопросы?
1:10:59>> Я случайно забыл опустить.
1:11:03>> А вот это первый момент. И если
1:11:05заморозить и рандомно инициализировать
1:11:08вот это LP проектор, а, то забавно. Ну,
1:11:13как бы казалось бы, а что там у нас MLP
1:11:15проектор тогда проецирует? Ну, какую
1:11:18информацию он сохраняет. Вот. Но
1:11:20казалось, что это работает лучше всего.
1:11:22А на эту статью есть теоретические
1:11:24обоснования, ну, точнее, у нас есть как
1:11:26бы идея, в какую сторону двигаться. Есть
1:11:28такая, а, штука, как Subspace
1:11:32Regression. Вот, по сути, мы, делая
1:11:34рандомную проекцию, считая косинус между
1:11:37а этими фичами, мы
1:11:41а по сути считаем а
1:11:46разни, короче, схожесть между
1:11:48подпространствами различными. А типа у
1:11:51нас есть как бы глобальное пространство,
1:11:53которое там говорится в Platonic
1:11:54Representation HPES. Это немного научно
1:11:57популярные скорее термины, а, но есть
1:12:00какое-то латентное generalized а
1:12:03пространство, а, в котором лежат хорошие
1:12:06фичи. Вот. А каждая модель, по сути,
1:12:10с различной модальностью, она выучивает
1:12:12отображение этого пространства. А она
1:12:16его выучивает свои параметры. Вот. А
1:12:19когда мы а делаем рандомную проекцию и
1:12:22считаем косинус между а двумя разными
1:12:26моделями, по сути, мы берём эти два
1:12:28разных под пространства,
1:12:30две разных этих проекций вот этого
1:12:32большого пространства и делаем между
1:12:36ними регрессию. Вот. А, то есть мы как
1:12:38бы, ну, в случае с Велой у нас там, а,
1:12:43вот этот LН Space, он очень сильно сжат,
1:12:46потому что у нас там возникает коллапс.
1:12:48Просто модель, а, перестаёт разчать там
1:12:51эмбединги
1:12:53с различными картинками. Она считает там
1:12:57в своих параметрах, а, что это что-то
1:13:00схожее, например. Вот. А, и мы как бы,
1:13:03когда делаем вот этот алаймот, мы
1:13:05обратно пытаемся растянуть там вот это
1:13:07пространство, а,
1:13:11сохранив вечи, сохранив там кластеры,
1:13:13которые могут быть, если там заимбидить
1:13:16какой-нибудь большой сет. Вот. Я не
1:13:19знаю, насколько как бы я ответил на
1:13:20вопрос, но у нас есть идея в эту сторону
1:13:22двигать, а, с точки зрения
1:13:25теоретического обоснования. Ну, тут,
1:13:26конечно, ну, типа, это не закрытый
1:13:28вопрос.
1:13:30Вот. А по поводу лоса, ну, мы пробовали
1:13:32косинус L2, а что инфо C что-то такое
1:13:37пробовали. Вот косинус лучше всего. Ну,
1:13:40скорее всего, из-за того, что косинус
1:13:42как бы он не смотрит на то, что у нас в
1:13:45цифрах конкретно содержится. Он алайнет
1:13:47направление, как раз выравнивает их.
1:13:50Вот. Ну и то, что в прошлых работах
1:13:52везде у них тоже было показано, что
1:13:54косинс лучше всего работает. Вот.
1:13:58>> Спасибо.
1:14:04А так я, наверное, да, последнее
1:14:07финализирую. А, то есть условно мы берём
1:14:10просто МЛПшку со случайными весами и
1:14:14замораживаем её. И у нас
1:14:18лмка просто, ну, Вилэмка условно учит
1:14:22подстраивать импединги так, чтобы
1:14:23проходя через вот эту вот МЛПшку, они
1:14:26нормально проецировались.
1:14:31Да. Да.
1:14:33>> Ну, типа того, да.
1:14:35>> О'кей. И тогда ещё последний вопрос. Мне
1:14:38показалось, что вот когда вы
1:14:40рассказывали, вы там говорили по поводу
1:14:42а там случайной проекции, она мне, ну,
1:14:46мне показалось или она или она
1:14:49действительно случайное? Тогда в чём
1:14:50случайность
1:14:53>> здесь? Я я это назвал типа рандомные
1:14:56проекции. А рандомно здесь скорее в том,
1:14:59что мы исходно, во-первых,
1:15:02инициализировали
1:15:04эту МЛП рандом весами и не учим их
1:15:06никак. Во-вторых, мы ещё вставляем
1:15:08дропауты в эту МЛП.
1:15:13И с дропаутами она чуть ещё получше
1:15:16работает. Вот.
1:15:18>> А, понял. Спасибо большое.
1:15:22>> Здесь принципиально, что это МП или это
1:15:24может быть просто проектор, просто
1:15:26линейный свой?
1:15:28Мы смотрели, нет, линейный слой вообще
1:15:30не работает. Ну, если там открыть
1:15:32статью, посмотреть, самый последний там
1:15:35раздел, вот, то там мы пробовали
1:15:39несколько видов там проекции, начиная от
1:15:42обучаемого какого-нибудь там спектраль,
1:15:45ну, короче, мы пробовали там
1:15:46спектральное разложение, там
1:15:48фурьерансформ какой-то делать. Ну,
1:15:49короче, разные функции потестили,
1:15:51которым можно, а, разные проекторы. Вот.
1:15:55А, и в том числе просто линейный слой.
1:15:57Ну, линейного обычного слоя оказалось
1:16:00недостаточно.
1:16:02Там есть ещё такой интересный результат,
1:16:04что если делать йнинг
1:16:07проекцию, то это тоже, в принципе,
1:16:09довольно неплохо работает.
1:16:12Wtingнing проекция - это с теория
1:16:15оптимизации штуки. Вот. Но типа тут,
1:16:19короче, чтобы это пояснить, нужно, мне
1:16:21кажется, жёстко закопаться в теорию пока
1:16:24что. Ну реально вот нет прям очевидного
1:16:27понимания, почему типа вот с рандом
1:16:30проекцией сработала из вайтингом. И ну
1:16:33прикол-то в том, что у нас это завелось
1:16:35не просто в симуляторе, а как бы
1:16:37реальном роботе тоже. Вот ладно бы там
1:16:40просто на симуляторе мы получили эти
1:16:42результаты, но такие жерезы с реальным
1:16:46роботом работают. И тут как бы
1:16:50work, я бы сказал.
1:16:53Вот поясните, почему это так и какую
1:16:55нужно делать правильную проекцию. У
1:16:57кого-то там в статье получалось, что у
1:17:00них сильно лучше свёртки работали, как
1:17:04проекция. Вот. И тут
1:17:08я думаю, можно это пояснить. Надо
1:17:10подумать хорошо просто.
1:17:14>> Ну да. Можно ещё вопросик в сторону
1:17:16вообще в целом по пайплайну типа
1:17:18алайнмента. То есть понятно, вот есть
1:17:20какая-то Vay, мы берём её, она типа
1:17:22запретрей, ну, берём её как чекпоинт. И
1:17:26вот у нас есть задача, у нас есть робот,
1:17:28а мы даём типа на алайнмент только
1:17:30траектории или ещё как-то параметры
1:17:33робота, его конфигурацию, там
1:17:34что-нибудь. Это это, короче, не
1:17:38учитывается, да?
1:17:41Малаймите. Ну, по сути, вот у нас
1:17:42картинка, да, как меняется наш пайплайн.
1:17:46А вот исходно, я не знаю, видно мою
1:17:48мышку или нет.
1:17:48>> Да, видно.
1:17:49>> Исходно у нас было обучение. Вот типа мы
1:17:52картинки текст, подсказываем экшены,
1:17:54считаем action loss по ground экшенам из
1:17:57датасета. Вот. А мы что делаем? По сути,
1:18:02просто втосеset ээ берём имиджи,
1:18:05картинки, переразмечаем datсеset
1:18:08фичами с vision учителя. Вот у нас
1:18:11теперь новый стек появился фичей.
1:18:14Короче, новое поле появилось досетите.
1:18:16Вот. И дальше мы просто, когда учим
1:18:19модель, у нас, конечно, у нас есть веса
1:18:21модели, а у нас лежат они напу. Мы через
1:18:24негратенты кидаем. Вот. А мы просто лос
1:18:28теперь не только через экшены
1:18:30прокидываем в эти веса, но ещё и через
1:18:33проектор, точнее. Ну да, лос лос течёт
1:18:36теперь через косинусный вот этот лос и
1:18:40затекает через вот эти внутренние vision
1:18:42фичи.
1:18:43Вот.
1:18:47>> Ну о'кей, короче, не учитывается. Я
1:18:48понял. Сил.
1:18:57>> Так, ну я думаю, всё. Все, кто хотел
1:19:02задать вопрос, спросили. Если что,
1:19:05приходите к Никитезно
1:19:07в личку.
1:19:09Вот.
1:19:10Да. Всем спасибо, что сегодня были. И
1:19:12тебе, Никита, тоже спасибо большое.