Full transcript
0:23Да, всем привет. Как видите, я очень рад
0:26здесь быть в это время. Вот. Надеюсь, вы
0:29тоже.
0:30А сегодня поговорим про Вла. А на этой
0:33летней школе, я так понимаю, у нас будет
0:34дофига лекций про Вла. Уже была одна.
0:37Кто был на первой лекции ПВЛА? Поднимите
0:40руку.
0:42Суперкайф. Так, и как вам понравилось?
0:46Классно. Короче, сегодня будет, я,
0:49насколько помню, там Андрей читал, а,
0:52там достаточно такие более технические
0:54вещи. Здесь мы опять чуть будем чуть
0:56повыше разговаривать по поводу в первую
0:58очередь масштабирования и фронтира. Вот.
1:02Аа нежели чем там то, что есть в
1:04онсурсе,
1:06а чтобы вы примерно понимали, куда всё
1:08это дело движется, какие уго предпосылки
1:10были и всё такое. Первое, кто не знает
1:13основную предпосылку Вла вообще зачем
1:16зачем они как бы нужны концептуально?
1:18Чем предыдущие парадигмы не подходили?
1:22Давай
1:25>> так. А ещё что-нибудь?
1:28А до этого я не знаю, там РЛЬ политики,
1:30они не были адаптивными.
1:33>> Есть максимальная адаптивность.
1:35>> Максимальная адаптивность. О'кей.
1:38Хорошо. Что, кто-нибудь ещё? ДПС Давай,
1:40короче, смотри, ребят, мы с вами будем
1:42разговаривать. Я не знаю, я буду вас
1:43мучить.
1:45>> Ага.
1:48>> О'кей.
1:50>> Да.
1:52Моделя уже достаточно большой,
1:55можно из него что-то срить.
1:57>> А ответ language модели достаточно
1:59большая область. Оттуда можно что-то
2:00тырить или О'кей. О'кей, хорошо. Ну,
2:03короче, а всё где-то рядом. Но по факту
2:07работотехники посмотрели на то, что
2:09происходит, ну, в ЛМ действительно, и
2:12такие типа: "Ого, ни фига, они данными
2:14заливают, оно работает. Может быть, мы
2:16можем что-то такое же сделать, э, и всё
2:19классно будет". Вот поэтому, да, - это
2:22банальная ставка на скелинг. Вот,
2:24[фыркает] сорри, сегодня будет много
2:25слопа на слайдах, поэтому готовьтесь. А,
2:29и банально как бы история о том, что
2:31давайте, наверное, думать по поводу
2:35того, что а как нам делают такие
2:37архитектуры, которые масштабируются от
2:39данных. Вот. А, ну и первое, что
2:42сделали, это взяли просто LLM, в LM как
2:44бы и на неё накрутили там action head и
2:47до сих пор это продолжают делать. А, и
2:49как бы вот в таком темпе давайте
2:51двигаться. Что важно, очень как бы часто
2:55путаю там, в том числе, когда про
2:56масштабирование говорят, там проитерле и
2:58всё такое, а это, короче, не значит, что
3:01не нужно архитектуру доводить ещё, да?
3:03То есть типа, да, нам нужно думать над
3:05тем, как нам собирать кучу данных, а
3:08какие данные это должны быть, а, ну и
3:11думать, собственно говоря, а как должна
3:13выглядеть архитектура под них, потому
3:15что может быть текущие там имеющиеся у
3:19нас не самые оптимальные. Вот. А
3:23давайте, кто из вас знаком с законами
3:25масштабирования?
3:26Scaling and close. Поднимите руку.
3:31Так, так, так, так, так, так. Интересно.
3:33Подождите, а, ну, сейчас я буду
3:36объяснять, [смех]
3:37а, банально, да, что в ЛМ такую штуку
3:42пронаблюдали, там шиншила, там Каплан и
3:45так далее, что с ростного масштаба
3:47ошибка падает предсказуема, и поэтому вы
3:50можете вывести небольшие законы, а, ну,
3:53они по факту являются
3:56степенными. Вот.
3:58и на основе этого обосновывать вашим,
4:00так сказать, инвесторам, что вам нужно
4:02больше денег на компьютер. Вот, и будет
4:05работать лучше. Ну, короче, да, то есть
4:07это примерно так работает. Считается это
4:10примерно так, что вы обучаете какие-то
4:12модели разных масштабов, [фыркает] а
4:14считаете изофлопы, там типа есть
4:15фиксированная формула, наносите
4:17финальный лост, там в осях вот log, у
4:20вас получаются такие вот параболки, и вы
4:23по оптимуму этих параболок просто
4:24проводите линию. И вот у вас выводится,
4:26собственно, такая линия. Аа и, ну, как
4:30бы вот тут есть такая штука, что сменила
4:32постановку вопроса с какую архитектуру
4:36придумать, насколько масштабировать. Ну,
4:38kind да и нет. Аа, ну вот, собственно,
4:42вот это вот вот так вот выглядит. А
4:46вот и как бы вывод для работотехники,
4:49что давайте делать что-то такое же, а
4:53будет супер круто работать. Вот мы
4:55сегодня посмотрим, действительно ли это
4:58так или нет. Вот. А
5:01быстро всё достаточно в как бы вышло в
5:06то, что выяснилось,
5:09что внезапно
5:11как бы масштабироваться в работотехнике
5:13гораздо сложнее по данным. Вот. Потому
5:16что, ну, интернет у вас forф, его можно
5:20было бесплатно раньше скрапить. До сих
5:22пор, наверное, можно, не знаю.
5:24Вот. А в работотехнике у вас большой
5:27мультимодальный поток. Это и картинки
5:30там, ну, как бы картинки, о'кей,
5:31картинки язык действительно дёшево. Ну,
5:33да, конкретно там типа действия про
5:35прицепция и всё такое. А, и даже,
5:38наверное, картинки там в каких-то
5:40конкретных ситуациях. Ну, это вообще-то,
5:43вообще-то дорого. У вас куча морфологий
5:45для роботов, там, для манипуляции,
5:47[фыркает]
5:48для локи. А, и вот, ну, откуда вы
5:52возьмёте эти данные?
5:55Наверное, наверное, их можно взять из
5:57видео. Можно их взять из видео.
6:03So.
6:05Так, а что из видео можно взять для
6:07работотехники?
6:13>> Ага. О'кей. А как действие не расслопить
6:16будем?
6:21Действия не действие не
6:23>> будем вкую
6:26а-э
6:27типа придумаем
6:30[смех] мы буквально придумаем действия
6:32нуквее вот этот вот типа код в кодбуке и
6:36всё
6:38так
6:40то есть то есть то есть ответ такой что
6:42типа мы взяли человеческие видео потом у
6:44нас есть какая-то волшебная бермодель
6:47которая нам может эти эти видео
6:50размапить в действие робота.
6:52>> Ну, может, я вперёд забегаю.
6:55>> О'кей. Такой модели нет, если что. Вот.
6:57Но концептуально, да, как бы
7:01в целом в в целом мысли как бы такие
7:04есть. А, о'кей, ладно. А-а, короче,
7:09концепт такой, что,
7:12э, много видосов, с ними непонятно, что
7:16делать было, особенно там в двадцать
7:17втором году.
7:18А, но как бы и они как будто бы не особо
7:22подходили для обучения там типа
7:24манипуляторов. [вздыхает][фыркает]
7:26Поэтому, собственно, начали думать, как
7:29бы,
7:31что с этим со всем делать, как это
7:32масштабировать. Там появилась куча,
7:34куча, куча, куча стартапов, которые
7:36собрали кучу, кучу кучу денег по поводу
7:38сбора данных для, а, для роботов, а,
7:42начиная от ребят, которые просто
7:45вывозили типа алохи или какие-нибудь
7:48другие манипы, а, в квартиры на Airbnb.
7:52То есть они снимали квартиры на Airbnb,
7:54[фыркает] ставили этих роботов там и как
7:56бы собирали таким образом данные. Вот. А
7:59не знаю, что с ними сейчас случилось.
8:01Вот, скорее всего, то же, что и
8:03случилось со всеми другими стартапами,
8:05которые в прошлом году побежали делать
8:08Lнвы для лмок. А, но факт остаётся
8:12фактом. Э данные вот эти с роботов, они
8:16очень дорогие. Ну, то есть прямо
8:18дорогие. Аа и вообще-то не очень
8:24понятно, как бы, а, ну, то есть логика
8:28такая была. Вот у нас, наверное, есть,
8:30мы, наверное, можем масштабироваться по
8:31данным. И все такие: "Ну да, мы,
8:33наверное, можем масштабироваться по
8:34данным". Есть ли у нас закон этих
8:35масштабированию работотехники? Нет этих
8:37законов масштабированию работотехники,
8:39но мы верим, что как бы по аналогии всё
8:42перенесётся, и поэтому мы как бы все
8:44дружно туда побежим. А дальше увидим,
8:47что что с этим произошло. Вот. А, ну да,
8:51я думаю, вам уже это рассказывали 150
8:53раз 150 раз повторят. Одна большая
8:55полюсь и на вход пикселей и слова на
8:57выходе действия. VLM backbone не
8:59обязательно VLM бэкбон. А сейчас можно
9:01делать совершенно поразному. А давайте
9:05поговорим типа о что у нас
9:07обычно в Vision там подаётся, а с точки
9:10зрения там масштабирования в том числе.
9:13А ну как бы
9:16ну все брали существующие энкодеры там
9:19типа Сиглипа Дина и Клипа. Вот, которые
9:22на вообще-то под задаче работотехники
9:24обычные никогда толком не были. Вот его
9:28часто в начале, допустим, вообще
9:29морозили, ничего с ним не делали,
9:31чуть-чуть, может быть, тюнили, а, ну,
9:34как бы по факту просто унаследовали
9:37с, ну, как бы всё, всё с usual. Вот. А,
9:41но при этом понятно, что нет ни
9:43метрической глубины, ни масштаба, ни
9:44силы, ни момента. Не умеет там типа с
9:46картинки определять тактильности,
9:49приобрецепции и так далее и тому
9:50подобное. Ну, короче, Vision Encoder,
9:52Bing Vision Encoder, в котором, который
9:54толком как бы ничего для работотехники,
9:58а, полезного не умеет. Это миллиард раз
10:00уже как бы в статьях показали, и там
10:02огромное количество работ, которые
10:04сейчас просто пытаются, а, как-то, а,
10:07visual embeded visual reasoning и вот
10:10всякие такие словечки делать. куча,
10:13куча, куча разных статей с кучей, кучей,
10:16кучей разных,
10:18а, минорных, мм, минорных как бы
10:21улучшений
10:22и движений. Но по факту всё, честно
10:25говоря, как бы врождается в то, что кто
10:28соберёт лучший датасет и его разметт под
10:31задачи, которые близки к работотехнике.
10:34Это вот как бы разговаривая там про
10:36ресarch, который можно делать, а, с
10:39влажками. В общем, вам нужно очень
10:42хорошо для себя подумать, если вы как бы
10:44хотите с этим связываться. А как бы
10:48насколько вы готовы к тому, что
10:49побеждать будут тут по большей степени
10:51ребята, которые данные намасштабировали
10:53и разобрались, как их лучше собирать? То
10:55есть вы, скорее всего, придумаете
10:56какую-нибудь новую архитектуру, и она
10:58сдохнет через, не знаю, там типа
11:01месяцдва,
11:02просто потому что там там ребята из
11:04Китая какую-нибудь лучшую архитектуру
11:05сделают, а фронтирные ребята просто
11:07скажут: "Ну, надо было данными залить, и
11:09это работает". И просто по принципу
11:11простоты, ну, вы отвалитесь,
11:14а, то есть, типа, ваша архитектура, она
11:16просто не будет никакого импакта, ну, с
11:18большой большой долей вероятности иметь.
11:21Если вы именно таким, а, форвард форвард
11:24ресерчем занимаетесь, где вы пытаетесь,
11:25ну, там, что-то придумывать новое, чтобы
11:27метрики прорезать, это, в общем, будет
11:30тяжело. А
11:33>> что-что?
11:34>> Дадада. Да, bitter lesson, буквально.
11:36Вот как там типа Сатун писал, но при
11:39этом э как бы bitter lesson bitter
11:42lessном, но если там на те же лмки
11:44смотреть, ну там тоже, я не знаю, там
11:46сейчас какой-нибудь кимика 3, он, ну,
11:47это не просто трансформер уже далеко, то
11:49есть как бы всё равно какие-то вещи они
11:51будут происходить, они будут
11:52осаживаться, но а как бы делать именно
11:57импактный ресarch в этой области
11:59достаточно сложно, если вы вы именно
12:01форвардом занимаетесь, а не обратными
12:03задачами, где вы пытаетесь понять,
12:05почему что-то работает, не работает, и
12:07как-то это объяснить нормально, но это
12:10сложно. Вот. А тактактак. А, ну, короче,
12:17да, а вот примерно что как бы
12:20приоритизирует там сейчас при тренировке
12:23там новых каких-то visionров, да? Кто-то
12:26знаете ваш такое affordances,
12:29понимает?
12:31Можно поднять руку и рассказать, если
12:32кто-то, ну, понимает, плюс-минус.
12:36Дада, да, тут написано, но вдруг типа я
12:38не знаю, как-то по-другому вы что-то
12:39понимаете.
12:43О'кей, ладно, я понял. Никто
12:46я понял. Короче, да, смысл такой, что
12:49это достаточно такой старый термин, но
12:51он по факту про то, что можно с
12:52предметом сделать. Вот. А то есть я не
12:55знаю, вы смотрите на картинку, вместо
12:57того, чтобы сказать, что это ручка, не
12:58знаю, там можно ручку на стол положить,
13:01можно ручку вставить куда-то, можно
13:03ручку с карандашом скрестить. Я не знаю,
13:05ну, то есть вот кучу кучу кучу кучу
13:07разных таких вещей. А и когда вы
13:10кэпшените, следовательно, там, э,
13:12картинки, которые у вас есть, ну,
13:13кэпшены, собственно говоря, меняются.
13:15Вот. Потому что, ну, когда вы, наверное,
13:17взаимодействуете со своим роботом, вы
13:19его просите как бы не сказать, э, как
13:22бы, а, не знаю, где где ручка или что
13:26там лежит, а сделай что-нибудь с чем-то.
13:31И поэтому нужен, ну, как бы нужна другая
13:34разметка.
13:35Вот. А вот это вот тут написано,
13:38контактцентричный признаки. Это такая
13:41спорная вещь, э, типа края, текстуры,
13:45трение, устойчивость захвата. А как бы
13:49highли это просто по-другому как-то
13:50будет решаться. И просто на винкодере
13:52это будет не, ну, типа, не нужно. Вот. А
13:56активное восприятие камеры на движущемся
13:58теле, да, факты. Все мы знаем, что в
14:01текущей текущая парадигма хреново
14:03работает out of distribution. Все же
14:06знают
14:07вот что, ну, у нас очень плохо с out of
14:12distстрибьюшном, на самом деле, по
14:14большей степени, если мы там не
14:16накручиваем какой-нибудь тест, тестлинг
14:18и так далее. То есть просто как бы,
14:20условно говоря, элмки. Почему хорошо
14:22работают чаще всего? Потому что те
14:24задачи, которые вы решаете, они не
14:25вообще не уникальные.
14:28их решал кто-то когда-то, и это в
14:31тренировочном доследкло. То есть он
14:33нормально миксует между ними, но типа по
14:36факту типа 90% деятельности, который мы
14:38делаем- это ну ничего нового. Это кто-то
14:40уже делал. А ког ну как бы с когнитивной
14:43нагрузкой то же самое. Сорри. Вот. А, а
14:47тут как бы
14:49это суперактивно, ну, это вылезает здесь
14:52суперактивно, просто потому что, а,
14:55данных именно там типа с движущихся тел,
14:58э, видосиков, там, картинок и прочего,
15:02их не настолько много, как может
15:04показаться. [фыркает] Вот.
15:06И у вас по факту vision энкоodдеры, они
15:09все у них, короче, в другую сторону.
15:13Вот. А, да. Ну, собственно говоря,
15:16ничего не масштабировали,
15:18потому что не было по факту ничего
15:20размечено, не было понятно, что это
15:21нужно делать. Сейчас как бы занимаются,
15:24ну, там типа супер разными способами. А
15:27подробно здесь мне не супер интересно
15:29останавливаться.
15:31А, о'кей. Теперь у нас язык. А что у нас
15:35с языком? А, во,
15:39вот кто кто-то здесь писал, пытался
15:43писать статьи, провела уже. Поднимите
15:45руку.
15:47Да, Егор, я знаю.
15:50А кто-то ещё? О'кей. А кто-то читал
15:53статьи ПВЛА? Там типа, я не знаю. О'кей.
15:56Больше больше десяти статей ПВЛА.
15:58Кто-нибудь читал? Один человек. Хорошо,
16:02давай. Что? Что? Что не так со статьями
16:05ПВЛА?
16:12Ага. Ну, типа, я не знаю, может, тебе
16:13что-то не понравилось, когда ты их
16:14читал, или ты когда-то ты их прочитал,
16:17потом попробовал сделать, что-то не
16:18получилось.
16:20>> Ага. Что мало практики.
16:22>> Остальное как будто норм.
16:24>> Остальное как будто нормально.
16:27Мы, наверно, микрофон, я думаю, можно не
16:29передавать. Я буду просто повторять, а
16:30то потому что нереально будет. Вот. А-а,
16:34короче, да, я у меня тут не будет
16:36слайда, но суть такая, что, э, в Ла
16:39происходит, ну, по крайней мере, там,
16:41типа в академии в Опсрсе лютый бенчма
16:44бенчмак бенчмаксинг.
16:46Лютый, просто лютейший. То есть,
16:50если вы возьмёте там типа вот этот
16:53пресловутый либера бенчмарк,
16:56там вышло одновременно куча статей про
16:58то, что если вы чуть-чуть покрутите
17:00инструкцию, вот прямо чуть-чуть, а,
17:03относительно там оригинальной, на
17:04которой обучалась, резко перестаёт
17:07работать.
17:08Ну, типа, там процентов на 30, на 40
17:10sucessсрейты падают. А, и это, ну, прямо
17:14общая болячка. Эта болячка, ну, вообще
17:17плохого, как бы, плохого бенчмаркинга в
17:19области. Это сейчас справляется. Вот там
17:20Егор, в том числе, этим занимается со
17:23своими там мемори штуками. Вот. Но как
17:27бы
17:29так и живём. Так и живём. Э, и вот тут
17:33встаёт как бы, ну, вопрос, а вот у вас
17:37есть язык, да? То есть мы же там типа
17:39vision language, да? Вот есть язык. И
17:42вместо того, чтобы, а, там передавать
17:45языковую инструкцию, которая была, аа
17:48давайте её просто заметим на
17:50какой-нибудь
17:52ID.
17:53Вот. Вот у вас были как бы инструкции
17:56языковые. Давайте теперь на айдишке
17:57поменяем. А, будь здорово. Аа что-то
18:02поменяется в перформансе модели?
18:07Ваши догадки.
18:10Всё превратится в тык.
18:11>> Всё превратится в тыкву
18:15ещё. Ну тут, да, как это понятно,
18:19короче.
18:21Ну, собственно, вот эта моя история
18:22прола с там типа языком. Не, не
18:25превратится.
18:27На бенчмарках ты можешь, короче,
18:28заменить языковые инструкции на Task ID.
18:31У тебя всё будет плюс-минус также
18:34работать, если ты берёшь вm бэкбона. А
18:37это, ну, как бы история, связанная с
18:40тем, что область просто хреново,
18:44как бы, ну, слабая методологическая
18:48культура, давайте её так назовём. Вот. А
18:50поэтому, ну, важно типа целиться там
18:54какой-нибудь out of distribution там на
18:55основе там типа бенчмарков, которых
18:56имеется. Это сложно. Вот. Потому что out
18:59of distribution, как только становится
19:01публичным, имеет тенденцию становиться
19:03in distribution. Вот. Благо, в статьях
19:06вы как бы это можете как-то пытаться
19:08контролировать, но в целом фронтирные
19:11ребята им по барабану.
19:14Вот. А, о'кей. Собственно, важный момент
19:18такой тоже, да, что типа вот есть аэ
19:22как-то два таких нарратива относительно
19:24языка. Аа, собственно, почему я почему
19:27знаки вопроса там в том числе поставил,
19:29это мы ещё будем разговаривать. Я здесь
19:34самовозки не покрываю SF driving cards,
19:36но как бы это важно. Просто очень много
19:39там, допустим, можно слышать по поводу
19:41ВЛА в автомобилях, да, и как бы там
19:44встаёт вопрос: "А зачем там язык?" Вот.
19:49А и на самом деле есть роботы, в которых
19:51тоже стоит вопрос: "А зачем там язык?
19:52Действительно ли нам нужно их стирить
19:54языком?" И вот есть, короче, э две
19:57версии по поводу того, что первое язык -
19:59это UI, да? То есть это просто то, как
20:01мы, собственно говоря, аа
20:03взаимодействуем с моделью для того,
20:06чтобы она делала, что мы хотим. Аа и
20:08есть как бы вторая, что язык - это
20:11скорее просто такой переходной мостик
20:12между вебскелингом
20:14и работотехникой, да, что вот у нас есть
20:18куча моделей, которые были натренированы
20:19на языке, аа в интернетах давайте,
20:22наверное, вот как-то всё это дело
20:25дружить. А,
20:27ну, как бы, скорее всего, просто и так,
20:30и так. Но сегодня мы посмотрим на две
20:33линейки, на линейку Galлиста и на
20:36линейку Physical Intelligence. А, и как
20:39раз обсудим там чуть-чуть, э, разницу
20:42между ними, вот
20:44в которых, ну, например,
20:46там генералист не считает, что язык, что
20:50там нужны предобученные ВЛМ и что на
20:52самом деле надо всё с нуля учить. Ну,
20:53это, в причём, да, обсудим.
20:55А, и собственно главное, третье - это,
20:58собственно, экшн, а,
21:01то есть то, как выдавать действия. И в
21:04этом, собственно, вся загвоздка. А есть
21:07три самых простых способа. Я думаю, на
21:11школе вам много раз будут рассказывать
21:14как бы там и про конкретные архитектуры,
21:16и про конкретные методы. Ну, три
21:18направления примерно плюс-минус такие
21:20большие. Это типа дискретные токены. Это
21:23просто прямая регрессия, которая, ну,
21:25как бы которую изначально выкинули,
21:26потому что у нас, вообще-то, у робота
21:28мультимодальные действия. То есть типа в
21:31одном там типа и том же
21:34обуславливаясь
21:35на одно на один и тот же инпут,
21:37вообще-то у него мультимодальное
21:38распределение как бы на выходе может
21:40быть. А
21:43как бы есть работы, которые говорят, что
21:45вообще-то, ну, нет, вообще-то пофиг. А,
21:48и поэтому вот когда вы часто видите
21:50[фыркает] аргументацию, что нужно
21:51использовать там, не знаю, фломатчинг
21:54или что-нибудь такого рода, потому что у
21:57вас мультимодальное распределение, ну,
22:00как обоснование, скорее всего, это
22:01булщит. Ну, то есть достаточно часто
22:03булшит. То есть типа вы должны себя
22:05спросить, типа, а вы показали, что это
22:07действительно как бы там мультимодальное
22:09распределение, оно как бы есть?
22:11А чаще вам скажет, что не, мы ничего не
22:13показывали, мы просто взяли фломачинг,
22:15потому что он позволяет моделировать
22:17такие вещи. И зачем нам дальше думать?
22:20Это нормальный ответ в целом, но как бы
22:24так такое [фыркает] вот. И да, и в
22:28общем, прямая регрессия иногда может
22:29типа работать. Э такое так редко делают.
22:33Ну, как бы знаю коллег как бы из
22:34компании, которые такое иногда
22:36практикуют, это типа успешно работает.
22:38Э, вот просто нужно хорошо знать свою
22:40задачу. Если говорить конкретно про
22:43как это, а, про General Robots,
22:47провела в целом для, э, как-то для любых
22:52морфологий и так далее, то вот, да, там
22:54прямая регрессия вам не подойдёт, скорее
22:56всего. Это это факт. Вот. Ну, есть там
22:57типа чанкинг. Э, там в первую очередь,
23:01чтобы всё побыстрее работало. Вот. А и в
23:04общем
23:06всё. Ну как не всё, но с двадцать
23:10второго года, с двадцать первого там
23:11года всё строилось там типа на, ну,
23:14банально как бы на имитации. У нас там
23:15есть видосики, ой, господи, у нас там
23:17есть записанные траектории с конкретными
23:19роботами. Давайте как бы всё это дело
23:21имитировать. А, ну как бы достаточно
23:25очевидным образом эволюционировало
23:28в LLM like обучение.
23:33Так, давайте про чуть-чуть чуть-чуть про
23:36поговорим. Кто-то из вас знает, как
23:38обучаются
23:39с нуля? Большие лалэмки.
23:43Поднимите руку, кто считает, что знает.
23:471 2 3 4
23:50Так, о'кей. Аа поднимите руку, кто
23:53считает, что типа ну что-то я понимаю,
23:55но в целом сам бы не сделал.
23:59[смех]
24:00Значительно больше. О'кей. А, ну вы
24:03знаете, что там есть притрейнинг фаза,
24:05потом там типа пострейн, там где-то
24:08между ещё там СФТ затисалась, куча куча
24:10разных вещей.
24:12Внимание, как вы думаете, что произошло
24:15в работотехнике?
24:18[смех] Да, как бы, в общем, произошло
24:20ровно то же самое. Ну, то есть типа люди
24:22просто движутся в ту же самую сторону,
24:23где они говорят: "Есть претрейн, а потом
24:25у нас есть пострей, а и вот мы там ещё и
24:28релим где-то. Ираль у нас имеет больше
24:31смысла, нежели чем в лмках знак вопроса.
24:36А, но как бы всё в итоге выродилось в
24:40это. И как бы, если вы знаете
24:42предпосылку там изначально вот этой
24:44области, что она строилась на том, что
24:46мы как бы хотим повторить успех лмых, то
24:49всё это достаточно предсказуемо. То
24:51есть, если вы находились там занимались
24:54ресерчем в двадцать втором-двать третьем
24:56году и видели, ну, что появляется ВЛА,
24:58который начинает обосновывать всю эту
25:00историю через
25:01ну, как бы через масштабирование,
25:03а они ещё тогда, я не помню, по-моему,
25:05тогда они ещё не назывались ВЛА, если
25:07что, то есть типа вот вы увидите, там
25:09есть типа и ещё там новый термин ВМА,
25:13world model action, да, то есть как бы
25:15модели вот это всё или World Model
25:18Action, короче, неважно. Аэ, по-моему,
25:21Никита Качаев будет рассказывать, если
25:22уже не рассказывал. По-моему, позже
25:24будет. Вот, э, и концепт такой, что вот,
25:29если вы понимали, что происходит, там,
25:31вдруг внезапно стало понятно, что
25:32ближайшая ваша жизнь как речера, ну,
25:35там, типа, на какое-то время она станет
25:37посмотри в НЛП, сделай так же. Это как
25:41бы до сих пор так происходит.
25:43Вот
25:45>> кого-то это интеллектуально развлекает в
25:48целом. Потому что тебе понятно, куда
25:50смотреть, понятно, откуда типа
25:52перебирать пространство, как есть
25:54пространство решения банальное. Ты его
25:55перебираешь потихоньку, что тебе кажется
25:57наиболее интуитивным. Но как бы в целом,
26:02по-моему, без кайфа, но как бы долго так
26:05двигались и далеко, да, двигались, на
26:07самом деле. Аа и да, в общем, самое
26:10главное там, что с самого начала
26:12говорил, проблема в том, что как бы
26:14корпуса действий, веб-масштаба не
26:16существует.
26:17А, ну как бы его не существовало, и он
26:21всё ещё не существует в тех масштабах,
26:23которые, ну, по всей видимости, нужны. А
26:25есть некоторые открытые децсеты.
26:27Открытые детасеты. В общем, история в
26:29том, что если вы хотите что-то делать с
26:30ВЛА на открытых датасетах, а, и там
26:32изучать, может быть, законы
26:33масштабирования, как это можно делать
26:35там типа сейчас с ЛМ, аа, ну, с ВЛА так
26:38делать ещё нельзя, потому что эти
26:40датасеты, они супер маленькие. И как мы
26:42дальше на слайдах увидим, для того,
26:45чтобы законы масштабирования появлялись,
26:47ну, там типа, чтобы эффекты у
26:49масштабирования появлялись, это нужно, в
26:51общем, очень много данных, много прямо.
26:55Вот. А-а,
26:57и
26:59вся проблема в том, что это тупо дорого.
27:02Тупо дорого. А-э,
27:05люди тратят какие-то сумасшедшие деньги
27:08на
27:10именно сбор данных с роботов конкретных.
27:13Аа
27:15потому что как бы это вот известно
27:18хорошо из, то есть мы, у нас есть как бы
27:19хорошо известный рецепт, что если у вас
27:21зафиксирована морфология там робота и
27:23там в целом сам робот, и вы можете а
27:26поставить телеоператора управлять этим
27:27роботом, чтобы он собирал вам данные а
27:30для решения каких-то задач. И вы можете
27:32таких данных насобирать много. В целом у
27:34вас будет плюс-минус всё работать, да?
27:36Там будет successрей не 99.999,
27:39но типа там за 90 вы в целом долезете,
27:42если очень долго этот как бы вот этот
27:45мешочек трясти. А, но просто это кучу,
27:49ну, прямо куча денег стоит, как бы.
27:51Цифры, к сожалению, там не могу
27:53говорить, но по индустрии вижу, сколько
27:55люди на это тратят. Много, прям, прямо
27:58много. А, и как бы есть примерно четыре
28:06основных таких направления по сбору
28:08данных, а, по источникам данных, да. А
28:14снизу вверх давайте начнём банально, да,
28:15типа телеоперация робота. Вот то, что я
28:17сейчас описал handхhриги. Это такие
28:21штучки, знаете, может быть на руки,
28:23допустим, вы на руку можете надеть и
28:25своей клешнёй там хватать, что-то мыть и
28:28так далее. Есть типа тоже стартапы
28:30прикольные, которые делают такого рода
28:31штуки. А, ну как бы понятно, робот на
28:35площадке здесь не нужен. Всё ещё human
28:38the loop, но это обычно только, ну, я не
28:40знаю, там типа вот
28:43рукой что-то поделать, да? А что, если у
28:45вас, я не знаю, робот гуманоид?
28:48Насколько такие данные вообще полезны
28:49для этого? А, открытая задача.
28:52Эгоцcентрик видео человека, наверное,
28:54видели.
28:55Типа весело, прикольно было на людей
28:56камеры вешают. Так вот сверху вниз и
29:00смотрят, как они что-то делают там
29:02руками.
29:04Вот это эгоцентриком называется. А
29:07проблема там в том, что видео у вас
29:11есть, но вот этого вот самого дорогого
29:14а-а, собственно, там при прицепции и
29:19самих действий нет. И вам нужно
29:21придумывать кучу разных методов
29:23ретаргетинга на вашего робота. Вот. Ну и
29:27есть четвёртое - это симуляция.
29:30Есть ребята, которые верят, что вообще
29:32не нужны никакие данные из жизни, то
29:34есть ничего вообще не нужно собирать.
29:36Можно сделать просто крутой симулятор,
29:38крутой, а и он будет, ну, как бы
29:41имитировать жизнь, и мы просто там всё
29:44обучим, а потом Ирол выпустим. Вот.
29:48А, ну а там обычно вся проблема в
29:52ВКонтакте, потому что мы не умеем до сих
29:55пор нормально моделировать контакт, а и
29:59не очень понятно. Ну как бы давайте так
30:03под нормально, я подразумеваю
30:04эмулировать его так, чтобы был хороший
30:06синтурил. Вот. То есть, э, как бы там
30:10вроде всё движется, ну, как бы даже не
30:12потихоньку, а, но,
30:15мм,
30:16давайте так. Я не фанат чистой
30:19симуляции. То есть я не верю, что мы всё
30:20в чистой симуляции как бы сделаем. Будет
30:22супер кайф. Но я скорее фанат там типа
30:25микстуры всех вот этих вот вещей.
30:27Возможно, без хнхелригов. Аа и в том
30:30числе там типа Сима. Андрей Полубаров
30:33будет завтра, по-моему, рассказывать про
30:36вла в навигации. Это когда вам нужно а
30:39маршруты строить, да. Это тоже можно как
30:41бы в ла всю историю перевести. А
30:44маршруты для роботов в смысле. И вот там
30:47симуляции, например, да, точно, the way
30:49to go. Потому что вам, ну, ничего толком
30:52моделировать, на самом деле, не надо
30:53сложного. Вот. Если хотите, короче,
30:56подробнее окунуться во всю эту историю,
30:59а, на икре Beond Teleoperation,
31:02вот, э, можно, короче, посмотреть,
31:05почитать, там много всякого интересного.
31:08Вот. М. Так.
31:12Ну, собственно, вот. А
31:16во,
31:18а есть вообще примеров [фыркает]
31:21сбора
31:23данных, ну, как бы компаний в целом, ну,
31:26то есть было модно флексить, если что,
31:28количеством данных, которые люди собрали
31:31с роботами. Вот там пифлексили, потом
31:34пришли генералисты, сказали: "Ну,
31:35смотрите, мы 500.000 часов собрали.
31:38Сначала было 270.000, а потом 500.000.
31:41А-а, у генералиста это конкретно они, в
31:46общем, они вешают датчики на людей. То
31:48есть они вешат камеру, они вешают
31:50датчики и потом делают ретаргетинг под
31:52нужной морфологии и до обучения. Мы тоже
31:55чуть подробнее поговорим. А у
31:57фронтированных моделей есть нюанс. Они
31:58не любят рассказывать, за исключением,
32:01там типа, наверное, пи, а как конкретно
32:05они что-то сделали.
32:07Вот. А что логично в целом?
32:12Вот поэтому можно там в среднем как бы
32:14догадываться, плюс-минус походить по
32:15конференциям, общаться с людьми, которые
32:17там работают, и плюс-минус как бы
32:19понимать, что происходит. А, ну суть в
32:22том, что 500.000 часов, ну, там 270.000
32:25часов даже, это, ну, как бы очень много.
32:29А-а сколько это? Ну, в общем, у них
32:33огромный флот, получается, людей делали
32:35там самые разные задачи. И причём, что
32:38важно у там генералиста, они же, ну, это
32:41не не гуманоид даже, то есть это там
32:44типа олохи, там две ручки, всё такое
32:49вот. Но они говорят, что переносятся,
32:50ну, это как бы отдельно поговорим. И в
32:52общем, суть в том, что, а, тезис такой,
32:55мол, скорость сбора - это есть ключевое
32:57преимущество. И в целом, а вот у
32:59стартапов, которые занимаются
33:00работотехникой или у компаний, которые
33:01занимаются работотехникой, основной мод
33:04- это именно там те данные, которые они
33:07собрали, а а всё остальное не особо мод.
33:11Э ну о'кей, файн. А есть
33:16разные там типа способы миксовать все
33:19эти данные, а и в том числе там типа
33:21как-то модель прокидывать. То есть,
33:25допустим, там P05 даже, когда тренились,
33:27там были там пшенинг, вербальные
33:29инструкции, саптаски, мультибоди,
33:33в общем, кучу кучу кучу кучу кучу разных
33:36вещей. Э, и по факту вот эта смесь того,
33:39как
33:41как какие данные, типа с каких
33:43источников, а телеоперация, не
33:46телеоперация и так далее, и так далее,
33:49это очень, ну, типа суперважное там типа
33:51проектное решение, которое влияет на то,
33:53сколько вы денег потратите на то, чтобы
33:55сделать робота, э, ну, то есть там типа
33:58конкретную и,
34:01а, качество потенциальное. Ну, то есть
34:04там, допустим, известный факт. Вот, если
34:06у вас есть вы решаете какой-то
34:09достаточно узкий сколп задач, э, там, не
34:13знаю, на какой-нибудь кухне, а вы, может
34:15быть, даже можете сделать симуляцию
34:17конкретную под эту кухню, либо вы можете
34:19насобирать данных с этой кухни. Аа, и
34:23вот как вам замешать все эти данные?
34:25Вот, допустим, есть известный факт, то
34:27есть всё чисто, ну, как бы симуляции
34:29больше чем 20-30%
34:31там типа в притрейн данные нельзя
34:33добавлять, потому что там начинает типа
34:34качеству падать. Вот просто как бы такое
34:36эмпирическое наблюдение, которое очень у
34:38многих повторяется. Типа оно повторяется
34:42там типа разговариваешь с ребятами из
34:44там Physical Intelligence, с ребятами из
34:45генералиста, с ребятами там типа из
34:47этого, господи, у них модель Hкса
34:49постока зовут, из Neo, из там ещё
34:52откуда-нибудь. И как бы все плюс-минус
34:54говорят одно и то же, а симуляционные
34:57данные в целом бывают полезны, но типа
35:01много нельзя. Вот. А, и давайте
35:06про фронтир поговорим. Про фронтирные
35:08модели я взял конкретно две. Это
35:12аа ген,
35:15ну, короче, компания Генералист Ген
35:17Zero. А, в общем, насколько мне
35:21известно, это единственные ребята,
35:23которые хоть как-то честно попытались
35:26построили построить clус в
35:28работотехнике. Ну, а как бы просто
35:31некому было больше этого делать,
35:32учитывая там типа скоп данных. Вот. А
35:40концепт следующий. У нас следующий
35:42график next action prediction error на
35:45валидации. А-а, и размер там типа
35:48притрей дасета от количества количества
35:51траекторий. А-а, вот примерно это кривая
35:56выглядит так. А что самое любопытное,
35:59как кривая линия, господи, 51.
36:03Ну, как бы вот они по факту сказали, да,
36:05Skilling GLS есть, типа мы все
36:08догадывались, что он есть, не было
36:09пруфа, что он есть. Вот смотрите, мы
36:11пуфаем, что он есть. И действительно
36:13размер модели типа здесь решает. А-а, и
36:17в чём прикол, что есть некоторый фазовый
36:19переход на 7Б. Ну, мы давайте так. Из-за
36:23того, что они не выложили статью, они
36:24выложили по факту только блокпост и как
36:28бы кучу размышлений в Твиттере от их
36:30инженеров. А
36:33мы не знаем, как бы, может, там просто
36:35баги какие-то. То есть он у них
36:37разошлось, потому что они там, я не
36:38знаю,
36:40снигрейтом накосячили ещё с чем его. Ну
36:42то есть типа you never know. А ну тезис
36:45у них следующий, что
36:48вот нужно до 7Б отмасштабироваться и
36:51тогда, если как бы компьютер там в
36:53зафлопах
36:55измерять всё такое, вот у вас будет всё
36:57аккуратненько падать, иначе всё будет
36:59нафиг расходиться. Вот и масштаб
37:01необходим без него, иначе притрейн не
37:03усваивается. Важно притрейн у них это не
37:08флот там типа из роботов, на которых,
37:09ну, которые там на теле оперировали, и
37:11они, ну, собственно, там его
37:13использовали, а это именно, а, господи,
37:16как его, а датчики, которые вешали на
37:19людей. Вот. Не помню то, что в Гено в
37:23Гензира уже было так или нет, но как бы
37:26про Генван сейчас тоже поговорим. Ну и
37:28да, помимо того, что там падает ошибка,
37:31предсказания,
37:33а, действия, ещё не замеряют, что это в
37:35целом на саксессрейты переносится,
37:37потому что, ну, типа, то, что падает
37:39ошибка, предсказании действий, не
37:40означает, что у вас вырастет successрей
37:42на вашей конкретной задаче. А, ну как бы
37:45они здесь говорят, ну, растёт круто. А
37:49по модели на самом деле не очень
37:51понятно, что там происходит. Есть
37:54какой-то гармоник reasoning гармонично.
37:57Вот я могу, я, ну, я для мема добавил,
37:59ну, типа гармоничное переплетение
38:00асинхронных непрерывных потоков токенов
38:03Sensing and acting. А что это значит? А
38:07кто не знает, что это значит?
38:10Егор, вот ты знаешь harmonic reasoning,
38:13а, переплетение синхронных непрерывных
38:16потоков.
38:18Дадада. Да, да. И вот все, все в
38:20Твиттере также поорали с этого. Ну, в
38:22общем, да, архитектура они не особо не
38:24раскрывает. Знаем только то, что там нет
38:25system one, system 2, да? То есть это
38:27то, например, как делают ребята из Neo,
38:29у них типа просто влэмка, которая
38:32сапкоманда отдаёт там типа на небольшую,
38:34по-моему, 50-80 млн модель. Аа тут нет,
38:38тут просто одна большая типа там влажка.
38:40Без инициализации от ВЛМ вообще тоже
38:42важно. А ребята из генералиста, они
38:44говорят, что вот влэмки там типа
38:47Спритрейн, они не нужны.
38:49Ну, то есть типа вот в лмке вот типа как
38:52вот вы обычно берёте, не надо. Для
38:54роботов надо всё с нуля тренировать. Вот
38:57у них тезис такой. Аа, о'кей. Вот. А
39:03тактактак тактак. А и да, а-э,
39:08то есть тут можно, наверное, задаться
39:09вопросом: "А как работает а обучение?"
39:13Да, то есть вот они вроде повесили на
39:16людей какие-то датчики, люди собрали
39:18[фыркает] 500.000 часов. А а как это
39:21переносится на конкретного робота?
39:24Вот на конкретного робота переносится
39:26пострейном. Вы просто это спорите для
39:27притрейна. Дальше собираете, не знаю,
39:29час на конкретном роботе того, как он
39:31выполняет какую-то задачу, и на этих
39:34данных, да, обучаете для решения этой
39:36задачи.
39:38Вот они клеймт, что там высокие
39:40successрейты. А-а, о'кей, мы им верим,
39:44а-а, вот надёжность, скорость, э, данные
39:49вот. Ну, да, и как бы хотя бы хотя бы
39:51честно говоря, что не все задачи
39:53идеально решаются.
39:55Вот. И как бы тут тезис такой, что аэ
40:00весь SF-то ставил на то, что scaling
40:02closча
40:04миллиардов была залита под это дело. И
40:07такие: "О, а, ну, типа угадали.
40:09Получается как-то как-то ЖPТ момент в
40:13работотехнике.
40:16Вот. [фыркает] И вот, наверное,
40:17наверное, это где-то вот оно что-то
40:19близкое. Вот. А посмотрим, э как бы что
40:25они дальше выкатят. В целом выглядит мм
40:29я бы не сказал, что многообещающе.
40:31Выглядит интересно, любопытно. скорее
40:33подтверждает там то, что все
40:34догадывались аа довести-то там до
40:37какого-то прода для решения каких-то
40:39реальных а продуктовых задач. Это вообще
40:41отдельная история, на самом деле. Сейчас
40:43в работостехнике все, ну не, ну все с
40:46этим страдают, а но это отдельная
40:49история. Вот. А и вторая, короче, важная
40:52линейка - это линейка Physical
40:54Intelligence. Эти ребята достаточно
40:55активно пишут,
40:58а в интернетах о том, что они делают,
41:01выкладывают принты. и публикуют их на
41:03конференциях, э-э,
41:06рассказывают, но не всегда выкладывают
41:08веса модели.
41:11Вот. А я не помню, какая там
41:140,6 не выложено, да, ещё, по-моему, или
41:17нет, 0,6 ещё не выложено. Уже есть 0,7
41:19уже есть 0,7, а 0 всё ещё как бы
41:22отсутствует. Вот. А-а, и у них, да, у
41:25них как бы ставка на то, что, ну, как бы
41:27наоборот, они говорят: "Нет, мы будем
41:28всё-таки использовать
41:30притрейны, ну, то есть уже притрейны
41:32влэмки. Просто надо
41:34докрутить рецепт вокруг всего этого дела
41:36для того, чтобы это работало, а, для
41:39роботов". И они просто вот по факту с
41:41двадцать там четвёртого года потихоньку
41:44нарешивают проблему. Что важно знать, а
41:46этот стартап как бы крут тем, ну, как бы
41:49стартапр, компания, whatever. А они
41:52круты тем, что вообще там собрались
41:55самые типа топовые ребята, которые
41:58считаются в в работотехнике, там
42:02Челсифин, давайте так. В в Эле плюс
42:04работотехники, я бы, наверное, так
42:05сформулировал, Челси Фин, а Кевин Франк
42:10и Сергей Левин. Вот. А и как бы поэтому
42:16мне хочется все сильно верят, помножить
42:17это всё на то, что там ещё, по-моему,
42:19SEO бывший какой-то чел из Страйпа. Ну,
42:21выглядит, в общем, достаточно
42:23внушительно. В общем, они много
42:26рассказывают о том, что они делают. Это
42:28можно даже плюс-минус местами когда-то
42:30воспроизводить. А-а, и сейчас, допустим,
42:35там как бы что важно, там для понимания,
42:37они про это в паблик не пишут, но это
42:39такая такой секрет полишанели для людей,
42:42которые в индустрии варятся. А, короче,
42:45работотехнических стартапов их много,
42:48которые конкретных роботов там для
42:50конкретных штук делают. А и Physical
42:52Intelligence, они говорят следующую
42:53вещь: "Мы хотим быть типа ЖP для таких
42:56стартапов". То есть вот мы просто модель
42:58как бы делаем, вы её там дальше под себя
43:00э используете. То есть, ну, генералист,
43:02да, условно говоря.
43:05Это начиналось всё так, но сейчас это
43:07немножко трансформируется. И, допустим,
43:09частые пайплайн, которые там с того, что
43:11я слышал, они проворачивают, они, а,
43:15партнёрятся с какой-нибудь компанией,
43:17потому что эта компания там выстроила
43:19пайплайна сборки каких-нибудь данных на
43:20каком-нибудь заводе или ещё где-то там
43:22для своего робота и так далее. А, и они,
43:25ну, а, типа, обучать вла модели - это
43:28дорого тоже, да? А, и вместо того, чтобы
43:31компания обучала ламо модели, они типа
43:34партнёры в формате: "Давайте вы нам
43:35будете давать свои данные, которые вы
43:37насобирали на своём роботе". А мы для
43:39вас модель пообучаем, и мы вам даже ещё
43:41типа денежку заплатим чуть-чуть. Вот что
43:43как бы люди не сделают ради того, чтобы
43:46такую большую модель построить.
43:48Генералиста, которая типа дальше везде
43:51будет приниматься, применяться и быть
43:53foundation layром. А вот, о'кей,
43:56давайте, короче, посмотрим на эти
43:57работы, что там происходит плюс-минус. А
44:00базовый рецепт, да, то есть что у нас?
44:02Интернет вm Flow Matching action expert.
44:04А все, ну как бы, а, короче, я не хотел
44:09в этой лекции вот прямо подробно
44:10архитектуры рассматривать. Просто
44:12тезисно как бы их проговорить. Вы ещё
44:15увидите все эти архитектуры по 150 раз и
44:18вообще лучше читать. А-а,
44:22банально тут backкбоone - это полигема.
44:25А дальше просто обучать FM action
44:27эксперта. данные OpenX Internetraining
44:30плюс у них свой датасет, который они
44:32отдельно собирают. Датасеты у них как бы
44:35теле, ну, типа телеоперирование.
44:37Вот с а как бы ВЛMКА 3B Action Expert
44:41был небольшой на 300 млн, э, и там
44:44сколько-то, в общем, робопла платформ.
44:46Они ещё параллельно, я не помню,
44:48по-моему, то ли в двадцать четвёртом, то
44:49ли в двадцать пятом они ещё запустили,
44:51а, Роборена, по-моему, называется,
44:52что-то такое, для того, чтобы сравнивать
44:54такого рода модели. Вот.
44:56А, в общем, это работает. Ну, то есть
45:00как бы это был хайп, если что, в своё
45:02время.
45:04Прямо лютый хайп был. То есть все очень
45:06сильно кайфанули с того, что такой
45:08простой рецепт работает, а какие
45:10результаты это всё дело показало. Плюс
45:12там типа набор людей, который всё это
45:14сделал. А, очень клёво. А дальше они
45:19пошли работать над тем, что, ну, вообще,
45:24наверное, это всё достаточно медленно и
45:27хочется делать модели работотехники.
45:30Как-то там был был такой вишен, он до
45:33сих пор существует, что вообще надо один
45:35к одному сводить обучение, ну, то есть
45:38типа архитектурно модели аа вот,
45:41собственно, там типа лалмок, влэмок и
45:44влашек. И поэтому были, ну, до сих пор
45:46продолжается много работы в сторону
45:48такинизации действий. Вот что вот вместо
45:51того, чтобы а там фэмить, давайте мы всё
45:55это дело дискритизируем вот наравне с
45:59языком. Вот. А-а,
46:02ну, как бы фаст,
46:06он там где-то примерно 10 иксов по
46:09компрессии получается, если там брать
46:11дефолтные там методы, потому что, ну,
46:12точн там хитрая, то есть там не не про
46:15не обычная компрессия, не не там типа не
46:17дефолтная компрессия, а она смотрит на
46:20то, как распределение у роботов, условно
46:21говоря, распределение действий у роботов
46:23работает и берёт эту информацию как бы
46:26для того, чтобы сжимать. Вот. [фыркает]
46:29А дальше там open world как бы
46:35котрейнинг докинули в микстуру данных
46:38там кэпшенинга, то есть там типамку
46:40дотюнивали уже вербальные инструкции,
46:43саптаскиas, визуальный граундинг. А по
46:45факту большая часть этой работы, она
46:47была про то, чтобы смесь данных
46:49докрутить. Ну все эти работы они
46:51делаются параллельно, естественно, что
46:52они как бы не непоследовательно одно с
46:54другим, но как бы это важно было
46:56достаточно очевидно. В общем, это
46:58накинуло к тому, что оно генерализуется,
47:02типа лучше.
47:04В общем, вопрос хороший, на самом деле,
47:06насколько это не демо, а действительно
47:08так вот. Аа дальше была история сed,
47:14то есть, а как бы многие, ну, есть куча
47:17работ там, в том числе в институте
47:20ребята делали про то, что когда вы
47:22обучаете вашу модель, а, действиям, она
47:26начинает затирать э там информацию про
47:30язык, ээ, э, не знаю, там, про
47:34визуальные юкссы какие-нибудь, а, и, ну,
47:37собственно, воломки начинают банально
47:38забывать, типа какие-то концепты. Вот
47:42есть куча методов по тому, как это
47:45лечить. Вот knowledge insulation - это а
47:48один из них вот с
47:52как бы там достаточно такой громозкий
47:54механизм, но как бы в общем почитать про
47:58него, чтобы там понимать одну из
47:59проблем, которая там существует в
48:00области. Она до сих пор существует и там
48:02до сих пор он всурсе там типа ребята
48:04обучают, когда модели. А, ну,
48:09в общем, забывание происходит. А дальше
48:12был RTC realтаing, да? То есть, то есть
48:16взять там типа синхронное исполнение
48:18кактинг задачу. Вот, потому что у вас
48:22существует следующая проблема сла, что,
48:25ну, как бы вы чаще всего не можете
48:28отдавать действия на той скорости, на
48:30которой работает робот, потому что
48:31модели большие, а, и у вас там есть
48:33задержки. А, поэтому нужно исхитряться
48:37со всеми этими историями. Вот тут есть
48:39такая как бы интересная интересный
48:42взгляд про то, что, наверное, это
48:44всё-такинг задача, и вокруг этого как бы
48:48всё играется. А опять же, есть миллиард
48:51других разных методов, как это можно
48:53делать. Э, но вот отсюда можно
48:55отталкиваться. А, и вот, собственно, 06
48:59- это где уже ребята подкрутили, а это
49:03как это подкрутили по факту Дагер плюс
49:07RL. Вот. А то есть у вас есть база, как
49:10бы вы стартуете на демонстрациях на
49:13имиitation лернинге, а после этого
49:17вы делаете какие-то эксперименталь, ну,
49:19типа экспертные корректировки на
49:20реальных провалах. То есть вы просто
49:21запускаете робота, он что-то делает, у
49:23него что-то не получается, человек
49:25вмешивается, доводит там типа задачу до
49:28корректной, и вы как бы эти данные
49:30используете
49:32при обучении, если как бы совсем
49:33упрещать. А, и вот этот автономный
49:36реально на своём опыте, где вы дальше
49:37просто запускаете ещё и релится, но там,
49:41честно говоря, выглядит всё тяжеловато,
49:44но как бы они утверждают, что это хорошо
49:47хорошо работает. Вот. А,
49:52ту-ту-ту-ту-ту-ту-ту.
49:53Ну, в общем, да, э, выглядит примерно
49:56так. Опять же, там, типа в других
49:58лекциях ребята на школе, ну, подробнее
50:00расскажут, как
50:01эти штуки работают, потому что их можно
50:04там типа полтора часа хоть каждую
50:05разбирать. Вот. И из последнего там из
50:09того, что capabilтис
50:12клеймы, которые новые прилетают, это
50:14что, а там у последней модели появляется
50:18какая-никакая композиционная
50:20генерализация, то есть, да, когда у вас
50:23разные вы обучали модель на этого задача
50:25А, задача B, потом попросили А + B, и
50:28это композиция там типа любого формата и
50:31или а вместе и так далее.
50:35что оно как бы начинает их решать. Вот.
50:38А, ну
50:42как бы, а давайте так, если читать
50:46статьи, которые были там пи0 пи этот вот
50:49всё, э, по тем задачам, которые они
50:52клеймили, что они тогда их решали, они
50:54тоже были композиционные. Здесь, ну,
50:57[откашливается] ну, честно говоря, в
50:59общем, в общем, я не знаю, давайте так.
51:00Моё лично, как это, моё моё ощущение от
51:03Physical Intelligence, что они, а,
51:05перехайпили в своё время, а, и теперь,
51:07а, как это under delivered, да,
51:09относительно того, что они, казалось,
51:12могут сделать. Вот. Но это всё ещё
51:15ребята, которые считаются фронтиром. И
51:17если вы как бы залетаете в Вла, а-а, или
51:21там типа следите за Вла, ну вам просто
51:22нужно их читать, следить, смотреть, как
51:24бы
51:26что они делают, потому что а этот там
51:29одни одни не из одни из немногих, кто а
51:33ну которые короче у которых высокие
51:35шансы там сделать то, что ну короче
51:38сделать, которые будут действительно там
51:40типа работать только от неё от неё
51:41ожидают. Вот. Аа, так, по-моему, у меня,
51:47э, плюс-минус, плюс-минус всё. А, вот
51:54мы можем, э, если есть желание, о
51:58чём-нибудь поговорить, я могу поотвечать
51:59на вопросы. Аэ, вот с Давайте,
52:07>> да, поднимать упало.
52:10>> Алло,
52:10>> алло.
52:11>> О, здравствуйте. О, начал работать.
52:14>> Владислав, город Долгопрудный,
52:16Московской области.
52:18Аа вопрос такой, э, вначале ты говорил
52:22про, э, то, откуда данные и понятно, что
52:25там, туда-сюда. А я вот сказал про
52:29нерослоп, что я имел в виду, это World
52:31Models. Угу.
52:33>> И про них уже что-то рассказывали, не?
52:35>> А, ну ты про них вроде бы тут не
52:37упоминал, но какое мнение по этому
52:39вопросу?
52:41И насколько ты считаешь в сравнении с
52:43тем, что есть? И и то есть как если
52:46финальная картина - это интеграция всех
52:48способов, то какое место может занимать
52:51а вот этот чудорослоб там?
52:55>> О'кей. А
52:57у меня нет, если что, понимания
52:59финальной картины того, что заработает.
53:01Если бы было, я бы не был сейчас здесь.
53:04А вот, но,
53:08короче, с моделями мира очень просто.
53:11Первое, это лютый хайп прямо сегодня.
53:15Ну, как бы лютый хайп, потому что люди
53:17такие типа: "О, нам нужны модели,
53:19которые умеют моделировать, а,
53:22происходящее вокруг нас". Потому что
53:24если они умеют это делать,
53:26следовательно, мы можем лучше понимать,
53:27что нам самим делать. Ну, конкретно там
53:29типа моделям моделям управления,
53:32да, типа всё так. Вот это действительно,
53:37скорее всего, будет так, потому что вы
53:38просто идёте по каузальной лестнице от
53:41observational данных, да, там типа
53:43interventional доfunctional. И
53:45действительно, если вы умеете делать там
53:48factual анализ с помощью ваших моделей,
53:50вы будете, скорее всего, получать
53:53более лучше работающие модели, которые
53:55используют там, в том числе эти данные.
53:58Но а эта задача гораздо сложнее, а,
54:03нежели там типа просто имитация на
54:05действиях или просто там типа под под
54:08конкретную задачу. А, не знаю, наверное,
54:12так вот Никита Качаев будет прямо много
54:14про вот последние, так сказать, Advancec
54:17в World Action моделях аа рассказывать.
54:21Я думаю, точно стоит, короче, к нему на
54:23лекцию сходить.
54:24Он что-то более путное здесь
54:27и более дельное, чем я, может сказать,
54:28потому что он в это больше, короче,
54:30погружен. Но,
54:32ну да, это как бы следующая, не
54:35следующая, наверное, текущая волна
54:37моделей
54:39для управления. Посмотрим, как она будет
54:41работать. Просто когда разговариваешь с
54:43ребятами, которые вот занимаются этим
54:46там типа dayту и обучением этих больших
54:48моделей, они стараются с первых
54:51принципов как бы рассуждать, да, и на
54:54самом деле им как бы, если с первых
54:56принципов идти, там не шибко важно, что
54:59у вас под капотом, типа влэмка или там
55:02видеомодель какая-нибудь будет. Вообще
55:04пофиг. Вот главное, чтобы лучше метрики
55:06как бы прорисовывал.
55:09Вот.
55:18Так, Кирилл, тайга Россия. В общем, э,
55:21хотел бы сразу же сказать, что Никита
55:23уже провёл свою лекцию, по-моему, ещё
55:26чуть ли неделю назад. Вот. Э, и
55:30>> я немножко не понял, э, ну, вот имеется
55:32в виду, что World Model можно
55:34использовать для того, чтобы, а,
55:36дополнительно обучать, короче, модельку.
55:38У меня такой вопрос: а можно ли
55:39использовать её для получения датасетов
55:43траекторий? В смысле, что мы просто
55:45генерим типа какое-то действие, потом
55:47смотрим, как эта картинка поменялась,
55:48типа генерим датасет. Ну вот типа что-то
55:50симуляция.
55:51>> О'кей. Аа, смотри, а такто скорее всего
55:55можно будет делать, потому что у нас
55:56есть пример, э, из игр банально с
55:59дриммером, да, что у тебя есть, ну, типа
56:02модель там дриммера, которая по факту
56:03учится, ну, по факту модель, которая
56:05учится в модели мира, а, в латентах,
56:07типа. То есть, типа, это возможно.
56:09Вопрос, насколько это возможно, типа,
56:11для роботов, скорее всего, да. Скорее
56:15всего, да, так можно будет делать. А, но
56:18тут как это будет ли пайплайн выглядеть
56:22так, что у тебя есть какая-то модель,
56:25которая генерит тебе именно синтетику, и
56:27ты на ней дообучаешься?
56:29А я не верю, что это оптимальный путь
56:32именно для обучения. То есть в латентах,
56:35скорее всего, надо будет просто учиться.
56:37А, ну то есть это просто известно,
56:39короче, изрели, что, в общем, такие вещи
56:41в латентах надо делать. Они не просто
56:43данные себе генерировать, потому что
56:45было много такого. А, ну подходы подходы
56:49будут и будет юзать. Не знаю. То есть
56:51мне мне просто концептуально вся эта
56:53история не очень шибко как-то. Я как-то
56:57с моделями мира я впервые столкнулся в
56:59семнадцатом году, когда там муж
57:01Шмитхубера
57:02вышла с с Джимми Ба, по-моему, статья,
57:05где они банально там типа там есть
57:07игрушка такая, где у тебя автомобиль,
57:10короче, по карте едет. А мы люто
57:12хайпанули в тот момент. Мы вообще там
57:14думали, как это там на там был ещё openй
57:17челлендж по Сонику. Бу. Думали, как это
57:19на Соника натянуть и всё такое. И вот
57:21как-то я тогда столкнулся с моделями
57:22мира, там что-то их пообучал, а-а, с
57:25ребятами там много про всё это думали и
57:28достаточно быстро перегорел, потому что,
57:31а, это всё по факту так или иначе model
57:33based model штуки. А model штуки очень
57:37тяжёлые в обучении вообще. То есть они
57:39разваливаются от любого чиха. И вот у
57:42меня до сих пор как бы сложилось, ну,
57:44как бы у меня до сих пор не поменялось
57:47вот это внутреннее ощущение, что эти
57:49модели разваливаются от любого чиха, но
57:50это могло уже поменяться, да? То есть
57:51просто я как бы, ну, руками руками новые
57:53модели вот эти не делал, не трогал. А, и
57:56поэтому я очень всегда опасаюсь вот этих
58:00вот штук. А, но есть нюанс такой, что
58:05как-то более теоретический. То есть,
58:08если ты говоришь, что у нас есть модель,
58:11а, вот у нас модель, которая обучилась
58:13на одном корпусе данных, да, а и мы
58:16используем эту модель для того, чтобы
58:18сгенерировать новый корпус данных,
58:20который будет полезен для другой модели,
58:22чтобы она обучилась, например, что-то
58:23делать, то ты делаешь предпосылку о
58:25твоей модели, что она каким-то образом
58:28может, ну, как бы, а, обогатить
58:33тот изначальный корпус данных, на
58:35котором она обучалась.
58:40Это, короче, на мой взгляд, спорная вещь
58:42достаточно.
58:44>> А вот по поводу латентов можно чуть
58:46уточнить? Ну, я вот про от Никиты знаю
58:49про модель Лапа. Ну вот где там
58:51буквально типа брали с каким-то гээпом
58:54кадры там с людьми и условно там
58:59Квантони ко мне, что это за действие? А,
59:01и типа вот латенты какого-то действия
59:04обучались и потом переносились. Это типа
59:06про вот это идёт речь или нет?
59:08>> Нет, а-э, это не про этой. Ну то есть
59:10как бы это, короче, оно рядом, ты
59:13можешь, ну, то есть вот эти все техники,
59:15они так или иначе могут использоваться.
59:16Я больше имел в виду историю в том, что
59:18у тебя есть модель, которая умеет тебе
59:20делать типа а форвард динамику,
59:23то есть вот прямо вот вот форвард
59:25динамика, тебе полностью как бы
59:26моделировать процесс. И у тебя вот есть
59:29вот латенты, ну, которые ты можешь,
59:30допустим, использовать как, ну, в общем,
59:32как инпуты модели для того, чтобы ты
59:34обучался. Вместо, ну, условно говоря,
59:35вот ты, у тебя есть на вход там типа
59:37state, дальше у тебя штучка какая-то
59:38сжимает, у тебя появляется латент, да, и
59:40вот модель мира, они типа стараются
59:42сделать так, чтобы они типа вот в этих
59:43латентах работали. И вместо того, чтобы
59:45потом разжимать это там типа в состояние
59:48какое-то типа, которое которое реальное,
59:50а мы говорим, что давайте наши модели
59:52учить вот в этих как бы латентах, да, то
59:56есть вместо того, чтобы типа их, ну,
59:58учить там типа в оригинальном
1:00:00стейтспейсе, потому что мы знаем, что
1:00:01когда он будет разжимать, скорее всего,
1:00:02что-то будет ну как бы не так ломаться,
1:00:04а если мы будем просто брать этот
1:00:05энкодер вот в этом пространстве
1:00:07работать, это будет лучше. Ну, то есть,
1:00:08если очень как бы отдалённо, так, ну,
1:00:11лапо,
1:00:12слушай, ну, лапо, оно же немножко
1:00:15чуть-чуть чуть-чуть всё-таки про другое.
1:00:18Оно же в первую очередь используется для
1:00:19того, чтобы как бы датасеты как бы
1:00:23[фыркает] как-то доразмечать датасеты, в
1:00:25которых действий нет.
1:00:27Вот
1:00:30оно
1:00:35>> так но там не конкретно про разметку,
1:00:37там скорее вот на предсказание этих
1:00:39латентов. Ну, короче, я вчера просто
1:00:41читал вот, что
1:00:42>> они такие: "Ну вот создадим дискретное
1:00:44пространство, которое будет типа вот за
1:00:46какие-то действия отвечать. Вот что это
1:00:48за действие будет? Ну пусть модель сама
1:00:50вытянет в них". Вот. А потом условно
1:00:53предположение, что это будет лучше
1:00:55переноситься для обучения уже на боди
1:00:57какой-то модельки типа конкретной
1:00:59работотехнической.
1:01:01>> Дада. Да. Ну то есть я об этом и говорю,
1:01:02что типа ты делаешь какой-то притрейн,
1:01:04где у тебя нету действий, типа ты
1:01:06какие-то типа латентные действия, ну то
1:01:08есть ты это как бы латентные действия
1:01:09получаешь и дальше у тебя есть датасет с
1:01:11размеченными же действиями, как бы ты,
1:01:13ну, собственно говоря, проецируешь, да?
1:01:15То есть это, э, как бы, да, так можно
1:01:17делать, но это же только это же только
1:01:19про, ну, как бы только про действие, то
1:01:21есть там есть типа в DM как бы IDM, а
1:01:24под капотом, но как-то, короче, мы ну
1:01:28типа у меня в группе мы сколько,
1:01:30полтора-д года занимались, типа late and
1:01:32action моделями буквально, то есть типа
1:01:35а ну [фыркает] мы ими перестали
1:01:38заниматься. Вот. Потому что они на самом
1:01:41деле не супер полезные для
1:01:43работотехники. Просто потому, что, ну,
1:01:46как Саша Никулин со мной поспорит, я не
1:01:48знаю, он как бы будет смотреть, не будет
1:01:50смотреть. Но а по всей видимости вот эти
1:01:54вот латентные именно
1:01:57латентные пространства, которые мы
1:01:59получаем на притрене из данных, в
1:02:00которых не было размеченных действий, не
1:02:02очень-то и нужны, когда у тебя есть
1:02:04500.000 часов, а, как бы полезных
1:02:07данных. Вот.
1:02:08>> Понял. Спасибо.
1:02:09>> Угу.
1:02:14Ещё какие-нибудь вопросы?
1:02:17Вообще любые можно, на самом деле. Как
1:02:19это?
1:02:24>> Да, здравствуйте. Вот Наполис.
1:02:27>> Вот я слышал, что в LA и в принципе в
1:02:30работо технике в основном используется
1:02:31алгоритм PPO. Почему, допустим, не
1:02:34говорится там, ну, я почти не слышал про
1:02:36использование других типа новых
1:02:38алгоритмов, типа GRPO, да, SDPO и прочих
1:02:41приколов из NLP?
1:02:44>> Ну, вообще ты можешь, короче, их
1:02:48применяют, ну, типа РПО насовывают
1:02:51только в путь. А, но вообще история
1:02:54такая, что как это, то есть есть модели,
1:02:57допустим, которые для селфдрайвинга
1:02:58применяют ГРПО, а или для роботов тоже
1:03:01применяют РПО. А, ну как бы стоит вопрос
1:03:03типа: "А а что такое Грпо?"
1:03:07>> Ну, мы считаем типа отваши относительно
1:03:11среднего по группе.
1:03:12>> Так. А, о'кей. А, ну как бы ты же
1:03:14понимаешь, что РПО - это уреза, ну, типа
1:03:16это прямо кастрированный типа ППО,
1:03:18>> да, но он как бы позволяет избавиться от
1:03:20критик модели.
1:03:21>> Ну, э как бы а как каким ограничением он
1:03:24это позволяет? Ну, типа, то есть почему
1:03:26он позволяет это сделать?
1:03:29Ну,
1:03:31в смысле, почему мы можем убрать
1:03:32критик-модель? Дададада.
1:03:34>> Ну, то, что мы adventш можем считать как
1:03:35раз-таки без критик модели. Вот
1:03:38>> так. Ну, то есть нет, за счёт чего ты
1:03:40это можешь там делать?
1:03:44>> Мм, [фыркает]
1:03:45короче, ответ такой, что это делается за
1:03:48счёт того, что ты всю цепочку твоего
1:03:50ответа, ну, то есть у тебя же как-то
1:03:53типа Грпо, насколько я помню, он же не
1:03:55на токенве не на токенвеel работает.
1:03:57Нет, ну вот DPO оно, ну вот есть
1:04:00модификация, условно,
1:04:01>> дадада, я понимаю, но эти все
1:04:03модификации они пришли, то есть короче
1:04:05вот почему почему ребята вре, господи, в
1:04:08работотехнике крутят ПPO или там типа
1:04:10дефолтные алгоритмы, потому что их
1:04:12изначально делали работотехники. То есть
1:04:13когда делался ППО, его делали под
1:04:15работотехнические задачи прямо с самого
1:04:17начала. И он, ну, как бы просто его
1:04:19лице, вот в том виде, в котором он есть,
1:04:20он прекрасно работает на
1:04:21работотехнических задачах. Ребята в
1:04:23начинают там типа своей как бы, ну,
1:04:26этими своими вещами заниматься, потому
1:04:27что когда начинаешь ПPO переносить в том
1:04:29виде, в котором он есть, или типа
1:04:30какие-то другие алгоритмы на лмные
1:04:32задачи, они не так хорошо работают, там
1:04:34типа хреново масштабируются или просто
1:04:36себя, ну, как бы плохо ведут. И там
1:04:38условный ГРПО, он там типа круто
1:04:39работает, а потому что он говорит там
1:04:41типа следующий, ну както потому что там
1:04:43типа валидное следующее предположение,
1:04:45что тебе не нужно там на токен-левеле
1:04:46как бы работать. А в задаче там типа
1:04:49работотехники, ну тебе нужно-то вот, ну
1:04:51типа у тебя задача буквально тебя вот
1:04:53каждый стейт, типа, если ты один за
1:04:54другим идёшь, у тебя токен level - это
1:04:56вот буквально состояние действия как бы
1:04:58вот, которое у тебя есть, если вот на на
1:05:01на лэмке переносить. Поэтому типа каждый
1:05:03раз я, когда вижу, когда какое-нибудь
1:05:04РПО переносит на там типа на на
1:05:07работотехнические задачи, ну ты как бы
1:05:09там типа понятно, что это как-то
1:05:14общем, давай так непонятно зачем это
1:05:16делать. Понятно, что ребята не, ну, типа
1:05:18не не занимались, короче, работотехникой
1:05:21до этого. Вот. То есть тут скорее больше
1:05:23вопрос: "А почему не САК, да? Ну, типа
1:05:27Soft actor critical алгоритм есть
1:05:28какой-нибудь, а, а не PPO. Вот. Или
1:05:32почему не AVR? Ну, вообще-то АР
1:05:33применяется, как бы. То есть там же куча
1:05:36куча разных алгоритмов. Э, когда ещё,
1:05:39ну, то есть это как бы концепт вм был
1:05:42следующий. А была область реля, была
1:05:46область там оффлайн реля, а есть там
1:05:48область метареля и так далее. Ребята там
1:05:50навыдумывали кучу разных алгоритмов, и
1:05:52чуваки из ЛМ просто начали их все
1:05:54применять потихоньку к себе. А стало
1:05:57понятно, что в тупу это всё дело не
1:05:59переносится. Нужно немножко, типа, нужно
1:06:00немножко, а сильно модифицировать эти
1:06:02алгоритмы и упрощать и там приводить
1:06:04определённые там ассампшены и как бы ну
1:06:08там типа появление того же там, не знаю,
1:06:09какого-нибудь DPO, которое, ну просто
1:06:12ребята аккуратно посмотрели на ту
1:06:13задачу, которую они решают. А там нужны
1:06:15просто вещи проще. В работотехнике тебе
1:06:18эти вещи проще не нужны. Тебе, ну тебе
1:06:20нужно вот оригинально, как это всё
1:06:22делалось, потому что это прямо делалось
1:06:23под подработику, под рабоку. Вот. Не
1:06:25знаю, ответил нет.
1:06:26>> Да, я понял. Спасибо.
1:06:27>> Угу. Кайф.
1:06:35Ещё вопросы?
1:06:42Кажется, вопросов больше нет. Всё,
1:06:43спасибо большое.