Free YouTube Transcribe

Video transcript

Владислав Куренков | Vision? Language? Action? Models

Astar Acceptman · 9,378 words · 43 min read

Want to search this transcript, jump the video from any line, or download it as TXT, SRT, or VTT?

Open in the transcript tool

Full transcript

0:23Да, всем привет. Как видите, я очень рад

0:26здесь быть в это время. Вот. Надеюсь, вы

0:29тоже.

0:30А сегодня поговорим про Вла. А на этой

0:33летней школе, я так понимаю, у нас будет

0:34дофига лекций про Вла. Уже была одна.

0:37Кто был на первой лекции ПВЛА? Поднимите

0:40руку.

0:42Суперкайф. Так, и как вам понравилось?

0:46Классно. Короче, сегодня будет, я,

0:49насколько помню, там Андрей читал, а,

0:52там достаточно такие более технические

0:54вещи. Здесь мы опять чуть будем чуть

0:56повыше разговаривать по поводу в первую

0:58очередь масштабирования и фронтира. Вот.

1:02Аа нежели чем там то, что есть в

1:04онсурсе,

1:06а чтобы вы примерно понимали, куда всё

1:08это дело движется, какие уго предпосылки

1:10были и всё такое. Первое, кто не знает

1:13основную предпосылку Вла вообще зачем

1:16зачем они как бы нужны концептуально?

1:18Чем предыдущие парадигмы не подходили?

1:22Давай

1:25>> так. А ещё что-нибудь?

1:28А до этого я не знаю, там РЛЬ политики,

1:30они не были адаптивными.

1:33>> Есть максимальная адаптивность.

1:35>> Максимальная адаптивность. О'кей.

1:38Хорошо. Что, кто-нибудь ещё? ДПС Давай,

1:40короче, смотри, ребят, мы с вами будем

1:42разговаривать. Я не знаю, я буду вас

1:43мучить.

1:45>> Ага.

1:48>> О'кей.

1:50>> Да.

1:52Моделя уже достаточно большой,

1:55можно из него что-то срить.

1:57>> А ответ language модели достаточно

1:59большая область. Оттуда можно что-то

2:00тырить или О'кей. О'кей, хорошо. Ну,

2:03короче, а всё где-то рядом. Но по факту

2:07работотехники посмотрели на то, что

2:09происходит, ну, в ЛМ действительно, и

2:12такие типа: "Ого, ни фига, они данными

2:14заливают, оно работает. Может быть, мы

2:16можем что-то такое же сделать, э, и всё

2:19классно будет". Вот поэтому, да, - это

2:22банальная ставка на скелинг. Вот,

2:24[фыркает] сорри, сегодня будет много

2:25слопа на слайдах, поэтому готовьтесь. А,

2:29и банально как бы история о том, что

2:31давайте, наверное, думать по поводу

2:35того, что а как нам делают такие

2:37архитектуры, которые масштабируются от

2:39данных. Вот. А, ну и первое, что

2:42сделали, это взяли просто LLM, в LM как

2:44бы и на неё накрутили там action head и

2:47до сих пор это продолжают делать. А, и

2:49как бы вот в таком темпе давайте

2:51двигаться. Что важно, очень как бы часто

2:55путаю там, в том числе, когда про

2:56масштабирование говорят, там проитерле и

2:58всё такое, а это, короче, не значит, что

3:01не нужно архитектуру доводить ещё, да?

3:03То есть типа, да, нам нужно думать над

3:05тем, как нам собирать кучу данных, а

3:08какие данные это должны быть, а, ну и

3:11думать, собственно говоря, а как должна

3:13выглядеть архитектура под них, потому

3:15что может быть текущие там имеющиеся у

3:19нас не самые оптимальные. Вот. А

3:23давайте, кто из вас знаком с законами

3:25масштабирования?

3:26Scaling and close. Поднимите руку.

3:31Так, так, так, так, так, так. Интересно.

3:33Подождите, а, ну, сейчас я буду

3:36объяснять, [смех]

3:37а, банально, да, что в ЛМ такую штуку

3:42пронаблюдали, там шиншила, там Каплан и

3:45так далее, что с ростного масштаба

3:47ошибка падает предсказуема, и поэтому вы

3:50можете вывести небольшие законы, а, ну,

3:53они по факту являются

3:56степенными. Вот.

3:58и на основе этого обосновывать вашим,

4:00так сказать, инвесторам, что вам нужно

4:02больше денег на компьютер. Вот, и будет

4:05работать лучше. Ну, короче, да, то есть

4:07это примерно так работает. Считается это

4:10примерно так, что вы обучаете какие-то

4:12модели разных масштабов, [фыркает] а

4:14считаете изофлопы, там типа есть

4:15фиксированная формула, наносите

4:17финальный лост, там в осях вот log, у

4:20вас получаются такие вот параболки, и вы

4:23по оптимуму этих параболок просто

4:24проводите линию. И вот у вас выводится,

4:26собственно, такая линия. Аа и, ну, как

4:30бы вот тут есть такая штука, что сменила

4:32постановку вопроса с какую архитектуру

4:36придумать, насколько масштабировать. Ну,

4:38kind да и нет. Аа, ну вот, собственно,

4:42вот это вот вот так вот выглядит. А

4:46вот и как бы вывод для работотехники,

4:49что давайте делать что-то такое же, а

4:53будет супер круто работать. Вот мы

4:55сегодня посмотрим, действительно ли это

4:58так или нет. Вот. А

5:01быстро всё достаточно в как бы вышло в

5:06то, что выяснилось,

5:09что внезапно

5:11как бы масштабироваться в работотехнике

5:13гораздо сложнее по данным. Вот. Потому

5:16что, ну, интернет у вас forф, его можно

5:20было бесплатно раньше скрапить. До сих

5:22пор, наверное, можно, не знаю.

5:24Вот. А в работотехнике у вас большой

5:27мультимодальный поток. Это и картинки

5:30там, ну, как бы картинки, о'кей,

5:31картинки язык действительно дёшево. Ну,

5:33да, конкретно там типа действия про

5:35прицепция и всё такое. А, и даже,

5:38наверное, картинки там в каких-то

5:40конкретных ситуациях. Ну, это вообще-то,

5:43вообще-то дорого. У вас куча морфологий

5:45для роботов, там, для манипуляции,

5:47[фыркает]

5:48для локи. А, и вот, ну, откуда вы

5:52возьмёте эти данные?

5:55Наверное, наверное, их можно взять из

5:57видео. Можно их взять из видео.

6:03So.

6:05Так, а что из видео можно взять для

6:07работотехники?

6:13>> Ага. О'кей. А как действие не расслопить

6:16будем?

6:21Действия не действие не

6:23>> будем вкую

6:26а-э

6:27типа придумаем

6:30[смех] мы буквально придумаем действия

6:32нуквее вот этот вот типа код в кодбуке и

6:36всё

6:38так

6:40то есть то есть то есть ответ такой что

6:42типа мы взяли человеческие видео потом у

6:44нас есть какая-то волшебная бермодель

6:47которая нам может эти эти видео

6:50размапить в действие робота.

6:52>> Ну, может, я вперёд забегаю.

6:55>> О'кей. Такой модели нет, если что. Вот.

6:57Но концептуально, да, как бы

7:01в целом в в целом мысли как бы такие

7:04есть. А, о'кей, ладно. А-а, короче,

7:09концепт такой, что,

7:12э, много видосов, с ними непонятно, что

7:16делать было, особенно там в двадцать

7:17втором году.

7:18А, но как бы и они как будто бы не особо

7:22подходили для обучения там типа

7:24манипуляторов. [вздыхает][фыркает]

7:26Поэтому, собственно, начали думать, как

7:29бы,

7:31что с этим со всем делать, как это

7:32масштабировать. Там появилась куча,

7:34куча, куча, куча стартапов, которые

7:36собрали кучу, кучу кучу денег по поводу

7:38сбора данных для, а, для роботов, а,

7:42начиная от ребят, которые просто

7:45вывозили типа алохи или какие-нибудь

7:48другие манипы, а, в квартиры на Airbnb.

7:52То есть они снимали квартиры на Airbnb,

7:54[фыркает] ставили этих роботов там и как

7:56бы собирали таким образом данные. Вот. А

7:59не знаю, что с ними сейчас случилось.

8:01Вот, скорее всего, то же, что и

8:03случилось со всеми другими стартапами,

8:05которые в прошлом году побежали делать

8:08Lнвы для лмок. А, но факт остаётся

8:12фактом. Э данные вот эти с роботов, они

8:16очень дорогие. Ну, то есть прямо

8:18дорогие. Аа и вообще-то не очень

8:24понятно, как бы, а, ну, то есть логика

8:28такая была. Вот у нас, наверное, есть,

8:30мы, наверное, можем масштабироваться по

8:31данным. И все такие: "Ну да, мы,

8:33наверное, можем масштабироваться по

8:34данным". Есть ли у нас закон этих

8:35масштабированию работотехники? Нет этих

8:37законов масштабированию работотехники,

8:39но мы верим, что как бы по аналогии всё

8:42перенесётся, и поэтому мы как бы все

8:44дружно туда побежим. А дальше увидим,

8:47что что с этим произошло. Вот. А, ну да,

8:51я думаю, вам уже это рассказывали 150

8:53раз 150 раз повторят. Одна большая

8:55полюсь и на вход пикселей и слова на

8:57выходе действия. VLM backbone не

8:59обязательно VLM бэкбон. А сейчас можно

9:01делать совершенно поразному. А давайте

9:05поговорим типа о что у нас

9:07обычно в Vision там подаётся, а с точки

9:10зрения там масштабирования в том числе.

9:13А ну как бы

9:16ну все брали существующие энкодеры там

9:19типа Сиглипа Дина и Клипа. Вот, которые

9:22на вообще-то под задаче работотехники

9:24обычные никогда толком не были. Вот его

9:28часто в начале, допустим, вообще

9:29морозили, ничего с ним не делали,

9:31чуть-чуть, может быть, тюнили, а, ну,

9:34как бы по факту просто унаследовали

9:37с, ну, как бы всё, всё с usual. Вот. А,

9:41но при этом понятно, что нет ни

9:43метрической глубины, ни масштаба, ни

9:44силы, ни момента. Не умеет там типа с

9:46картинки определять тактильности,

9:49приобрецепции и так далее и тому

9:50подобное. Ну, короче, Vision Encoder,

9:52Bing Vision Encoder, в котором, который

9:54толком как бы ничего для работотехники,

9:58а, полезного не умеет. Это миллиард раз

10:00уже как бы в статьях показали, и там

10:02огромное количество работ, которые

10:04сейчас просто пытаются, а, как-то, а,

10:07visual embeded visual reasoning и вот

10:10всякие такие словечки делать. куча,

10:13куча, куча разных статей с кучей, кучей,

10:16кучей разных,

10:18а, минорных, мм, минорных как бы

10:21улучшений

10:22и движений. Но по факту всё, честно

10:25говоря, как бы врождается в то, что кто

10:28соберёт лучший датасет и его разметт под

10:31задачи, которые близки к работотехнике.

10:34Это вот как бы разговаривая там про

10:36ресarch, который можно делать, а, с

10:39влажками. В общем, вам нужно очень

10:42хорошо для себя подумать, если вы как бы

10:44хотите с этим связываться. А как бы

10:48насколько вы готовы к тому, что

10:49побеждать будут тут по большей степени

10:51ребята, которые данные намасштабировали

10:53и разобрались, как их лучше собирать? То

10:55есть вы, скорее всего, придумаете

10:56какую-нибудь новую архитектуру, и она

10:58сдохнет через, не знаю, там типа

11:01месяцдва,

11:02просто потому что там там ребята из

11:04Китая какую-нибудь лучшую архитектуру

11:05сделают, а фронтирные ребята просто

11:07скажут: "Ну, надо было данными залить, и

11:09это работает". И просто по принципу

11:11простоты, ну, вы отвалитесь,

11:14а, то есть, типа, ваша архитектура, она

11:16просто не будет никакого импакта, ну, с

11:18большой большой долей вероятности иметь.

11:21Если вы именно таким, а, форвард форвард

11:24ресерчем занимаетесь, где вы пытаетесь,

11:25ну, там, что-то придумывать новое, чтобы

11:27метрики прорезать, это, в общем, будет

11:30тяжело. А

11:33>> что-что?

11:34>> Дадада. Да, bitter lesson, буквально.

11:36Вот как там типа Сатун писал, но при

11:39этом э как бы bitter lesson bitter

11:42lessном, но если там на те же лмки

11:44смотреть, ну там тоже, я не знаю, там

11:46сейчас какой-нибудь кимика 3, он, ну,

11:47это не просто трансформер уже далеко, то

11:49есть как бы всё равно какие-то вещи они

11:51будут происходить, они будут

11:52осаживаться, но а как бы делать именно

11:57импактный ресarch в этой области

11:59достаточно сложно, если вы вы именно

12:01форвардом занимаетесь, а не обратными

12:03задачами, где вы пытаетесь понять,

12:05почему что-то работает, не работает, и

12:07как-то это объяснить нормально, но это

12:10сложно. Вот. А тактактак. А, ну, короче,

12:17да, а вот примерно что как бы

12:20приоритизирует там сейчас при тренировке

12:23там новых каких-то visionров, да? Кто-то

12:26знаете ваш такое affordances,

12:29понимает?

12:31Можно поднять руку и рассказать, если

12:32кто-то, ну, понимает, плюс-минус.

12:36Дада, да, тут написано, но вдруг типа я

12:38не знаю, как-то по-другому вы что-то

12:39понимаете.

12:43О'кей, ладно, я понял. Никто

12:46я понял. Короче, да, смысл такой, что

12:49это достаточно такой старый термин, но

12:51он по факту про то, что можно с

12:52предметом сделать. Вот. А то есть я не

12:55знаю, вы смотрите на картинку, вместо

12:57того, чтобы сказать, что это ручка, не

12:58знаю, там можно ручку на стол положить,

13:01можно ручку вставить куда-то, можно

13:03ручку с карандашом скрестить. Я не знаю,

13:05ну, то есть вот кучу кучу кучу кучу

13:07разных таких вещей. А и когда вы

13:10кэпшените, следовательно, там, э,

13:12картинки, которые у вас есть, ну,

13:13кэпшены, собственно говоря, меняются.

13:15Вот. Потому что, ну, когда вы, наверное,

13:17взаимодействуете со своим роботом, вы

13:19его просите как бы не сказать, э, как

13:22бы, а, не знаю, где где ручка или что

13:26там лежит, а сделай что-нибудь с чем-то.

13:31И поэтому нужен, ну, как бы нужна другая

13:34разметка.

13:35Вот. А вот это вот тут написано,

13:38контактцентричный признаки. Это такая

13:41спорная вещь, э, типа края, текстуры,

13:45трение, устойчивость захвата. А как бы

13:49highли это просто по-другому как-то

13:50будет решаться. И просто на винкодере

13:52это будет не, ну, типа, не нужно. Вот. А

13:56активное восприятие камеры на движущемся

13:58теле, да, факты. Все мы знаем, что в

14:01текущей текущая парадигма хреново

14:03работает out of distribution. Все же

14:06знают

14:07вот что, ну, у нас очень плохо с out of

14:12distстрибьюшном, на самом деле, по

14:14большей степени, если мы там не

14:16накручиваем какой-нибудь тест, тестлинг

14:18и так далее. То есть просто как бы,

14:20условно говоря, элмки. Почему хорошо

14:22работают чаще всего? Потому что те

14:24задачи, которые вы решаете, они не

14:25вообще не уникальные.

14:28их решал кто-то когда-то, и это в

14:31тренировочном доследкло. То есть он

14:33нормально миксует между ними, но типа по

14:36факту типа 90% деятельности, который мы

14:38делаем- это ну ничего нового. Это кто-то

14:40уже делал. А ког ну как бы с когнитивной

14:43нагрузкой то же самое. Сорри. Вот. А, а

14:47тут как бы

14:49это суперактивно, ну, это вылезает здесь

14:52суперактивно, просто потому что, а,

14:55данных именно там типа с движущихся тел,

14:58э, видосиков, там, картинок и прочего,

15:02их не настолько много, как может

15:04показаться. [фыркает] Вот.

15:06И у вас по факту vision энкоodдеры, они

15:09все у них, короче, в другую сторону.

15:13Вот. А, да. Ну, собственно говоря,

15:16ничего не масштабировали,

15:18потому что не было по факту ничего

15:20размечено, не было понятно, что это

15:21нужно делать. Сейчас как бы занимаются,

15:24ну, там типа супер разными способами. А

15:27подробно здесь мне не супер интересно

15:29останавливаться.

15:31А, о'кей. Теперь у нас язык. А что у нас

15:35с языком? А, во,

15:39вот кто кто-то здесь писал, пытался

15:43писать статьи, провела уже. Поднимите

15:45руку.

15:47Да, Егор, я знаю.

15:50А кто-то ещё? О'кей. А кто-то читал

15:53статьи ПВЛА? Там типа, я не знаю. О'кей.

15:56Больше больше десяти статей ПВЛА.

15:58Кто-нибудь читал? Один человек. Хорошо,

16:02давай. Что? Что? Что не так со статьями

16:05ПВЛА?

16:12Ага. Ну, типа, я не знаю, может, тебе

16:13что-то не понравилось, когда ты их

16:14читал, или ты когда-то ты их прочитал,

16:17потом попробовал сделать, что-то не

16:18получилось.

16:20>> Ага. Что мало практики.

16:22>> Остальное как будто норм.

16:24>> Остальное как будто нормально.

16:27Мы, наверно, микрофон, я думаю, можно не

16:29передавать. Я буду просто повторять, а

16:30то потому что нереально будет. Вот. А-а,

16:34короче, да, я у меня тут не будет

16:36слайда, но суть такая, что, э, в Ла

16:39происходит, ну, по крайней мере, там,

16:41типа в академии в Опсрсе лютый бенчма

16:44бенчмак бенчмаксинг.

16:46Лютый, просто лютейший. То есть,

16:50если вы возьмёте там типа вот этот

16:53пресловутый либера бенчмарк,

16:56там вышло одновременно куча статей про

16:58то, что если вы чуть-чуть покрутите

17:00инструкцию, вот прямо чуть-чуть, а,

17:03относительно там оригинальной, на

17:04которой обучалась, резко перестаёт

17:07работать.

17:08Ну, типа, там процентов на 30, на 40

17:10sucessсрейты падают. А, и это, ну, прямо

17:14общая болячка. Эта болячка, ну, вообще

17:17плохого, как бы, плохого бенчмаркинга в

17:19области. Это сейчас справляется. Вот там

17:20Егор, в том числе, этим занимается со

17:23своими там мемори штуками. Вот. Но как

17:27бы

17:29так и живём. Так и живём. Э, и вот тут

17:33встаёт как бы, ну, вопрос, а вот у вас

17:37есть язык, да? То есть мы же там типа

17:39vision language, да? Вот есть язык. И

17:42вместо того, чтобы, а, там передавать

17:45языковую инструкцию, которая была, аа

17:48давайте её просто заметим на

17:50какой-нибудь

17:52ID.

17:53Вот. Вот у вас были как бы инструкции

17:56языковые. Давайте теперь на айдишке

17:57поменяем. А, будь здорово. Аа что-то

18:02поменяется в перформансе модели?

18:07Ваши догадки.

18:10Всё превратится в тык.

18:11>> Всё превратится в тыкву

18:15ещё. Ну тут, да, как это понятно,

18:19короче.

18:21Ну, собственно, вот эта моя история

18:22прола с там типа языком. Не, не

18:25превратится.

18:27На бенчмарках ты можешь, короче,

18:28заменить языковые инструкции на Task ID.

18:31У тебя всё будет плюс-минус также

18:34работать, если ты берёшь вm бэкбона. А

18:37это, ну, как бы история, связанная с

18:40тем, что область просто хреново,

18:44как бы, ну, слабая методологическая

18:48культура, давайте её так назовём. Вот. А

18:50поэтому, ну, важно типа целиться там

18:54какой-нибудь out of distribution там на

18:55основе там типа бенчмарков, которых

18:56имеется. Это сложно. Вот. Потому что out

18:59of distribution, как только становится

19:01публичным, имеет тенденцию становиться

19:03in distribution. Вот. Благо, в статьях

19:06вы как бы это можете как-то пытаться

19:08контролировать, но в целом фронтирные

19:11ребята им по барабану.

19:14Вот. А, о'кей. Собственно, важный момент

19:18такой тоже, да, что типа вот есть аэ

19:22как-то два таких нарратива относительно

19:24языка. Аа, собственно, почему я почему

19:27знаки вопроса там в том числе поставил,

19:29это мы ещё будем разговаривать. Я здесь

19:34самовозки не покрываю SF driving cards,

19:36но как бы это важно. Просто очень много

19:39там, допустим, можно слышать по поводу

19:41ВЛА в автомобилях, да, и как бы там

19:44встаёт вопрос: "А зачем там язык?" Вот.

19:49А и на самом деле есть роботы, в которых

19:51тоже стоит вопрос: "А зачем там язык?

19:52Действительно ли нам нужно их стирить

19:54языком?" И вот есть, короче, э две

19:57версии по поводу того, что первое язык -

19:59это UI, да? То есть это просто то, как

20:01мы, собственно говоря, аа

20:03взаимодействуем с моделью для того,

20:06чтобы она делала, что мы хотим. Аа и

20:08есть как бы вторая, что язык - это

20:11скорее просто такой переходной мостик

20:12между вебскелингом

20:14и работотехникой, да, что вот у нас есть

20:18куча моделей, которые были натренированы

20:19на языке, аа в интернетах давайте,

20:22наверное, вот как-то всё это дело

20:25дружить. А,

20:27ну, как бы, скорее всего, просто и так,

20:30и так. Но сегодня мы посмотрим на две

20:33линейки, на линейку Galлиста и на

20:36линейку Physical Intelligence. А, и как

20:39раз обсудим там чуть-чуть, э, разницу

20:42между ними, вот

20:44в которых, ну, например,

20:46там генералист не считает, что язык, что

20:50там нужны предобученные ВЛМ и что на

20:52самом деле надо всё с нуля учить. Ну,

20:53это, в причём, да, обсудим.

20:55А, и собственно главное, третье - это,

20:58собственно, экшн, а,

21:01то есть то, как выдавать действия. И в

21:04этом, собственно, вся загвоздка. А есть

21:07три самых простых способа. Я думаю, на

21:11школе вам много раз будут рассказывать

21:14как бы там и про конкретные архитектуры,

21:16и про конкретные методы. Ну, три

21:18направления примерно плюс-минус такие

21:20большие. Это типа дискретные токены. Это

21:23просто прямая регрессия, которая, ну,

21:25как бы которую изначально выкинули,

21:26потому что у нас, вообще-то, у робота

21:28мультимодальные действия. То есть типа в

21:31одном там типа и том же

21:34обуславливаясь

21:35на одно на один и тот же инпут,

21:37вообще-то у него мультимодальное

21:38распределение как бы на выходе может

21:40быть. А

21:43как бы есть работы, которые говорят, что

21:45вообще-то, ну, нет, вообще-то пофиг. А,

21:48и поэтому вот когда вы часто видите

21:50[фыркает] аргументацию, что нужно

21:51использовать там, не знаю, фломатчинг

21:54или что-нибудь такого рода, потому что у

21:57вас мультимодальное распределение, ну,

22:00как обоснование, скорее всего, это

22:01булщит. Ну, то есть достаточно часто

22:03булшит. То есть типа вы должны себя

22:05спросить, типа, а вы показали, что это

22:07действительно как бы там мультимодальное

22:09распределение, оно как бы есть?

22:11А чаще вам скажет, что не, мы ничего не

22:13показывали, мы просто взяли фломачинг,

22:15потому что он позволяет моделировать

22:17такие вещи. И зачем нам дальше думать?

22:20Это нормальный ответ в целом, но как бы

22:24так такое [фыркает] вот. И да, и в

22:28общем, прямая регрессия иногда может

22:29типа работать. Э такое так редко делают.

22:33Ну, как бы знаю коллег как бы из

22:34компании, которые такое иногда

22:36практикуют, это типа успешно работает.

22:38Э, вот просто нужно хорошо знать свою

22:40задачу. Если говорить конкретно про

22:43как это, а, про General Robots,

22:47провела в целом для, э, как-то для любых

22:52морфологий и так далее, то вот, да, там

22:54прямая регрессия вам не подойдёт, скорее

22:56всего. Это это факт. Вот. Ну, есть там

22:57типа чанкинг. Э, там в первую очередь,

23:01чтобы всё побыстрее работало. Вот. А и в

23:04общем

23:06всё. Ну как не всё, но с двадцать

23:10второго года, с двадцать первого там

23:11года всё строилось там типа на, ну,

23:14банально как бы на имитации. У нас там

23:15есть видосики, ой, господи, у нас там

23:17есть записанные траектории с конкретными

23:19роботами. Давайте как бы всё это дело

23:21имитировать. А, ну как бы достаточно

23:25очевидным образом эволюционировало

23:28в LLM like обучение.

23:33Так, давайте про чуть-чуть чуть-чуть про

23:36поговорим. Кто-то из вас знает, как

23:38обучаются

23:39с нуля? Большие лалэмки.

23:43Поднимите руку, кто считает, что знает.

23:471 2 3 4

23:50Так, о'кей. Аа поднимите руку, кто

23:53считает, что типа ну что-то я понимаю,

23:55но в целом сам бы не сделал.

23:59[смех]

24:00Значительно больше. О'кей. А, ну вы

24:03знаете, что там есть притрейнинг фаза,

24:05потом там типа пострейн, там где-то

24:08между ещё там СФТ затисалась, куча куча

24:10разных вещей.

24:12Внимание, как вы думаете, что произошло

24:15в работотехнике?

24:18[смех] Да, как бы, в общем, произошло

24:20ровно то же самое. Ну, то есть типа люди

24:22просто движутся в ту же самую сторону,

24:23где они говорят: "Есть претрейн, а потом

24:25у нас есть пострей, а и вот мы там ещё и

24:28релим где-то. Ираль у нас имеет больше

24:31смысла, нежели чем в лмках знак вопроса.

24:36А, но как бы всё в итоге выродилось в

24:40это. И как бы, если вы знаете

24:42предпосылку там изначально вот этой

24:44области, что она строилась на том, что

24:46мы как бы хотим повторить успех лмых, то

24:49всё это достаточно предсказуемо. То

24:51есть, если вы находились там занимались

24:54ресерчем в двадцать втором-двать третьем

24:56году и видели, ну, что появляется ВЛА,

24:58который начинает обосновывать всю эту

25:00историю через

25:01ну, как бы через масштабирование,

25:03а они ещё тогда, я не помню, по-моему,

25:05тогда они ещё не назывались ВЛА, если

25:07что, то есть типа вот вы увидите, там

25:09есть типа и ещё там новый термин ВМА,

25:13world model action, да, то есть как бы

25:15модели вот это всё или World Model

25:18Action, короче, неважно. Аэ, по-моему,

25:21Никита Качаев будет рассказывать, если

25:22уже не рассказывал. По-моему, позже

25:24будет. Вот, э, и концепт такой, что вот,

25:29если вы понимали, что происходит, там,

25:31вдруг внезапно стало понятно, что

25:32ближайшая ваша жизнь как речера, ну,

25:35там, типа, на какое-то время она станет

25:37посмотри в НЛП, сделай так же. Это как

25:41бы до сих пор так происходит.

25:43Вот

25:45>> кого-то это интеллектуально развлекает в

25:48целом. Потому что тебе понятно, куда

25:50смотреть, понятно, откуда типа

25:52перебирать пространство, как есть

25:54пространство решения банальное. Ты его

25:55перебираешь потихоньку, что тебе кажется

25:57наиболее интуитивным. Но как бы в целом,

26:02по-моему, без кайфа, но как бы долго так

26:05двигались и далеко, да, двигались, на

26:07самом деле. Аа и да, в общем, самое

26:10главное там, что с самого начала

26:12говорил, проблема в том, что как бы

26:14корпуса действий, веб-масштаба не

26:16существует.

26:17А, ну как бы его не существовало, и он

26:21всё ещё не существует в тех масштабах,

26:23которые, ну, по всей видимости, нужны. А

26:25есть некоторые открытые децсеты.

26:27Открытые детасеты. В общем, история в

26:29том, что если вы хотите что-то делать с

26:30ВЛА на открытых датасетах, а, и там

26:32изучать, может быть, законы

26:33масштабирования, как это можно делать

26:35там типа сейчас с ЛМ, аа, ну, с ВЛА так

26:38делать ещё нельзя, потому что эти

26:40датасеты, они супер маленькие. И как мы

26:42дальше на слайдах увидим, для того,

26:45чтобы законы масштабирования появлялись,

26:47ну, там типа, чтобы эффекты у

26:49масштабирования появлялись, это нужно, в

26:51общем, очень много данных, много прямо.

26:55Вот. А-а,

26:57и

26:59вся проблема в том, что это тупо дорого.

27:02Тупо дорого. А-э,

27:05люди тратят какие-то сумасшедшие деньги

27:08на

27:10именно сбор данных с роботов конкретных.

27:13Аа

27:15потому что как бы это вот известно

27:18хорошо из, то есть мы, у нас есть как бы

27:19хорошо известный рецепт, что если у вас

27:21зафиксирована морфология там робота и

27:23там в целом сам робот, и вы можете а

27:26поставить телеоператора управлять этим

27:27роботом, чтобы он собирал вам данные а

27:30для решения каких-то задач. И вы можете

27:32таких данных насобирать много. В целом у

27:34вас будет плюс-минус всё работать, да?

27:36Там будет successрей не 99.999,

27:39но типа там за 90 вы в целом долезете,

27:42если очень долго этот как бы вот этот

27:45мешочек трясти. А, но просто это кучу,

27:49ну, прямо куча денег стоит, как бы.

27:51Цифры, к сожалению, там не могу

27:53говорить, но по индустрии вижу, сколько

27:55люди на это тратят. Много, прям, прямо

27:58много. А, и как бы есть примерно четыре

28:06основных таких направления по сбору

28:08данных, а, по источникам данных, да. А

28:14снизу вверх давайте начнём банально, да,

28:15типа телеоперация робота. Вот то, что я

28:17сейчас описал handхhриги. Это такие

28:21штучки, знаете, может быть на руки,

28:23допустим, вы на руку можете надеть и

28:25своей клешнёй там хватать, что-то мыть и

28:28так далее. Есть типа тоже стартапы

28:30прикольные, которые делают такого рода

28:31штуки. А, ну как бы понятно, робот на

28:35площадке здесь не нужен. Всё ещё human

28:38the loop, но это обычно только, ну, я не

28:40знаю, там типа вот

28:43рукой что-то поделать, да? А что, если у

28:45вас, я не знаю, робот гуманоид?

28:48Насколько такие данные вообще полезны

28:49для этого? А, открытая задача.

28:52Эгоцcентрик видео человека, наверное,

28:54видели.

28:55Типа весело, прикольно было на людей

28:56камеры вешают. Так вот сверху вниз и

29:00смотрят, как они что-то делают там

29:02руками.

29:04Вот это эгоцентриком называется. А

29:07проблема там в том, что видео у вас

29:11есть, но вот этого вот самого дорогого

29:14а-а, собственно, там при прицепции и

29:19самих действий нет. И вам нужно

29:21придумывать кучу разных методов

29:23ретаргетинга на вашего робота. Вот. Ну и

29:27есть четвёртое - это симуляция.

29:30Есть ребята, которые верят, что вообще

29:32не нужны никакие данные из жизни, то

29:34есть ничего вообще не нужно собирать.

29:36Можно сделать просто крутой симулятор,

29:38крутой, а и он будет, ну, как бы

29:41имитировать жизнь, и мы просто там всё

29:44обучим, а потом Ирол выпустим. Вот.

29:48А, ну а там обычно вся проблема в

29:52ВКонтакте, потому что мы не умеем до сих

29:55пор нормально моделировать контакт, а и

29:59не очень понятно. Ну как бы давайте так

30:03под нормально, я подразумеваю

30:04эмулировать его так, чтобы был хороший

30:06синтурил. Вот. То есть, э, как бы там

30:10вроде всё движется, ну, как бы даже не

30:12потихоньку, а, но,

30:15мм,

30:16давайте так. Я не фанат чистой

30:19симуляции. То есть я не верю, что мы всё

30:20в чистой симуляции как бы сделаем. Будет

30:22супер кайф. Но я скорее фанат там типа

30:25микстуры всех вот этих вот вещей.

30:27Возможно, без хнхелригов. Аа и в том

30:30числе там типа Сима. Андрей Полубаров

30:33будет завтра, по-моему, рассказывать про

30:36вла в навигации. Это когда вам нужно а

30:39маршруты строить, да. Это тоже можно как

30:41бы в ла всю историю перевести. А

30:44маршруты для роботов в смысле. И вот там

30:47симуляции, например, да, точно, the way

30:49to go. Потому что вам, ну, ничего толком

30:52моделировать, на самом деле, не надо

30:53сложного. Вот. Если хотите, короче,

30:56подробнее окунуться во всю эту историю,

30:59а, на икре Beond Teleoperation,

31:02вот, э, можно, короче, посмотреть,

31:05почитать, там много всякого интересного.

31:08Вот. М. Так.

31:12Ну, собственно, вот. А

31:16во,

31:18а есть вообще примеров [фыркает]

31:21сбора

31:23данных, ну, как бы компаний в целом, ну,

31:26то есть было модно флексить, если что,

31:28количеством данных, которые люди собрали

31:31с роботами. Вот там пифлексили, потом

31:34пришли генералисты, сказали: "Ну,

31:35смотрите, мы 500.000 часов собрали.

31:38Сначала было 270.000, а потом 500.000.

31:41А-а, у генералиста это конкретно они, в

31:46общем, они вешают датчики на людей. То

31:48есть они вешат камеру, они вешают

31:50датчики и потом делают ретаргетинг под

31:52нужной морфологии и до обучения. Мы тоже

31:55чуть подробнее поговорим. А у

31:57фронтированных моделей есть нюанс. Они

31:58не любят рассказывать, за исключением,

32:01там типа, наверное, пи, а как конкретно

32:05они что-то сделали.

32:07Вот. А что логично в целом?

32:12Вот поэтому можно там в среднем как бы

32:14догадываться, плюс-минус походить по

32:15конференциям, общаться с людьми, которые

32:17там работают, и плюс-минус как бы

32:19понимать, что происходит. А, ну суть в

32:22том, что 500.000 часов, ну, там 270.000

32:25часов даже, это, ну, как бы очень много.

32:29А-а сколько это? Ну, в общем, у них

32:33огромный флот, получается, людей делали

32:35там самые разные задачи. И причём, что

32:38важно у там генералиста, они же, ну, это

32:41не не гуманоид даже, то есть это там

32:44типа олохи, там две ручки, всё такое

32:49вот. Но они говорят, что переносятся,

32:50ну, это как бы отдельно поговорим. И в

32:52общем, суть в том, что, а, тезис такой,

32:55мол, скорость сбора - это есть ключевое

32:57преимущество. И в целом, а вот у

32:59стартапов, которые занимаются

33:00работотехникой или у компаний, которые

33:01занимаются работотехникой, основной мод

33:04- это именно там те данные, которые они

33:07собрали, а а всё остальное не особо мод.

33:11Э ну о'кей, файн. А есть

33:16разные там типа способы миксовать все

33:19эти данные, а и в том числе там типа

33:21как-то модель прокидывать. То есть,

33:25допустим, там P05 даже, когда тренились,

33:27там были там пшенинг, вербальные

33:29инструкции, саптаски, мультибоди,

33:33в общем, кучу кучу кучу кучу кучу разных

33:36вещей. Э, и по факту вот эта смесь того,

33:39как

33:41как какие данные, типа с каких

33:43источников, а телеоперация, не

33:46телеоперация и так далее, и так далее,

33:49это очень, ну, типа суперважное там типа

33:51проектное решение, которое влияет на то,

33:53сколько вы денег потратите на то, чтобы

33:55сделать робота, э, ну, то есть там типа

33:58конкретную и,

34:01а, качество потенциальное. Ну, то есть

34:04там, допустим, известный факт. Вот, если

34:06у вас есть вы решаете какой-то

34:09достаточно узкий сколп задач, э, там, не

34:13знаю, на какой-нибудь кухне, а вы, может

34:15быть, даже можете сделать симуляцию

34:17конкретную под эту кухню, либо вы можете

34:19насобирать данных с этой кухни. Аа, и

34:23вот как вам замешать все эти данные?

34:25Вот, допустим, есть известный факт, то

34:27есть всё чисто, ну, как бы симуляции

34:29больше чем 20-30%

34:31там типа в притрейн данные нельзя

34:33добавлять, потому что там начинает типа

34:34качеству падать. Вот просто как бы такое

34:36эмпирическое наблюдение, которое очень у

34:38многих повторяется. Типа оно повторяется

34:42там типа разговариваешь с ребятами из

34:44там Physical Intelligence, с ребятами из

34:45генералиста, с ребятами там типа из

34:47этого, господи, у них модель Hкса

34:49постока зовут, из Neo, из там ещё

34:52откуда-нибудь. И как бы все плюс-минус

34:54говорят одно и то же, а симуляционные

34:57данные в целом бывают полезны, но типа

35:01много нельзя. Вот. А, и давайте

35:06про фронтир поговорим. Про фронтирные

35:08модели я взял конкретно две. Это

35:12аа ген,

35:15ну, короче, компания Генералист Ген

35:17Zero. А, в общем, насколько мне

35:21известно, это единственные ребята,

35:23которые хоть как-то честно попытались

35:26построили построить clус в

35:28работотехнике. Ну, а как бы просто

35:31некому было больше этого делать,

35:32учитывая там типа скоп данных. Вот. А

35:40концепт следующий. У нас следующий

35:42график next action prediction error на

35:45валидации. А-а, и размер там типа

35:48притрей дасета от количества количества

35:51траекторий. А-а, вот примерно это кривая

35:56выглядит так. А что самое любопытное,

35:59как кривая линия, господи, 51.

36:03Ну, как бы вот они по факту сказали, да,

36:05Skilling GLS есть, типа мы все

36:08догадывались, что он есть, не было

36:09пруфа, что он есть. Вот смотрите, мы

36:11пуфаем, что он есть. И действительно

36:13размер модели типа здесь решает. А-а, и

36:17в чём прикол, что есть некоторый фазовый

36:19переход на 7Б. Ну, мы давайте так. Из-за

36:23того, что они не выложили статью, они

36:24выложили по факту только блокпост и как

36:28бы кучу размышлений в Твиттере от их

36:30инженеров. А

36:33мы не знаем, как бы, может, там просто

36:35баги какие-то. То есть он у них

36:37разошлось, потому что они там, я не

36:38знаю,

36:40снигрейтом накосячили ещё с чем его. Ну

36:42то есть типа you never know. А ну тезис

36:45у них следующий, что

36:48вот нужно до 7Б отмасштабироваться и

36:51тогда, если как бы компьютер там в

36:53зафлопах

36:55измерять всё такое, вот у вас будет всё

36:57аккуратненько падать, иначе всё будет

36:59нафиг расходиться. Вот и масштаб

37:01необходим без него, иначе притрейн не

37:03усваивается. Важно притрейн у них это не

37:08флот там типа из роботов, на которых,

37:09ну, которые там на теле оперировали, и

37:11они, ну, собственно, там его

37:13использовали, а это именно, а, господи,

37:16как его, а датчики, которые вешали на

37:19людей. Вот. Не помню то, что в Гено в

37:23Гензира уже было так или нет, но как бы

37:26про Генван сейчас тоже поговорим. Ну и

37:28да, помимо того, что там падает ошибка,

37:31предсказания,

37:33а, действия, ещё не замеряют, что это в

37:35целом на саксессрейты переносится,

37:37потому что, ну, типа, то, что падает

37:39ошибка, предсказании действий, не

37:40означает, что у вас вырастет successрей

37:42на вашей конкретной задаче. А, ну как бы

37:45они здесь говорят, ну, растёт круто. А

37:49по модели на самом деле не очень

37:51понятно, что там происходит. Есть

37:54какой-то гармоник reasoning гармонично.

37:57Вот я могу, я, ну, я для мема добавил,

37:59ну, типа гармоничное переплетение

38:00асинхронных непрерывных потоков токенов

38:03Sensing and acting. А что это значит? А

38:07кто не знает, что это значит?

38:10Егор, вот ты знаешь harmonic reasoning,

38:13а, переплетение синхронных непрерывных

38:16потоков.

38:18Дадада. Да, да. И вот все, все в

38:20Твиттере также поорали с этого. Ну, в

38:22общем, да, архитектура они не особо не

38:24раскрывает. Знаем только то, что там нет

38:25system one, system 2, да? То есть это

38:27то, например, как делают ребята из Neo,

38:29у них типа просто влэмка, которая

38:32сапкоманда отдаёт там типа на небольшую,

38:34по-моему, 50-80 млн модель. Аа тут нет,

38:38тут просто одна большая типа там влажка.

38:40Без инициализации от ВЛМ вообще тоже

38:42важно. А ребята из генералиста, они

38:44говорят, что вот влэмки там типа

38:47Спритрейн, они не нужны.

38:49Ну, то есть типа вот в лмке вот типа как

38:52вот вы обычно берёте, не надо. Для

38:54роботов надо всё с нуля тренировать. Вот

38:57у них тезис такой. Аа, о'кей. Вот. А

39:03тактактак тактак. А и да, а-э,

39:08то есть тут можно, наверное, задаться

39:09вопросом: "А как работает а обучение?"

39:13Да, то есть вот они вроде повесили на

39:16людей какие-то датчики, люди собрали

39:18[фыркает] 500.000 часов. А а как это

39:21переносится на конкретного робота?

39:24Вот на конкретного робота переносится

39:26пострейном. Вы просто это спорите для

39:27притрейна. Дальше собираете, не знаю,

39:29час на конкретном роботе того, как он

39:31выполняет какую-то задачу, и на этих

39:34данных, да, обучаете для решения этой

39:36задачи.

39:38Вот они клеймт, что там высокие

39:40successрейты. А-а, о'кей, мы им верим,

39:44а-а, вот надёжность, скорость, э, данные

39:49вот. Ну, да, и как бы хотя бы хотя бы

39:51честно говоря, что не все задачи

39:53идеально решаются.

39:55Вот. И как бы тут тезис такой, что аэ

40:00весь SF-то ставил на то, что scaling

40:02closча

40:04миллиардов была залита под это дело. И

40:07такие: "О, а, ну, типа угадали.

40:09Получается как-то как-то ЖPТ момент в

40:13работотехнике.

40:16Вот. [фыркает] И вот, наверное,

40:17наверное, это где-то вот оно что-то

40:19близкое. Вот. А посмотрим, э как бы что

40:25они дальше выкатят. В целом выглядит мм

40:29я бы не сказал, что многообещающе.

40:31Выглядит интересно, любопытно. скорее

40:33подтверждает там то, что все

40:34догадывались аа довести-то там до

40:37какого-то прода для решения каких-то

40:39реальных а продуктовых задач. Это вообще

40:41отдельная история, на самом деле. Сейчас

40:43в работостехнике все, ну не, ну все с

40:46этим страдают, а но это отдельная

40:49история. Вот. А и вторая, короче, важная

40:52линейка - это линейка Physical

40:54Intelligence. Эти ребята достаточно

40:55активно пишут,

40:58а в интернетах о том, что они делают,

41:01выкладывают принты. и публикуют их на

41:03конференциях, э-э,

41:06рассказывают, но не всегда выкладывают

41:08веса модели.

41:11Вот. А я не помню, какая там

41:140,6 не выложено, да, ещё, по-моему, или

41:17нет, 0,6 ещё не выложено. Уже есть 0,7

41:19уже есть 0,7, а 0 всё ещё как бы

41:22отсутствует. Вот. А-а, и у них, да, у

41:25них как бы ставка на то, что, ну, как бы

41:27наоборот, они говорят: "Нет, мы будем

41:28всё-таки использовать

41:30притрейны, ну, то есть уже притрейны

41:32влэмки. Просто надо

41:34докрутить рецепт вокруг всего этого дела

41:36для того, чтобы это работало, а, для

41:39роботов". И они просто вот по факту с

41:41двадцать там четвёртого года потихоньку

41:44нарешивают проблему. Что важно знать, а

41:46этот стартап как бы крут тем, ну, как бы

41:49стартапр, компания, whatever. А они

41:52круты тем, что вообще там собрались

41:55самые типа топовые ребята, которые

41:58считаются в в работотехнике, там

42:02Челсифин, давайте так. В в Эле плюс

42:04работотехники, я бы, наверное, так

42:05сформулировал, Челси Фин, а Кевин Франк

42:10и Сергей Левин. Вот. А и как бы поэтому

42:16мне хочется все сильно верят, помножить

42:17это всё на то, что там ещё, по-моему,

42:19SEO бывший какой-то чел из Страйпа. Ну,

42:21выглядит, в общем, достаточно

42:23внушительно. В общем, они много

42:26рассказывают о том, что они делают. Это

42:28можно даже плюс-минус местами когда-то

42:30воспроизводить. А-а, и сейчас, допустим,

42:35там как бы что важно, там для понимания,

42:37они про это в паблик не пишут, но это

42:39такая такой секрет полишанели для людей,

42:42которые в индустрии варятся. А, короче,

42:45работотехнических стартапов их много,

42:48которые конкретных роботов там для

42:50конкретных штук делают. А и Physical

42:52Intelligence, они говорят следующую

42:53вещь: "Мы хотим быть типа ЖP для таких

42:56стартапов". То есть вот мы просто модель

42:58как бы делаем, вы её там дальше под себя

43:00э используете. То есть, ну, генералист,

43:02да, условно говоря.

43:05Это начиналось всё так, но сейчас это

43:07немножко трансформируется. И, допустим,

43:09частые пайплайн, которые там с того, что

43:11я слышал, они проворачивают, они, а,

43:15партнёрятся с какой-нибудь компанией,

43:17потому что эта компания там выстроила

43:19пайплайна сборки каких-нибудь данных на

43:20каком-нибудь заводе или ещё где-то там

43:22для своего робота и так далее. А, и они,

43:25ну, а, типа, обучать вла модели - это

43:28дорого тоже, да? А, и вместо того, чтобы

43:31компания обучала ламо модели, они типа

43:34партнёры в формате: "Давайте вы нам

43:35будете давать свои данные, которые вы

43:37насобирали на своём роботе". А мы для

43:39вас модель пообучаем, и мы вам даже ещё

43:41типа денежку заплатим чуть-чуть. Вот что

43:43как бы люди не сделают ради того, чтобы

43:46такую большую модель построить.

43:48Генералиста, которая типа дальше везде

43:51будет приниматься, применяться и быть

43:53foundation layром. А вот, о'кей,

43:56давайте, короче, посмотрим на эти

43:57работы, что там происходит плюс-минус. А

44:00базовый рецепт, да, то есть что у нас?

44:02Интернет вm Flow Matching action expert.

44:04А все, ну как бы, а, короче, я не хотел

44:09в этой лекции вот прямо подробно

44:10архитектуры рассматривать. Просто

44:12тезисно как бы их проговорить. Вы ещё

44:15увидите все эти архитектуры по 150 раз и

44:18вообще лучше читать. А-а,

44:22банально тут backкбоone - это полигема.

44:25А дальше просто обучать FM action

44:27эксперта. данные OpenX Internetraining

44:30плюс у них свой датасет, который они

44:32отдельно собирают. Датасеты у них как бы

44:35теле, ну, типа телеоперирование.

44:37Вот с а как бы ВЛMКА 3B Action Expert

44:41был небольшой на 300 млн, э, и там

44:44сколько-то, в общем, робопла платформ.

44:46Они ещё параллельно, я не помню,

44:48по-моему, то ли в двадцать четвёртом, то

44:49ли в двадцать пятом они ещё запустили,

44:51а, Роборена, по-моему, называется,

44:52что-то такое, для того, чтобы сравнивать

44:54такого рода модели. Вот.

44:56А, в общем, это работает. Ну, то есть

45:00как бы это был хайп, если что, в своё

45:02время.

45:04Прямо лютый хайп был. То есть все очень

45:06сильно кайфанули с того, что такой

45:08простой рецепт работает, а какие

45:10результаты это всё дело показало. Плюс

45:12там типа набор людей, который всё это

45:14сделал. А, очень клёво. А дальше они

45:19пошли работать над тем, что, ну, вообще,

45:24наверное, это всё достаточно медленно и

45:27хочется делать модели работотехники.

45:30Как-то там был был такой вишен, он до

45:33сих пор существует, что вообще надо один

45:35к одному сводить обучение, ну, то есть

45:38типа архитектурно модели аа вот,

45:41собственно, там типа лалмок, влэмок и

45:44влашек. И поэтому были, ну, до сих пор

45:46продолжается много работы в сторону

45:48такинизации действий. Вот что вот вместо

45:51того, чтобы а там фэмить, давайте мы всё

45:55это дело дискритизируем вот наравне с

45:59языком. Вот. А-а,

46:02ну, как бы фаст,

46:06он там где-то примерно 10 иксов по

46:09компрессии получается, если там брать

46:11дефолтные там методы, потому что, ну,

46:12точн там хитрая, то есть там не не про

46:15не обычная компрессия, не не там типа не

46:17дефолтная компрессия, а она смотрит на

46:20то, как распределение у роботов, условно

46:21говоря, распределение действий у роботов

46:23работает и берёт эту информацию как бы

46:26для того, чтобы сжимать. Вот. [фыркает]

46:29А дальше там open world как бы

46:35котрейнинг докинули в микстуру данных

46:38там кэпшенинга, то есть там типамку

46:40дотюнивали уже вербальные инструкции,

46:43саптаскиas, визуальный граундинг. А по

46:45факту большая часть этой работы, она

46:47была про то, чтобы смесь данных

46:49докрутить. Ну все эти работы они

46:51делаются параллельно, естественно, что

46:52они как бы не непоследовательно одно с

46:54другим, но как бы это важно было

46:56достаточно очевидно. В общем, это

46:58накинуло к тому, что оно генерализуется,

47:02типа лучше.

47:04В общем, вопрос хороший, на самом деле,

47:06насколько это не демо, а действительно

47:08так вот. Аа дальше была история сed,

47:14то есть, а как бы многие, ну, есть куча

47:17работ там, в том числе в институте

47:20ребята делали про то, что когда вы

47:22обучаете вашу модель, а, действиям, она

47:26начинает затирать э там информацию про

47:30язык, ээ, э, не знаю, там, про

47:34визуальные юкссы какие-нибудь, а, и, ну,

47:37собственно, воломки начинают банально

47:38забывать, типа какие-то концепты. Вот

47:42есть куча методов по тому, как это

47:45лечить. Вот knowledge insulation - это а

47:48один из них вот с

47:52как бы там достаточно такой громозкий

47:54механизм, но как бы в общем почитать про

47:58него, чтобы там понимать одну из

47:59проблем, которая там существует в

48:00области. Она до сих пор существует и там

48:02до сих пор он всурсе там типа ребята

48:04обучают, когда модели. А, ну,

48:09в общем, забывание происходит. А дальше

48:12был RTC realтаing, да? То есть, то есть

48:16взять там типа синхронное исполнение

48:18кактинг задачу. Вот, потому что у вас

48:22существует следующая проблема сла, что,

48:25ну, как бы вы чаще всего не можете

48:28отдавать действия на той скорости, на

48:30которой работает робот, потому что

48:31модели большие, а, и у вас там есть

48:33задержки. А, поэтому нужно исхитряться

48:37со всеми этими историями. Вот тут есть

48:39такая как бы интересная интересный

48:42взгляд про то, что, наверное, это

48:44всё-такинг задача, и вокруг этого как бы

48:48всё играется. А опять же, есть миллиард

48:51других разных методов, как это можно

48:53делать. Э, но вот отсюда можно

48:55отталкиваться. А, и вот, собственно, 06

48:59- это где уже ребята подкрутили, а это

49:03как это подкрутили по факту Дагер плюс

49:07RL. Вот. А то есть у вас есть база, как

49:10бы вы стартуете на демонстрациях на

49:13имиitation лернинге, а после этого

49:17вы делаете какие-то эксперименталь, ну,

49:19типа экспертные корректировки на

49:20реальных провалах. То есть вы просто

49:21запускаете робота, он что-то делает, у

49:23него что-то не получается, человек

49:25вмешивается, доводит там типа задачу до

49:28корректной, и вы как бы эти данные

49:30используете

49:32при обучении, если как бы совсем

49:33упрещать. А, и вот этот автономный

49:36реально на своём опыте, где вы дальше

49:37просто запускаете ещё и релится, но там,

49:41честно говоря, выглядит всё тяжеловато,

49:44но как бы они утверждают, что это хорошо

49:47хорошо работает. Вот. А,

49:52ту-ту-ту-ту-ту-ту-ту.

49:53Ну, в общем, да, э, выглядит примерно

49:56так. Опять же, там, типа в других

49:58лекциях ребята на школе, ну, подробнее

50:00расскажут, как

50:01эти штуки работают, потому что их можно

50:04там типа полтора часа хоть каждую

50:05разбирать. Вот. И из последнего там из

50:09того, что capabilтис

50:12клеймы, которые новые прилетают, это

50:14что, а там у последней модели появляется

50:18какая-никакая композиционная

50:20генерализация, то есть, да, когда у вас

50:23разные вы обучали модель на этого задача

50:25А, задача B, потом попросили А + B, и

50:28это композиция там типа любого формата и

50:31или а вместе и так далее.

50:35что оно как бы начинает их решать. Вот.

50:38А, ну

50:42как бы, а давайте так, если читать

50:46статьи, которые были там пи0 пи этот вот

50:49всё, э, по тем задачам, которые они

50:52клеймили, что они тогда их решали, они

50:54тоже были композиционные. Здесь, ну,

50:57[откашливается] ну, честно говоря, в

50:59общем, в общем, я не знаю, давайте так.

51:00Моё лично, как это, моё моё ощущение от

51:03Physical Intelligence, что они, а,

51:05перехайпили в своё время, а, и теперь,

51:07а, как это under delivered, да,

51:09относительно того, что они, казалось,

51:12могут сделать. Вот. Но это всё ещё

51:15ребята, которые считаются фронтиром. И

51:17если вы как бы залетаете в Вла, а-а, или

51:21там типа следите за Вла, ну вам просто

51:22нужно их читать, следить, смотреть, как

51:24бы

51:26что они делают, потому что а этот там

51:29одни одни не из одни из немногих, кто а

51:33ну которые короче у которых высокие

51:35шансы там сделать то, что ну короче

51:38сделать, которые будут действительно там

51:40типа работать только от неё от неё

51:41ожидают. Вот. Аа, так, по-моему, у меня,

51:47э, плюс-минус, плюс-минус всё. А, вот

51:54мы можем, э, если есть желание, о

51:58чём-нибудь поговорить, я могу поотвечать

51:59на вопросы. Аэ, вот с Давайте,

52:07>> да, поднимать упало.

52:10>> Алло,

52:10>> алло.

52:11>> О, здравствуйте. О, начал работать.

52:14>> Владислав, город Долгопрудный,

52:16Московской области.

52:18Аа вопрос такой, э, вначале ты говорил

52:22про, э, то, откуда данные и понятно, что

52:25там, туда-сюда. А я вот сказал про

52:29нерослоп, что я имел в виду, это World

52:31Models. Угу.

52:33>> И про них уже что-то рассказывали, не?

52:35>> А, ну ты про них вроде бы тут не

52:37упоминал, но какое мнение по этому

52:39вопросу?

52:41И насколько ты считаешь в сравнении с

52:43тем, что есть? И и то есть как если

52:46финальная картина - это интеграция всех

52:48способов, то какое место может занимать

52:51а вот этот чудорослоб там?

52:55>> О'кей. А

52:57у меня нет, если что, понимания

52:59финальной картины того, что заработает.

53:01Если бы было, я бы не был сейчас здесь.

53:04А вот, но,

53:08короче, с моделями мира очень просто.

53:11Первое, это лютый хайп прямо сегодня.

53:15Ну, как бы лютый хайп, потому что люди

53:17такие типа: "О, нам нужны модели,

53:19которые умеют моделировать, а,

53:22происходящее вокруг нас". Потому что

53:24если они умеют это делать,

53:26следовательно, мы можем лучше понимать,

53:27что нам самим делать. Ну, конкретно там

53:29типа моделям моделям управления,

53:32да, типа всё так. Вот это действительно,

53:37скорее всего, будет так, потому что вы

53:38просто идёте по каузальной лестнице от

53:41observational данных, да, там типа

53:43interventional доfunctional. И

53:45действительно, если вы умеете делать там

53:48factual анализ с помощью ваших моделей,

53:50вы будете, скорее всего, получать

53:53более лучше работающие модели, которые

53:55используют там, в том числе эти данные.

53:58Но а эта задача гораздо сложнее, а,

54:03нежели там типа просто имитация на

54:05действиях или просто там типа под под

54:08конкретную задачу. А, не знаю, наверное,

54:12так вот Никита Качаев будет прямо много

54:14про вот последние, так сказать, Advancec

54:17в World Action моделях аа рассказывать.

54:21Я думаю, точно стоит, короче, к нему на

54:23лекцию сходить.

54:24Он что-то более путное здесь

54:27и более дельное, чем я, может сказать,

54:28потому что он в это больше, короче,

54:30погружен. Но,

54:32ну да, это как бы следующая, не

54:35следующая, наверное, текущая волна

54:37моделей

54:39для управления. Посмотрим, как она будет

54:41работать. Просто когда разговариваешь с

54:43ребятами, которые вот занимаются этим

54:46там типа dayту и обучением этих больших

54:48моделей, они стараются с первых

54:51принципов как бы рассуждать, да, и на

54:54самом деле им как бы, если с первых

54:56принципов идти, там не шибко важно, что

54:59у вас под капотом, типа влэмка или там

55:02видеомодель какая-нибудь будет. Вообще

55:04пофиг. Вот главное, чтобы лучше метрики

55:06как бы прорисовывал.

55:09Вот.

55:18Так, Кирилл, тайга Россия. В общем, э,

55:21хотел бы сразу же сказать, что Никита

55:23уже провёл свою лекцию, по-моему, ещё

55:26чуть ли неделю назад. Вот. Э, и

55:30>> я немножко не понял, э, ну, вот имеется

55:32в виду, что World Model можно

55:34использовать для того, чтобы, а,

55:36дополнительно обучать, короче, модельку.

55:38У меня такой вопрос: а можно ли

55:39использовать её для получения датасетов

55:43траекторий? В смысле, что мы просто

55:45генерим типа какое-то действие, потом

55:47смотрим, как эта картинка поменялась,

55:48типа генерим датасет. Ну вот типа что-то

55:50симуляция.

55:51>> О'кей. Аа, смотри, а такто скорее всего

55:55можно будет делать, потому что у нас

55:56есть пример, э, из игр банально с

55:59дриммером, да, что у тебя есть, ну, типа

56:02модель там дриммера, которая по факту

56:03учится, ну, по факту модель, которая

56:05учится в модели мира, а, в латентах,

56:07типа. То есть, типа, это возможно.

56:09Вопрос, насколько это возможно, типа,

56:11для роботов, скорее всего, да. Скорее

56:15всего, да, так можно будет делать. А, но

56:18тут как это будет ли пайплайн выглядеть

56:22так, что у тебя есть какая-то модель,

56:25которая генерит тебе именно синтетику, и

56:27ты на ней дообучаешься?

56:29А я не верю, что это оптимальный путь

56:32именно для обучения. То есть в латентах,

56:35скорее всего, надо будет просто учиться.

56:37А, ну то есть это просто известно,

56:39короче, изрели, что, в общем, такие вещи

56:41в латентах надо делать. Они не просто

56:43данные себе генерировать, потому что

56:45было много такого. А, ну подходы подходы

56:49будут и будет юзать. Не знаю. То есть

56:51мне мне просто концептуально вся эта

56:53история не очень шибко как-то. Я как-то

56:57с моделями мира я впервые столкнулся в

56:59семнадцатом году, когда там муж

57:01Шмитхубера

57:02вышла с с Джимми Ба, по-моему, статья,

57:05где они банально там типа там есть

57:07игрушка такая, где у тебя автомобиль,

57:10короче, по карте едет. А мы люто

57:12хайпанули в тот момент. Мы вообще там

57:14думали, как это там на там был ещё openй

57:17челлендж по Сонику. Бу. Думали, как это

57:19на Соника натянуть и всё такое. И вот

57:21как-то я тогда столкнулся с моделями

57:22мира, там что-то их пообучал, а-а, с

57:25ребятами там много про всё это думали и

57:28достаточно быстро перегорел, потому что,

57:31а, это всё по факту так или иначе model

57:33based model штуки. А model штуки очень

57:37тяжёлые в обучении вообще. То есть они

57:39разваливаются от любого чиха. И вот у

57:42меня до сих пор как бы сложилось, ну,

57:44как бы у меня до сих пор не поменялось

57:47вот это внутреннее ощущение, что эти

57:49модели разваливаются от любого чиха, но

57:50это могло уже поменяться, да? То есть

57:51просто я как бы, ну, руками руками новые

57:53модели вот эти не делал, не трогал. А, и

57:56поэтому я очень всегда опасаюсь вот этих

58:00вот штук. А, но есть нюанс такой, что

58:05как-то более теоретический. То есть,

58:08если ты говоришь, что у нас есть модель,

58:11а, вот у нас модель, которая обучилась

58:13на одном корпусе данных, да, а и мы

58:16используем эту модель для того, чтобы

58:18сгенерировать новый корпус данных,

58:20который будет полезен для другой модели,

58:22чтобы она обучилась, например, что-то

58:23делать, то ты делаешь предпосылку о

58:25твоей модели, что она каким-то образом

58:28может, ну, как бы, а, обогатить

58:33тот изначальный корпус данных, на

58:35котором она обучалась.

58:40Это, короче, на мой взгляд, спорная вещь

58:42достаточно.

58:44>> А вот по поводу латентов можно чуть

58:46уточнить? Ну, я вот про от Никиты знаю

58:49про модель Лапа. Ну вот где там

58:51буквально типа брали с каким-то гээпом

58:54кадры там с людьми и условно там

58:59Квантони ко мне, что это за действие? А,

59:01и типа вот латенты какого-то действия

59:04обучались и потом переносились. Это типа

59:06про вот это идёт речь или нет?

59:08>> Нет, а-э, это не про этой. Ну то есть

59:10как бы это, короче, оно рядом, ты

59:13можешь, ну, то есть вот эти все техники,

59:15они так или иначе могут использоваться.

59:16Я больше имел в виду историю в том, что

59:18у тебя есть модель, которая умеет тебе

59:20делать типа а форвард динамику,

59:23то есть вот прямо вот вот форвард

59:25динамика, тебе полностью как бы

59:26моделировать процесс. И у тебя вот есть

59:29вот латенты, ну, которые ты можешь,

59:30допустим, использовать как, ну, в общем,

59:32как инпуты модели для того, чтобы ты

59:34обучался. Вместо, ну, условно говоря,

59:35вот ты, у тебя есть на вход там типа

59:37state, дальше у тебя штучка какая-то

59:38сжимает, у тебя появляется латент, да, и

59:40вот модель мира, они типа стараются

59:42сделать так, чтобы они типа вот в этих

59:43латентах работали. И вместо того, чтобы

59:45потом разжимать это там типа в состояние

59:48какое-то типа, которое которое реальное,

59:50а мы говорим, что давайте наши модели

59:52учить вот в этих как бы латентах, да, то

59:56есть вместо того, чтобы типа их, ну,

59:58учить там типа в оригинальном

1:00:00стейтспейсе, потому что мы знаем, что

1:00:01когда он будет разжимать, скорее всего,

1:00:02что-то будет ну как бы не так ломаться,

1:00:04а если мы будем просто брать этот

1:00:05энкодер вот в этом пространстве

1:00:07работать, это будет лучше. Ну, то есть,

1:00:08если очень как бы отдалённо, так, ну,

1:00:11лапо,

1:00:12слушай, ну, лапо, оно же немножко

1:00:15чуть-чуть чуть-чуть всё-таки про другое.

1:00:18Оно же в первую очередь используется для

1:00:19того, чтобы как бы датасеты как бы

1:00:23[фыркает] как-то доразмечать датасеты, в

1:00:25которых действий нет.

1:00:27Вот

1:00:30оно

1:00:35>> так но там не конкретно про разметку,

1:00:37там скорее вот на предсказание этих

1:00:39латентов. Ну, короче, я вчера просто

1:00:41читал вот, что

1:00:42>> они такие: "Ну вот создадим дискретное

1:00:44пространство, которое будет типа вот за

1:00:46какие-то действия отвечать. Вот что это

1:00:48за действие будет? Ну пусть модель сама

1:00:50вытянет в них". Вот. А потом условно

1:00:53предположение, что это будет лучше

1:00:55переноситься для обучения уже на боди

1:00:57какой-то модельки типа конкретной

1:00:59работотехнической.

1:01:01>> Дада. Да. Ну то есть я об этом и говорю,

1:01:02что типа ты делаешь какой-то притрейн,

1:01:04где у тебя нету действий, типа ты

1:01:06какие-то типа латентные действия, ну то

1:01:08есть ты это как бы латентные действия

1:01:09получаешь и дальше у тебя есть датасет с

1:01:11размеченными же действиями, как бы ты,

1:01:13ну, собственно говоря, проецируешь, да?

1:01:15То есть это, э, как бы, да, так можно

1:01:17делать, но это же только это же только

1:01:19про, ну, как бы только про действие, то

1:01:21есть там есть типа в DM как бы IDM, а

1:01:24под капотом, но как-то, короче, мы ну

1:01:28типа у меня в группе мы сколько,

1:01:30полтора-д года занимались, типа late and

1:01:32action моделями буквально, то есть типа

1:01:35а ну [фыркает] мы ими перестали

1:01:38заниматься. Вот. Потому что они на самом

1:01:41деле не супер полезные для

1:01:43работотехники. Просто потому, что, ну,

1:01:46как Саша Никулин со мной поспорит, я не

1:01:48знаю, он как бы будет смотреть, не будет

1:01:50смотреть. Но а по всей видимости вот эти

1:01:54вот латентные именно

1:01:57латентные пространства, которые мы

1:01:59получаем на притрене из данных, в

1:02:00которых не было размеченных действий, не

1:02:02очень-то и нужны, когда у тебя есть

1:02:04500.000 часов, а, как бы полезных

1:02:07данных. Вот.

1:02:08>> Понял. Спасибо.

1:02:09>> Угу.

1:02:14Ещё какие-нибудь вопросы?

1:02:17Вообще любые можно, на самом деле. Как

1:02:19это?

1:02:24>> Да, здравствуйте. Вот Наполис.

1:02:27>> Вот я слышал, что в LA и в принципе в

1:02:30работо технике в основном используется

1:02:31алгоритм PPO. Почему, допустим, не

1:02:34говорится там, ну, я почти не слышал про

1:02:36использование других типа новых

1:02:38алгоритмов, типа GRPO, да, SDPO и прочих

1:02:41приколов из NLP?

1:02:44>> Ну, вообще ты можешь, короче, их

1:02:48применяют, ну, типа РПО насовывают

1:02:51только в путь. А, но вообще история

1:02:54такая, что как это, то есть есть модели,

1:02:57допустим, которые для селфдрайвинга

1:02:58применяют ГРПО, а или для роботов тоже

1:03:01применяют РПО. А, ну как бы стоит вопрос

1:03:03типа: "А а что такое Грпо?"

1:03:07>> Ну, мы считаем типа отваши относительно

1:03:11среднего по группе.

1:03:12>> Так. А, о'кей. А, ну как бы ты же

1:03:14понимаешь, что РПО - это уреза, ну, типа

1:03:16это прямо кастрированный типа ППО,

1:03:18>> да, но он как бы позволяет избавиться от

1:03:20критик модели.

1:03:21>> Ну, э как бы а как каким ограничением он

1:03:24это позволяет? Ну, типа, то есть почему

1:03:26он позволяет это сделать?

1:03:29Ну,

1:03:31в смысле, почему мы можем убрать

1:03:32критик-модель? Дададада.

1:03:34>> Ну, то, что мы adventш можем считать как

1:03:35раз-таки без критик модели. Вот

1:03:38>> так. Ну, то есть нет, за счёт чего ты

1:03:40это можешь там делать?

1:03:44>> Мм, [фыркает]

1:03:45короче, ответ такой, что это делается за

1:03:48счёт того, что ты всю цепочку твоего

1:03:50ответа, ну, то есть у тебя же как-то

1:03:53типа Грпо, насколько я помню, он же не

1:03:55на токенве не на токенвеel работает.

1:03:57Нет, ну вот DPO оно, ну вот есть

1:04:00модификация, условно,

1:04:01>> дадада, я понимаю, но эти все

1:04:03модификации они пришли, то есть короче

1:04:05вот почему почему ребята вре, господи, в

1:04:08работотехнике крутят ПPO или там типа

1:04:10дефолтные алгоритмы, потому что их

1:04:12изначально делали работотехники. То есть

1:04:13когда делался ППО, его делали под

1:04:15работотехнические задачи прямо с самого

1:04:17начала. И он, ну, как бы просто его

1:04:19лице, вот в том виде, в котором он есть,

1:04:20он прекрасно работает на

1:04:21работотехнических задачах. Ребята в

1:04:23начинают там типа своей как бы, ну,

1:04:26этими своими вещами заниматься, потому

1:04:27что когда начинаешь ПPO переносить в том

1:04:29виде, в котором он есть, или типа

1:04:30какие-то другие алгоритмы на лмные

1:04:32задачи, они не так хорошо работают, там

1:04:34типа хреново масштабируются или просто

1:04:36себя, ну, как бы плохо ведут. И там

1:04:38условный ГРПО, он там типа круто

1:04:39работает, а потому что он говорит там

1:04:41типа следующий, ну както потому что там

1:04:43типа валидное следующее предположение,

1:04:45что тебе не нужно там на токен-левеле

1:04:46как бы работать. А в задаче там типа

1:04:49работотехники, ну тебе нужно-то вот, ну

1:04:51типа у тебя задача буквально тебя вот

1:04:53каждый стейт, типа, если ты один за

1:04:54другим идёшь, у тебя токен level - это

1:04:56вот буквально состояние действия как бы

1:04:58вот, которое у тебя есть, если вот на на

1:05:01на лэмке переносить. Поэтому типа каждый

1:05:03раз я, когда вижу, когда какое-нибудь

1:05:04РПО переносит на там типа на на

1:05:07работотехнические задачи, ну ты как бы

1:05:09там типа понятно, что это как-то

1:05:14общем, давай так непонятно зачем это

1:05:16делать. Понятно, что ребята не, ну, типа

1:05:18не не занимались, короче, работотехникой

1:05:21до этого. Вот. То есть тут скорее больше

1:05:23вопрос: "А почему не САК, да? Ну, типа

1:05:27Soft actor critical алгоритм есть

1:05:28какой-нибудь, а, а не PPO. Вот. Или

1:05:32почему не AVR? Ну, вообще-то АР

1:05:33применяется, как бы. То есть там же куча

1:05:36куча разных алгоритмов. Э, когда ещё,

1:05:39ну, то есть это как бы концепт вм был

1:05:42следующий. А была область реля, была

1:05:46область там оффлайн реля, а есть там

1:05:48область метареля и так далее. Ребята там

1:05:50навыдумывали кучу разных алгоритмов, и

1:05:52чуваки из ЛМ просто начали их все

1:05:54применять потихоньку к себе. А стало

1:05:57понятно, что в тупу это всё дело не

1:05:59переносится. Нужно немножко, типа, нужно

1:06:00немножко, а сильно модифицировать эти

1:06:02алгоритмы и упрощать и там приводить

1:06:04определённые там ассампшены и как бы ну

1:06:08там типа появление того же там, не знаю,

1:06:09какого-нибудь DPO, которое, ну просто

1:06:12ребята аккуратно посмотрели на ту

1:06:13задачу, которую они решают. А там нужны

1:06:15просто вещи проще. В работотехнике тебе

1:06:18эти вещи проще не нужны. Тебе, ну тебе

1:06:20нужно вот оригинально, как это всё

1:06:22делалось, потому что это прямо делалось

1:06:23под подработику, под рабоку. Вот. Не

1:06:25знаю, ответил нет.

1:06:26>> Да, я понял. Спасибо.

1:06:27>> Угу. Кайф.

1:06:35Ещё вопросы?

1:06:42Кажется, вопросов больше нет. Всё,

1:06:43спасибо большое.

More from Astar Acceptman

Recently added transcripts

Browse the whole transcript library

This transcript was generated from the captions YouTube publishes for this video. Get the transcript of any YouTube video atfreeyoutubetranscribe.com, free, unlimited, no sign-up.