Full transcript
Начало
0:00Ну что, это было одно из самых
0:02запрашиваемых видео на канале в
0:04последнее время, а именно видео про
0:06локальные модели. Для тех, кто не в
0:09курсе, что это такое, показываю.
0:11Представим, что я сейчас лечу в
0:13самолёте. Связи нет, вай-фая нет, нет
0:16привычного нам ассистента. Но я открываю
0:19приложение, выбираю локальную модель,
0:21закидываю сюда документ и начинаю решать
0:24рабочие задачи. Вот черновик, превращаю
0:27его в нормальное письмо. Вот несколько
0:29заметок после созвона. Прошу разложить
0:31их на задачи. Вот чеки и скриншоты.
0:33Модель может вытащить из них нужные
0:35данные и сложить в таблицу. И всё вот
0:37это работает локально. То есть AI
0:40установлен у меня на компьютере,
0:42отвечает прямо здесь и не зависит от
0:45интернета. А ещё это абсолютно
0:48бесплатно. Вы просили сделать подробное
0:50видео на тему локальных моделей. Что это
0:53[фыркает] такое? Где их искать? Как их
0:55запускать? Как понять, какая модель
0:57подойдёт именно вашему компьютеру?
0:59Сможет ли ваш компьютер это потянуть?
1:01Почему одна модель весит 2 ГБ, а другая-
1:0320? Ну и главное, конечно, кому и зачем,
1:06и в каких задачах локальные модели
1:08необходимы. В этом видео я разложу вам
1:10всё по полочкам, всё расскажу так, чтобы
1:12стало понятно и тем, кто абсолютно с
1:14нуля этой темой интересуется, и тем, кто
1:16уже активно использует чад, но хочет
1:20понять, как устроен локальный AI и как
1:23его вообще можно применять. А ещё я
1:25покажу самый простой путь настройки
1:27локальных моделей через кодекс. В общем,
1:30поехали. Но вначале будет очень много
1:32полезной информации, что вообще такое
Что такое локальные модели
1:34локальный модели. Начнём с самой базы.
1:37Когда вы пользуетесь чам GPT или GMI в
1:39браузере или в приложении, всё работает
1:41через облако. То есть вы пишите запрос,
1:44он уходит на сервер компании, там его
1:46обрабатывает большая языковая модель и
1:48ответ возвращает обратно к вам. То есть
1:50модель живёт не у вас на компьютере, она
1:52живёт где-то там, в этоцентрах, на
1:54огромных серверах, и вы используете
1:56именно сервера той компании. Локальная
1:58модель, она работает иначе. Это модель,
2:01которая скачивается прямо на ваш
2:02компьютер и запускается прямо на вашем
2:04компьютере. То есть файл лежит у вас на
2:06диске, приложение запускает его
2:08локально, и ответы генерируются не на
2:10где-то сервере Openail или Google, а на
2:13вашем ноутбуке, используя мощность
2:15вашего ноутбука. Соответственно, она
2:18работает без интернета, в него можно без
2:21опаски абсолютно отправлять приватные
2:23файлы с личной или там финансовой
2:24информацией, и она бесплатная. Теперь,
2:27чтобы пользоваться локальными моделями,
2:28нужно три вещи. Первая вещь - это сама
2:32модель. Это мозг. Например, у нас есть
2:35Квен, у нас есть Гемма, у нас есть лама,
2:38Мистрал. Это разные семейство модели от
2:41разных компаний. Каждая, естественно,
2:43хороша по-своему. Некоторые лучше
2:45работают с текстом, некоторые рассуждают
2:47лучше, некоторые работают с кодом или
2:49изображениями. Вторая вещь - это
2:51приложение, которое запускает модель.
2:54Например, у нас есть такое приложение,
2:56как Oлаama. Потому что сама модель,
2:58которую мы устанавливаем - это просто
3:00файл. И чтобы она начала отвечать, нужно
3:03плеер, который умеет открывать вот этот
3:05файл и запускать. Вот Алаama как раз
3:08одна из таких приложений. Она является
3:09таким плеером. Модель, конечно, можно
3:12установить и прямо в терминале, но если
3:14вы не разработчик, вам, скорее всего,
3:16будет это делать сложнее. Это может быть
3:19неудобным или непонятным в начале, но я
3:21вам тоже покажу этот способ. Просто
3:23плеер имеет более понятную и удобную
3:25оболочку, я бы сказала. И третья вещь,
3:27которая вам нужна, чтобы иметь локальную
3:28модель - это ваш компьютер. Это, на
3:31самом деле, является ключевым, одно из
3:33ключевых параметров, потому что модель,
3:35она может быть хорошей, приложение может
3:37быть удобным, но если модель слишком
3:40тяжёлая, а обычно сильные модели, умные,
3:43да, вот теми, которые вы используете CLД
3:44или ch GPT, мощные модели, естественно,
3:47такую прямо большую мощность ваш
3:49компьютер не подтянет, и вам придётся
3:51устанавливать более простые модели. Они
3:53тоже будут работать. Мы это всё
3:55разберём, но просто я вам говорю, что
3:57это очень важный фактор, какой у вас
3:59компьютер, какое у вас железо. Потому
4:01что если у вас прямо супер-супер старый
4:03компьютер, то модель может тормозить,
4:06она может зависать или вообще даже не
Откуда берутся локальные модели
4:08запуститься. Теперь вопрос: кто вообще
4:11делает эти модели? Эти модели делают
4:14большие лаборатории и компании. Google,
4:17например, делает Гемmaма, Мета делает
4:19ламма, Alibabба делает Quen, Microsoft
4:22делает P, ML AI делает ML. И в общем,
4:25сейчас таких моделей уже даже не
4:27десятки, а их сотни. А если считать
4:30вообще все версии доработок, то есть
4:32каждая модель, она может быть доработана
4:34под определённый тип задачи, под
4:36определённый компьютер. Есть сжатые
4:38сборки, варианты от сообщества. То есть
4:41там уже сейчас реально больше тысячи
4:43разных вариантов локальных моделей. Если
4:46это всё бесплатно, зачем вообще компании
4:48создают и выкладывают такие модели, у
4:49вас может возникнуть вопрос. Так вот,
4:51если у Google есть GMI, зачем им
4:53выпускать гема? Они же так будто будут
4:55конкурировать со своими облачными
4:57продуктами, платными. Но здесь
4:59немножечко другой смысл. Во-первых, это
5:01целая экосистема. Если разработчики, а в
5:04основном используют локальные модели,
5:05разработчики или компании, они начинают
5:07использовать вашу модель, вокруг неё
5:09появляются инструкции, разные
5:10приложения, интеграции, тесты
5:13дообучения, локальные сборки. модель
5:15становится стандартом, а стандарт - это
5:17влияние. Во-вторых, локальные модели,
5:19они ещё нужны там, где облако неудобно
5:22или невозможно, например, в
5:23корпоративных системах, где просто
5:25нельзя отправлять данные наружу, в
5:27медицинских инструментах, в приложениях,
5:29которые должны работать оффлайн, в
5:31устройствах, где модель должна быть
5:32прямо внутри продукта, в телефонах,
5:34ноутбуках, локальных ассистентах. И
5:37поэтому большие компании, кроме своих
5:39фронтирных моделей, разрабатывают и вот
5:41такие вот локальные, чтобы захватить как
5:43бы и этот сегмент рынка. Потому что,
5:45в-третьих, они ещё получают
5:47исследование, да, когда модель ваша
5:49доступная, её тестируют, сравнивают,
5:51дорабатывают. Комьюнити зачастую очень
5:53часто находит ошибки, делает маленькие
5:56версии, адаптирует под разные языки, под
5:58код, под документы, под конкретные
6:00задачи. Ну, в общем, сообщество - это
6:02суперважный элемент AI индустрии.
6:04Вообще, в принципе, любой. Именно
6:06сообщество двигает нас к развитию. Тогда
Где лежат локальные модели
6:09где эти модели все лежат и где их удобно
6:11искать? И главное место, где сейчас
6:14ищут, обычно ищут модели - это у нас
6:17HA-F. Hag-inface - это у нас сайт, такой
6:19большой каталог, такая огромнейшая
6:22библиотека моделей. То есть представьте
6:24себе Apple Store только не для
6:26приложений, а для нейросетей. Там лежат
6:28модели для текста, картинок, аудиокода,
6:30перевода, анализа документов. И в том
6:33числе там лежат модели, которые можно
6:35запускать локально у себя на компьютере.
6:37Но, конечно же, у Хагинфейса, если вы
6:39туда заходили и вышли, есть огромная
6:42проблема. Особенно, ну, опять же,
6:43проблема нас, простых людей, так скажем,
6:45те, которым не сбо разбираются в коде
6:47вообще в разработке всей этой. Там очень
6:49много всего в Хакинфейсе. Ну, это
6:51буквально открытое место, где каждый из
6:53нас может что-то опубликовать. Это как
6:54бы одновременно и боль, и сила, потому
6:56что если вы просто вбиваете в пояс
6:58гемма, у вас выпадет не просто одна
7:00модель, а у вас выпадет огромнейший
7:02список. И новичку будет очень сложно
7:05понять вообще, куда нажимать, какую
7:07устанавливать, да? Напоминаю, Гема - это
7:09у нас локальная модель от Google. У нас
7:10тут есть гема с припиской 31Б, е с
7:13припиской 12B, е с припиской 4Б. Б у нас
7:17эта цифра означает сколько миллиардов
7:19параметров у этой модели. Это первый
7:21выбор, который перед вами встанет.
7:23Соответственно, что выбрать? Здесь
7:25важный момент, особенно если вообще вы
7:27это делаете первый раз и вы не уверены
7:28за свой ноутбук, не надо сразу выбирать
7:30самую большую, самую мощную модель. То
7:32есть, если вы видите значение 31, это
7:34очень тяжёлая модель. Да, она хороша,
7:36она, конечно же, будет умнее и лучше
7:38работать, но для обычного ноутбука она,
7:41скорее всего, просто не подойдёт. Вы
7:42даже не сможете её установить. Например,
7:44если у вас компьютеров, как у меня,
7:46MacBook с 16 Гбми оперативной памяти или
7:49просто обычный рабочий ноутбук, то,
7:51конечно же, тут уже начинать логичнее с
7:53чего-то в районе 4Б. Это не совсем
7:56крошечная модель, но уже относительно
7:58подъёмная для локального запуска. Модели
8:011Б, 2B тоже бывают полезные, особенно
8:04для слабых компьютером. Но, конечно же,
8:07ребят, качество ответов может быть
8:09заметнозаметно хуже. Поэтому для первого
8:11такого нормального теста я бы
8:12ориентировалась на вашем месте 4Б. Вот
8:15именно на эту версию мы с вами и нажмём.
8:17Но и это ещё не всё. Это просто первая
8:20выборка, которая перед вами стонет
8:21внутри вот этой модели, когда мы на неё
8:23открываем. Есть ещё несколько разных её
8:25версий. Их можно найти вот здесь вот в
8:27правой части интерфейса, вот в этом
8:29блоке. Поэтому нам нужна вкладка
8:31оптимизированные модели. И здесь вот мы
8:33уже можем найти варианты, которые кто-то
8:35подготовил под разные сценарии. Ну,
8:37какой-то разработчик, под локальный
8:39запуск, под разные форматы, под разные
8:40программы. То есть теперь из вот этого
8:42огромнейшего списка нам необходимо
8:44как-то выбрать модель, которая подходит
8:46именно нам. И чтобы понять, какая модель
8:49подойдёт, нужно уметь читать название. Я
8:52сейчас вам подробно разложу. Это не так
8:54сложно, как кажется. Вы примерно уже
8:56будете понимать. Ну, во всяком случае,
8:58если что, вы можете просто вбить
9:00название в тот же любой там чаat GPT
9:02колод, что вы используете, тоже у него
9:03спросить, что означает данная модель. К
9:05примеру, возьмём модель GEMA i4B ITQ4
9:10keygguf.
9:12В общем, на первый взгляд это выглядит
9:14особенно не для технарей. Это выглядит
9:16какой-то больше кошмар, что это
9:18означает. Но на самом-то деле тут всё
9:20довольно логично. У нас название всегда
9:23разрезается на кусочки. Первое - это
9:25Гема 4 - это семейство модели, то есть
9:28гема четвёртого поколения. Гема - это
9:30открытое семейство модели от Google. И
9:324B - это у нас размер модели. Помните, B
9:36у нас отвечает за билн миллиард. То есть
9:384B, 8B, 14B, 4B - это 4 млрд параметров.
9:43У Гем 4 есть своя особенность, и там
9:47используется обозначение I4B, то есть
9:50effective 4B. Более эффективное 4B
9:53параметра. Для нас это большого значения
9:55не имеет. На бытовом уровне можно
9:57сказать так, что и 4B и 4B - это
10:00примерно одно и то же, примерно один
10:03уровень модели. Следующая часть у нас
10:05инструкции - это IT. Это у нас
10:07instructional tuned, то есть модель до
10:11обучили выполнять инструкции. То есть
10:13эта модель, она может не просто
10:15продолжать текст, например, а она может
10:17отвечать на команды. Объясни проще.
10:19Перепиши письмо, сделай summary, оформи
10:22таблицу, найди ошибки, разложи по
10:23пунктам. И вот для обычного пользователя
10:25это как раз то, что нужно. Поэтому, если
10:27вы видите IT, instructт - это обычно
10:31хороший знак. Значит, модель в этом
10:33случае больше подходит для общения и
10:35выполнения разных задач. Теперь Q4КМ
10:39- это сжатие модели. Технически это
10:41называется квантование. И здесь смысл
10:44простой. То есть модель она была
10:46большой, но её сжали, чтобы она занимала
10:49просто меньше места и могла запускаться
10:51на обычном компьютере. И Q4 - это
10:55довольно сильное сжатие, но обычно это
10:58такой баланс. Модель она становится
11:01легче, но качество остаётся более-менее
11:04нормальным. Поэтому, если вы не знаете,
11:07что выбрать Q4К часто это такой самый
11:10стартовый вариант. И наконец-то у нас
11:13есть точка gguf. Это у нас формат файла
11:17модели. Например, у нас есть формат PDF,
11:19формат документа, да, GPG, формат
11:22картинки, MP4, формат видео. GGUF - это
11:25формат, который удобно запускать
11:27локально на обычных компьютерах через
11:29Allлаama, LM Studдия и похожие
11:31инструменты. Поэтому, если на самом деле
11:34перевести сейчас вот это на человеческий
11:36язык, это модель Гема четвёртого
11:38поколения, версия примерно 4 млрд
11:41эффективных параметров, обученная
11:43выполнять инструкции, сжатая в варианте
11:45Q4 и сохранённые файле GUF для
11:48локального запуска. Теперь, умея читать
Параметры и квантование
11:51название, как же всё-таки вообще выбрать
11:54модель под себя? И для этого нам
11:56чуть-чуть подробнее нужно разобрать две
11:58характеристики. Это у нас параметры и
12:00это у нас квантование. Параметры - это
12:03размер мозга модели. У нас есть 1 млрд,
12:06у нас есть 4 млрд, у нас есть 70 млрд.
12:09Параметры - это не статьи, это не факты
12:13и не документы внутри самой модели. Это
12:15миллиарды чисел, которые модель
12:18выстроила в определённом порядке во
12:20время обучения. То есть это буквально
12:22файл с числами. По этим числам она
12:25понимает, как отвечать, какое слово
12:27выбрать дальше, как рассуждать, как
12:30связывать идеи. Проще говоря, параметры
12:32- это размер мозга модели, количество
12:35нейронных связей, если проводить
12:37аналогию с нашим человеческим мозгом.
12:39Естественно, чем больше параметров, тем
12:41модель обычно способнее. Но именно
12:44обычно, потому что качество зависят ещё
12:47и от данных обучения, архитектуры,
12:51донастройки и задачи. Бывает такое, что
12:54маленькая какая-то хорошо обученная
12:56модель иногда может быть полезнее
12:58большой. Разработчики, кто её
13:00тренировал, они использовали более
13:02качественные данные, но просто в бытовом
13:04смысле правило такое, да, естественно,
13:06больше параметров. У нас потенциально
13:08она умнее, но она и тяжелее для вашего
13:10компьютера. И вот тут вот появляется
13:13квантование. Квантование - это уже
13:15сжатие модели. Представьте фотографию.
13:18Её можно сохранить в максимальном
13:19качестве. Она будет, например, весить, я
13:21не знаю, 50 Мб. А можно сжать, и она
13:23будет весить 5 Мб. Как бы смотреть на
13:25эту картинку всё ещё можно. Мы всё-таки
13:27можем считать на ней информацию, да,
13:29понять, что на ней изображено, но часть
13:32качества, естественно, потеряется. Так
13:34вот, с моделями примерно так же. У
13:36модели есть миллиарды чисел. Их можно
13:38хранить очень точно, а можно округлить и
13:41хранить компактнее. И модель она
13:43становится легче, её проще запустить на
13:45обычном компьютере, но, конечно же, и
13:47качество будет теряться. Так вот, у нас
13:49есть Q8. Модель сжата меньше, поэтому
13:52она тяжелее. У нас есть Q5, средний
13:54вариант Q4 сильнее сжато, зато легче
13:58запускается. И также есть вообще Q2 и Q3
14:00уже для прямо ну очень слабого железа.
14:02Поэтому качество может заметно
14:04проседать. Для старта, если вы не
14:07знаете, с чего начать, что выбрать,
14:08начинайте пока с Q4КМ.
14:11Это часто обычно хороший баланс. Вы
14:13всегда можете перейти выше или ниже. Но
14:16здесь может у вас возникнуть вопрос: а
14:17что вообще тогда важнее при выборе? Это
14:20параметры либо это квантование? Я бы,
14:22наверное, думала так. Сначала мы
14:24выбираем модель по количеству
14:25параметров, то есть решаем, какой вообще
14:27размер мозга потянет наш компьютер. Это
14:301B, 4B, 8B14 и так далее. А уже потом
14:34внутри этого размера смотрим
14:35квантование, то есть насколько теперь
14:37эта модель ещё и сжата. Q4 будет легче,
14:39Q8 тяжелее, но потенциально
14:41качественней. Если есть у нас
14:43разработчики, которые смотрят это видео,
14:44можете добавить что-то от себя. То есть,
14:46да, логика такая. Сначала выбираем
14:48подходящий размер модели, а потом уже
14:49подходящую упаковку. И опять для
14:51обычного компьютера у нас стартовая
14:53точка в что-то в районе 4 млрд
14:54параметров и Q4. Если работает быстро,
14:57можно попробовать модели побольше и
14:59другое квантование. Если тормозит,
15:01просто берём модель поменьше или сильнее
Как выбрать модель
15:03сжатую. Теперь про ваш компьютер,
15:05ребята. Чтобы понять, какую модель вам
15:08ставить, нужно посмотреть на параметры
15:10вашего компьютера. На Маке это делается
15:12нажатием всего лишь на вот эту кнопочку,
15:14на вот это яблочко. Потом about this
15:16Mac, об этом ноутбуке. И смотрим, какой
15:18у нас процессор. В данном случае у меня
15:211 и операционная память 16 ГБ. Теперь
15:25самый простой путь, чтобы подобрать
15:27вообще модель именно под своё железо -
15:29это зайти на сам Hugging Face, вкладка
15:32Local Apps, и прямо указать в своём
15:35профайле параметры своего компьютера.
15:37Всё, теперь Hugin of Face, они будут
15:39показывать, какие вообще модели, скорее
15:41всего, подходят вашему железу, а какие
15:43нет. Например, я поставила параметры
15:45своего компьютера М1 16 Гб оперативной
15:47памяти. И теперь, когда я возвращаюсь на
15:49страницу с выбором модели, видите, у
15:51меня возле каждой модельки появляется
15:53либо зелёная галочка, это значит, что
15:54модель потенциально нам подходит и
15:56запустится, либо жёлтая галочка, это
15:58означает, что моделька будет сложно
16:00работать на нашем компьютере, либо
16:01вообще красный крестик, что означает,
16:03это категорически не подходит твоему
16:05компьютеру. Поэтому здесь, я думаю,
16:07вопрос закрыт. И теперь поговорим про
Как скачивать и запускать
16:10то, как их скачивать и запускать. На чём
16:12запускать локальные модели? Инструментов
16:15для этого много. У нас есть LM Studдия,
16:18у нас есть LAAMA, у нас есть GEN, у нас
16:21есть Open Web UI и есть ещё и другие
16:24варианты. Но конкретно в этом видео я
16:26вам покажу простой путь через Allлаma.
16:29Allлаama - это у нас бесплатное
16:30приложение, которое умеет скачивать и
16:32запускать локальные модели прямо у вас
16:34на компьютере. У него есть десктопная
16:36версия, своя даже библиотека моделей. Ну
16:39и в целом, как бы, я считаю, что это
16:40одно из самых понятных способов
16:42начинать, если, опять же, вы не
16:43программист и просто хотите попробовать
16:45локально не расить у себя на ноутбуке.
16:47О'кей, что делаем? Мы заходим на сайт
16:50Allamma, нажимаем на download,
16:53соответственно, скачиваем приложение и
16:55устанавливаем его. После установки у вас
16:57открывается такая вот доступная версия.
17:00И интерфейс, на самом деле, здесь очень
17:01минималистичный, похож просто на
17:03привычный чат. Есть поле, куда мы пишем
17:05сообщения, есть список диалогов. Внизу
17:07можно выбрать, с какой моделью мы хотим
17:09общаться. Здесь обратите внимание на
17:11значки. То есть модели, рядом с которыми
17:13нарисовано облачко. Это у нас облачные
17:16модели. То есть они работают через
17:18интернет, и в данном случае нас они не
17:19интересуют. Нам нужны именно локальные
17:22модели, которые будут работать прямо у
17:23вас на компьютере. И из коробки прямо
17:26улама она предлагает уже несколько
17:28локальных моделей. В моём случае я
17:30сейчас вижу только Гemma и Quн. Сюда
17:32можно устанавливать и другие модели, но
17:34для первого запускала Лама предлагает
17:35именно эти варианты. Мы с вами выберем
17:37Гема и пишем первое сообщение. Привет.
17:40После этого модель начинает уже
17:42скачиваться. И, соответственно, Алама
17:44видит, что вы её хотите запустить,
17:46скачивает и только потом уже запускает.
17:48И я скажу честно, лично у меня здесь
17:51возникла проблема, потому что я знаю,
17:53что многие с ней столкнутся. Я вам
17:54расскажу. Модель гема, которая у нас
17:56скачалась именно по умолчанию, она весит
17:59около 10 Гб. На моём Макбуке с
18:02процессором 1,6 ГБ оперативной памяти
18:05она не подошла. То есть компьютер начал
18:08конкретно зависать. Что это означает?
18:10Это означает, что конкретно эта версия
18:12модели, она слишком тяжёлая для моего
18:14компьютера. Мне нужна модель попроще.
18:16Где её взять? У нас есть официальная
18:19библиотека Олаama, и там собраны модели,
18:21которые можно запускать через Олам. У
18:23нас есть КН, Гема, другие. То есть вы
18:25заходите в библиотеку, это тот же сайт,
18:28что я скачал моё само приложение. Потом
18:30выбираете нужное семейство модели и
18:32смотрите, какие у него есть версии.
18:33Читать это название вы уже умеете. На
18:36одной из моделей будет пометка Latest.
18:38Это версия по умолчанию. Я выбираю
18:40модель, которая весит 7 Гб. И здесь у
18:42нас уже есть инструкция, как эту модель
18:45установить. Во-первых, нам нужно открыть
18:47здесь терминал. Это такое окошко, где вы
18:49напрямую общаетесь с компьютером и даёте
18:51ему команды. Мы копируем вот эту
18:54команду, которая указана на странице
18:56модели. Ищем в поиске на компьютере
18:58терминал. Вставляем сюда вот эту
18:59команду, нажимаем Enter. Всё. Теперь
19:01модель должна автоматически скачаться,
19:03установиться, и у вас в списке, прямо в
19:05десктопном приложении появится новая
19:08моделька. Теперь вы можете её просто
19:09выбрать и пообщаться. Но, конечно же,
19:12вам что стоит понимать, да, когда вы
19:13только скачаете новую модель, вам нужно
19:15будет теперь её попробовать и вообще
19:17посмотреть, она у вас запускается и
19:19работа она как нужно или нет. Например,
19:21на моём компьютере конкретно эта модель
19:23на 7 ГБ тоже работала плохо, и она очень
19:25подвисала. Что тогда делать, если вы
19:27выбрали прямо, ну, вроде бы даже
19:29маленькую модель, а она всё равно не
19:31работает. Это означает, что для моего
19:33компьютера локальных моделей нет? Нет.
19:36Если у вас будет такая же ситуация, как
19:37у меня, то есть модели будут
19:39устанавливаться, но они не будут
19:40запускаться, либо компьютер будет очень
19:41сильно безумно глючить, то есть другой
19:43способ - это не использовать модели с
19:45официальной библиотеки Олаama, а
19:47использовать для этого Hugging Face и
19:49помощь агента. И ранее hgening Face он
19:52мог показаться сложным и для новичка
19:54установка модели могла быть непонятной.
19:56Но сейчас благодаря возможностям и
19:59агентам всё стало гораздо проще, поэтому
20:01я покажу, как это делать. Возвращаемся,
20:04соответственно, на сайт Hugin Face. И на
20:06Хагингфейсе, как мы помним, мы уже
20:07указали параметры своего компьютера в
20:09настройках. Соответственно, выбираем
20:10модель, которую мы хотим скачать,
20:12например, Гемma. И рядом с моделью у нас
20:14появляется подсказка, то есть какая
20:16модель подходит к нашему компьютеру.
20:18Выбираем 4 млрд параметром. Тут в околом
20:21меню мы выбираем приложение, в котором
20:23мы хотим запустить конкретно эту модель.
20:25В нашем случае мы хотим запустить на
20:26Олаama, поэтому выбираем логотип ОлаAM.
20:29И дальше вы либо можете скопировать вот
20:30этот адрес этой страницы, которая
20:32открылась, либо команду, которая
20:34появилась у вас на экране. И дальше уже
20:36будем использовать помощь агента, то
20:38есть, например, кодекса. Вы можете
20:40использовать иклод, если вы пользуетесь
20:42им. Просто я буду показывать на кодексе.
20:44Про года, кстати, у меня было отдельное
20:45видео, можете его посмотреть. Если
20:47совсем коротко, то это приложение SE,
20:49которое может управлять вашим
20:50компьютером и выполнять на нём какие-то
20:51полезные действия. Поэтому мы открываем
20:54с вами кодекс и просто пишем ему
20:56обычными словами. У нас установлена
20:58О-Лама, и нам нужно установить
21:00конкретную модель. Вот ссылка на эту
21:02модель. Всё. И теперь кодекс, он сам
21:04выполнит вообще все команды, скачает
21:07модель, установит её. И после установки
21:10всё, мы теперь можем закрыть кодекс,
21:12отключить интернет, открыть Олаama, и в
21:15списке модели будет уже вот эта та самая
21:17локальная модель, которую мы попросили
21:19установить. Вот, в принципе, это и
21:21прелесть вот этого метода. А даже если у
21:23вас возникнут какие-то проблемы, опять
21:25же, вы включаете интернет и просите
21:27кодекс продиагностировать вашу проблему,
21:29найти и скачать какую-то более
21:30оптимизированную модель, что там
21:32возможно переустановить, исправить
21:34ошибки. В общем, с вот этим методом, я
21:35думаю, у вас точно не будет отговорок
21:37попробовать локальную модель. Теперь
Какие модели для каких задач
21:38какие модели попробовать? Вообще какая
21:40для чего подходит? Я коротко поделюсь, с
21:42каких можно начинать. Поделюсь своим
21:44мнением. Ну, естественно, это поле для
21:46комментариев, для рассуждений. Если у
21:48вас есть какой-то опыт, поделитесь им с
21:50другими. Карма вам вернётся, да? Итак,
21:52моё открытие Квен. Он у нас пойдёт для
21:54текста. Он хорошо владеет русским языком
21:56и подходит для простых рабочих задач.
21:58Например, структурирование, письма,
22:00заметки, если нужно что-то
22:01переформулировать для объяснений, иногда
22:03даже для кода. У нас есть моделька гема,
22:05модели Google. Они у нас интересны тем,
22:08что многие версии, они умеют неплохо
22:09работать не только с текстом, но они ещё
22:11могут работать с изображениями. Если вам
22:13нужно в самолёте, например, разобрать
22:15фото чеков, либо скриншоты, документы,
22:17там таблицы по картинке, то Гема вот для
22:19этого поможет. Есть у нас P4 Mini. Это
22:22маленькая модель от Майкрософта. Её
22:24конкретно можно попробовать для
22:26математики, для цифр. Ещё у нас есть
22:29семейство Small LM. Это именно прямо от
22:32самой площадки Huging Face. Это такие
22:34маленькие модельки. Они не будут самыми
22:36умными, но их плюс в том, что они просто
22:38очень лёгкие. То есть это вариант прямо
22:40для суперслабого компьютера или для
22:42самого первого теста, чтобы вообще
22:44просто понять, как вообще работают
22:45локальные модели. Но что здесь очень
22:47важно сказать? Всё, что я вам сказала,
22:49оно может не сойтись потом с вашим
22:51мнением, с вашим опытом, потому что у
22:53каждой модели есть свой характер, да,
22:55одна лучше пишет, другая лучше
22:57структурирует, третья быстрее, четвёртая
22:59лучше понимает изображение, какая-то
23:00лучше работает на вашем компьютере или
23:02под вашу задача. В общем, идеальный
23:03способ - это взять просто несколько
23:05моделей и просто прогнать их на своих
23:08реальных задачах. Ну и теперь, конечно
Зачем нужны локальные модели
23:10же, главный вопрос - это вообще зачем
23:12это мощному человеку в каких-то задачах
23:14локальной модели? Как вообще они могут
23:16быть полезны и зачем их держать у себя
23:18на компьютере? И первый сценарий
23:20использования - это работа без
23:21интернета. Если вы часто уезжаете,
23:22самолёт, поезд, дача, командировка,
23:24плохой Wi-Fi. И если у вас, в принципе,
23:26компьютер позволяет, почему бы нет,
23:28иметь такую вот локальную модельку,
23:30которую вы можете потом запускать.
23:31Второй сценарий, его в основном
23:33используют именно уже компании для
23:35конфиденциальности данных, да? Например,
23:37у вас клиентские реквизиты, внутренние
23:39какие-то документы, личные таблицы,
23:40финансовая информация, в общем, личная
23:42информация. И не всегда хочется
23:44отправлять это в обычный сервис.
23:46Локальная модель, она даёт вам больше
23:47контроля, потому что обработка идёт на
23:49вашем компьютере. Третий сценарий
23:51использования - это документы и рутина.
23:53Например, черновик превратить в письмо,
23:54длинный текст, краткое резюме, заметку,
23:56структуру, транскрибация созвона, что-то
23:58такое небольшое рутинное. Ну и четвёртый
24:00сценарьй - это изображение, ска, чеки.
24:02Да, там, если модель поддерживает текст,
24:04ид, то можно дать ей фотографию или
24:06скриншот, попросить вытащить информацию,
24:08например, сумму из чека, данные из
24:09документа, там обшивку на скриншоте. То
24:11есть как бы локальная модель - это не
24:13обязательно замена чат GPT или clod. Я
24:15бы вообще про это так не думала. Это
24:17отдельный инструмент. Где-то слабее,
24:18где-то удобнее. Это я говорю для
24:20простого пользователя. Да, естественно,
24:22я не упоминаю тех людей, у которых есть
24:23определённые задачи. Они хотят прямо
24:25тренировать. Они создают свои модели.
24:28они тренируют их под свои задачи, под
24:29свой компьютер, под всё-всёвсёвсё своё,
24:31тогда, конечно, это совершенно другой
24:33разговор, да, но этих людей меньшинство,
24:35поэтому я сейчас это не упоминаю.
24:37Конечно же, простым людям с локальными
24:38моделями, с обычным компьютером, вам
24:40будет сложно разработать какую-то
24:42большую стратегию, анализировать
24:43огромные документы, вообще, в принципе,
24:45решать ваши задачи, потому что просто
24:47компьютер не потянет. Но попробовать
24:50точно стоит. Поэтому пробуйте,
24:52экспериментируйте, и увидимся в
24:53следующем видео. y