Мы пилим сук, на котором сидим
СтатистикаИнженеры учат нейронки работать за себя. Кейсы из жизни. https://ai.ovc.me/ Для связи @ovcme
- Последний пост
- 15:43
- Последнее чтение
- 13:53
- Постов за неделю
- 6
- Всего постов
- 24
- Тип
- открытый
- Язык
- русский
- Категория
- Технологии
- В каталоге с
- 12 авг.
- 1/24сутки в ленте
- 100
- 1/48двое суток
- 114
- 1/72трое суток
- 123
Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.
Посты
видео или голосовое, без подписи
Я отчетливо помню, что лет 10 назад видел где-то на просторах интернета или вообще в журнале "Игромания" (забавный факт - я там чуть чуть на сайте работал и плотно сидел модератором на форуме много лет, пока не надоело) рассказ о том, как программистов заменили слишком умные телефоны. Тогда я прочитал и забыл, а вот недавно вспомнил и нашел его - разумеется с помощью ИИ. И делюсь с вами - Люди с кодопрошлым или закат программистов 2013 год между прочим, тогда еще только цепи Маркова были и Корчеватель. Если что редакция не считает что ИИ заменяет программистов, а считает что ИИ это инструмент, который делает жизнь проще. И я всегда и всем рекомендую не читать комментарии в интернете, но к той статье на хабре стоит. "ChatGPT привет передавал, просил не расходиться"
Как понять, что текст, картинку или код сделал ИИ? Обычно считается, что машинную работу видно издалека, а ещё туда обязательно вшивают какие-нибудь метки. Всё это почти правда. Самый очевидный способ - смотреть на результат. У текста анализируют предсказуемость слов, структуру фраз, повторяемость оборотов, пунктуацию. У картинок ищут артефакты генерации, особенности текстур и пикселей. Шесть пальцев и три руки уже редкость (Гемини даже по запросу так не делает), а вот зверски пересвеченные картинки ИИ почему-то до сих пор любит. Проблема в том, что человек тоже может писать ровно, скучно и предсказуемо. С кучей списков, дубовыми оборотами и длинными тире. А ИИ можно попросить писать короче, кривее и менять стиль. Я даже больше скажу - можно накормить его своими текстами и он прекрасно подстроится. Он только из коробки пишет плохо, надо ему задавать стиль текста. И вообще, ИИ ведь учился на текстах людей. Все эти «нейросетевые» обороты он взял у нас. Теперь люди читают ИИ, правят его тексты и сами перенимают те же конструкции. Сначала ИИ учился писать у человека. Теперь человека ловят на том, что он пишет как ИИ, который научился писать у человека. И кто тут кому подражает? Есть более серьёзная штука - водяные знаки. Генератор может специально оставлять скрытый сигнал: в изображении, например, через почти незаметные изменения, в тексте - через статистику выбора токенов. Но текст переписали, картинку обрезали, код отформатировали и отрефакторили - и метка начинает разваливаться. Есть ещё C2PA. Это уже не гадание по стилю, а криптографически подтверждаемая история жизни файла. Камера сделала фото. Потом его отредактировали. Потом ИИ добавил котика. Эти этапы можно связать в проверяемую цепочку. Но и C2PA не магия. Файл можно пересоздать, изображение заскриншотить, текст скопировать в новый документ. С обычным текстом вообще беда. Нейросеть написала абзац по моему заданию. Я переписал начало и конец, добавил данные и что-то выкинул. И чей теперь это текст? С кодом то же самое. Можно переименовать переменные, изменить структуру функций и провести рефакторинг, сохранив ту же логику. Поэтому обещания «мы точно определим, какой ИИ это написал» стоит воспринимать осторожно. Но вопрос, как говорится, в другом. Допустим, мы доказали, что текст написал ИИ. Мы умницы и классные ребята. А дальше что? Если текст корректный, решает задачу, не содержит ошибок и соответствует заданию, что именно не так? Если там нейробред - вопросов нет. Креатив Генерирован, Автор - Машина. Но в обычной работе ИИ не сам решил написать отчёт, ТЗ, статью или программу. Ему поставили задачу, дали исходные данные, а результат кто-то проверил или не проверил. ИИ - просто инструмент автоматизации. Очень сложный и часто меметичный, но инструмент. Никто же не возмущается Excel вместо счётов. Почему-то с ИИ пока действует странное правило: если работа сделана слишком быстро, надо выяснить, не жульничал ли человек. Хотя можно три часа самостоятельно писать ерунду, а можно за десять минут получить хороший результат, проверить его и использовать. Поэтому вопрос «это сделал ИИ?» сам по себе мало что значит. Гораздо важнее: задача решена? Результат корректный? Его проверили? Человек понимает, что получил, и готов за это отвечать? Если да, то какая разница, откуда оно родилось? ИИ не заменил автора задачи, проверку и ответственность. Он просто козырнул и сделал.
Большинство людей не умеют пользоваться ИИ. А надо ли? А есть ли чему учиться? С компьютерами и интернетом было примерно так же. Компьютеры должны были изменить человечество. Изменили: теперь на машинах невероятной мощности мы двигаем ячейки в Excel и смотрим мемы. Интернет дал доступ почти ко всем знаниям мира, после чего человечество немедленно занялось котиками и спорами с незнакомцами. И это прекрасно, чудеса науки. Теперь нам дали ИИ. Пока одна из самых сложных технологий в истории пишет поздравления бухгалтеру, «делает письмо более профессиональным» и рисует котиков. И это еще прекраснее. Сложнейшая технология доступнее некуда. Причем кажется, что нейронками уже пользуются все. А вот и нет. По оценке Microsoft, в начале 2026 года генеративным ИИ пользовались около 18% трудоспособного населения мира. Остальные гуглят. Впрочем, как это считали и можно ли этому верить, науке неизвестно. А порог входа смешной: просто напиши в чат. Буквально наука в каждый дом. Не надо знать, что такое LLM, RAG, harness, MoE или Transformer. Если вам с пафосом говорят: «Да что вы знаете про ИИ, если не отличаете harness от RAG?» - шлите их куда подальше. В поисковиках тоже есть операторы, индексация и свои шаманские практики. Но чтобы найти рецепт сырников, устройство Google изучать необязательно. Просто некоторым людям очень хочется самоутвердиться. С ИИ так же. Можно написать: «У меня 30 тысяч файлов. Хочу получать из них вот это. Я вообще не знаю, как это делается. Разберись и веди меня по шагам». Не обязательно знать, какой инструмент вам нужен. И что вообще такое инструмент. Можно прийти просто с проблемой. Промпт-магия тоже не обязательна. Не надо назначать модель «экспертом мирового уровня», заставлять глубоко дышать и угрожать отменой подписки. Некоторые, кстати, обижаются. Просто расскажите, что у вас есть и чего вы хотите. Или киньте свою сломанную табличку и скажите: «почини». Но тут есть подвох. ИИ очень сильно снизил порог получения профессионально выглядящего результата, а порог понимания, правильный ли он, снизился гораздо меньше. Поисковик хотя бы заставлял найти ссылку, открыть ее и что-нибудь прочитать. Нейронка сразу выдает готовый ответ. Красивый, убедительный и иногда неправильный. Я могу с ИИ написать программу, не будучи программистом. Она запустится, кнопки будут нажиматься, все красиво. А внутри база держится на изоленте, пароль администратора лежит в коде, а «Сохранить» сохраняет по настроению. И я этого не замечу именно потому, что я не программист. С договором и расчетами то же самое. Пятнадцать страниц юридического текста выглядят прекрасно до появления юриста. Расчет с формулами и тремя знаками после запятой выглядит научно, даже если первая цифра взята с потолка. Поэтому правило простое: если цена ошибки небольшая - пробуйте. Если большая - проверяйте. И «Ты точно уверен?» проверкой не считается. ИИ вполне может еще раз посмотреть на собственную ошибку и ответить: «Абсолютно». Спасибо, чел, ты лучший. И пара советов напоследок. Пользуетесь ChatGPT, Claude или другим нормальным ИИ-чатом - заведите проект, положите туда важные файлы и инструкции по конкретной работе. Получится постоянное рабочее место вместо очередного пустого чата. А хотите немного дешевой магии - заведите скиллы. Они позволяют один раз объяснить ИИ, как делать определенную работу, а не повторять это в каждом чате. Иногда еще и заметно улучшают результат. Но про скиллы отдельно. А пока все просто: чтобы начать пользоваться ИИ, не надо разбираться в ИИ. Просто напишите в чат. А чтобы бездумно ему доверять, желательно все-таки разбираться в том, о чем спросили.
Канал называется «Мы пилим сук, на котором сидим», что мне до сих пор кажется смешной шуткой. Но пора рассказать об одном из настоящих пилильщиков. И не про Альтмана и Маска, они на фоне этого человека скучные. Дэмис Хассабис. Если вы пользуетесь Gemini,…
Канал называется «Мы пилим сук, на котором сидим», что мне до сих пор кажется смешной шуткой. Но пора рассказать об одном из настоящих пилильщиков. И не про Альтмана и Маска, они на фоне этого человека скучные. Дэмис Хассабис. Если вы пользуетесь Gemini, то фактически пользуетесь результатом примерно тридцатилетней одержимости этого человека искусственным интеллектом. Сегодня он возглавляет Google DeepMind, которая делает Gemini, а заодно является лауреатом Нобелевской премии по химии 2024 года за работу над AlphaFold. Но начиналось всё с шахмат и компьютерных игр. Хассабис был шахматным вундеркиндом, в 15 лет попал в Bullfrog к Питеру Молиньё, работал над Syndicate и Theme Park, а затем в Lionhead занимался искусственным интеллектом в симуляторе бога Black & White. Если кто не помнит, там у игрока было огромное существо, которое училось на его действиях: наблюдало, получало поощрения и наказания и постепенно меняло поведение. На дворе был 2001 год. Потом Хассабис основал Elixir Studios и решил замахнуться уже на целое общество. В Republic: The Revolution он хотел симулировать десятки тысяч жителей виртуальной страны с отношениями, убеждениями и собственным поведением. Для компьютеров начала нулевых замысел оказался слишком большим, и игру пришлось сильно упростить. Я еще помню что у игры в минимальных системных требованиях были заоблачные тогда 512mb RAM. А потом Хассабис уходит из игровой индустрии и получает PhD по нейробиологии. Человек много лет пытался сделать искусственный интеллект и в какой-то момент решил разобраться, как устроен настоящий. В 2010 году Хассабис вместе с Шейном Леггом и Мустафой Сулейманом основал DeepMind. Цель была сразу нескромной: не сделать ИИ для конкретной задачи, а разобраться с интеллектом как таковым и в итоге построить AGI. Начали снова с игр. Системы DeepMind научились играть в Atari по изображению с экрана, затем AlphaGo в 2016 году победила Ли Седоля, одного из сильнейших игроков в Go. Но игры были полигоном: маленькими мирами с понятными правилами, где можно проверять, способна ли машина самостоятельно учиться принимать сложные решения. А затем DeepMind вынес эту идею из игр в реальность. AlphaFold занялся одной из старых проблем биологии: предсказанием трёхмерной структуры белков. И вот здесь ИИ уже не играл лучше человека, а решал настоящую научную задачу. В 2024 году Хассабис и Джон Джампер получили за работы по предсказанию структуры белков Нобелевскую премию по химии. Путь от Black & White до Нобеля оказался удивительно прямым. Google купила DeepMind ещё в 2014 году, а в 2023-м объединила её с Google Brain в Google DeepMind под руководством Хассабиса. Именно эта структура сегодня делает Gemini. Поэтому Gemini не просто внезапный ответ Google на ChatGPT, а продолжение той же линии: сначала научить машину играть, потом учиться, затем решать научные задачи, а теперь сделать универсальную систему, которая работает с текстом, кодом, изображениями, звуком, инструментами и всё большим куском реального мира. Кстати архитектура современных ИИ - Transformer - это Google, но не наш герой. И Gemini тоже не конечная цель. Хассабис открыто идёт к AGI, универсальному искусственному интеллекту, способному решать огромный спектр интеллектуальных задач и, в его представлении, ускорить науку, создание лекарств, исследования в физике, энергетике и других областях. Звучит прекрасно. Есть только одна небольшая проблема: мы строим универсальную машину для интеллектуального труда в цивилизации, где огромное количество людей живёт именно за счёт интеллектуального труда. Вот поэтому Хассабис для меня один из главных пилильщиков. Не потому, что сделал очередной чат-бот, а потому, что уже лет тридцать довольно последовательно пытается построить интеллект лучше нашего. Black & White, DeepMind, AlphaGo, AlphaFold, Нобелевская премия, Gemini кажутся совершенно разными историями, но на самом деле это один длинный проект. Сначала сделать интеллект игрушечным. Потом полезным. Потом универсальным. Пила с каждым этапом становится мощнее. А сук всё тот же.
Музей реальности Представьте музей где-нибудь в 2040 году. За бронированным стеклом висит совершенно обычная фотография кота. Кот сидит на кухне. Ничего особенного. Табличка рядом: «Последняя подтверждённая фотография кота. 2026 год. Не сгенерировано. Происхождение подтверждено». Звучит как шутка. Но мы довольно быстро движемся в мир, где ценностью будет не возможность создать изображение, а возможность доказать, что его не создавали. Мы уже привыкли к тому, что нейросеть может нарисовать человека, которого никогда не существовало. Потом научились клонировать голос. Теперь генерируем видео. Всё это обычно обсуждают как проблему дипфейков: интернет будет завален подделками и мы начнём принимать их за настоящие. Но мне кажется, это не самая интересная проблема. Гораздо хуже, если произойдёт обратное: мы перестанем верить настоящему. Настоящая запись разговора? Синтез голоса. Настоящее видео? Дипфейк. Настоящая фотография? Нейросеть. Настоящая переписка? Нарисовали. И вот здесь я вспомнил Брета Истона Эллиса, автора «Американского психопата». В «Гламораме», написанной ещё в 1998 году, есть очень неприятная тема: подделывается уже не отдельная фотография или запись, а сама реальность. Фотографии показывают одно, видео другое, люди рассказывают третье. Герой вроде бы сам видел событие, но появляются свидетельства, что всё было иначе. В какой-то момент становится невозможно понять не только, что подделано, но и каким способом вообще можно доказать, что что-то было настоящим. В 1998 году это была постмодернистская паранойя. Сейчас у нас для неё появился технологический стек. ИИ последовательно снижает стоимость подделки почти до нуля. Photoshop тоже позволял изменить фотографию, но хорошая подделка требовала времени и навыков. Теперь фото можно сгенерировать, голос клонировать, видео синтезировать. А следующий шаг гораздо интереснее отдельного дипфейка. Можно подделывать не файл, а целую цепочку реальности: фотографию события, видеозапись, телефонный звонок, переписку, документы, публикации в соцсетях и свидетельства нескольких «людей». И всё это будет согласовано между собой, потому что генерировать эту реальность сможет одна система. ИИ атакует не столько правду, сколько доказательную стоимость информации. Последние сто лет человечество совершенствовало способы фиксировать реальность: фотография, звукозапись, кино, цифровое видео. Мы привыкли считать сам факт существования записи аргументом. Теперь этого недостаточно. Важнее становится происхождение файла: каким устройством он создан, когда, изменялся ли после записи и сохранилась ли проверяемая цепочка происхождения. Для этого уже появляются стандарты вроде C2PA и криптографической подписи контента. Такая подпись, конечно, не докажет, что происходящее перед камерой было правдой. Но она сможет доказать хотя бы то, что конкретный файл действительно появился на конкретном устройстве и после этого изменялся определённым образом. То есть аргументом постепенно становится не «у меня есть видео», а «у меня есть проверяемый оригинал». И тогда наш воображаемый Музей реальности уже не кажется таким смешным. Контента будет бесконечно много. Мы сможем создать фотографию чего угодно, видео чего угодно и голос кого угодно. А за стеклом будет лежать обычная фотография кота. Потому что реальность станет дефицитным ресурсом.
Читаю очередную новость про сбежавшие и сломавшие все ИИ. В маркетинг Антропики точно умеют прекрасно, а вот другие только подражают. Мем, конечно, украл.
LoRA: ожидание и реальность Всем же очень хочется доучить модель под свои нужды? Она не тупит, просто мы ее не научили! В теории всё выглядит прекрасно. Берём готовую языковую модель, не трогаем её миллиарды весов, добавляем небольшие обучаемые матрицы и за сравнительно небольшие деньги меняем поведение модели под свою задачу. Это и есть LoRA. Вместо полноценного переобучения модели мы обучаем небольшой адаптер, который потом подключается поверх исходной модели. Есть ещё QLoRA. Идея та же, только сама базовая модель во время обучения лежит в памяти в 4-битном виде. Поэтому модель на 9B параметров уже можно дообучать не в стойке с A100, а буквально дома. На NVIDIA с 8 ГБ VRAM это уже возможно, хотя придётся экономить на длине контекста и размере пакета. С 16 ГБ становится гораздо приятнее, с 24 ГБ уже почти цивилизация. Из программ самый простой вход сейчас через Unsloth, дальше можно уходить в PEFT, TRL или Axolotl. Но тут и начинается «реальность» с котом и пилой. Главная проблема LoRA вообще не в том, как запустить обучение. Запустить его относительно легко. Проблема в том, чему именно учить модель. Допустим, у нас есть агент, который должен работать со сметной базой. Саму ФСНБ бессмысленно пытаться запихнуть в LoRA. Для этого есть база, поиск и инструменты. А вот научить модель правильному поведению вполне можно: сначала открыть каталог, потом получить кандидатов, прочитать карточки, сравнить их, не придумывать отсутствующую норму и честно вернуть unbound, если доказательств недостаточно. И тут понадобятся трейсы. Трейс выглядит примерно так: запрос → вызов инструмента → результат → следующий инструмент → результат → итоговый ответ То есть мы записываем реальные хорошие проходы агента, чистим их, исправляем ошибки и используем как учебные примеры. Не внутренний «поток мыслей» модели, а именно наблюдаемое поведение: какой инструмент она выбрала, с какими параметрами, что получила и какое решение после этого приняла. Поэтому LoRA немного похожа на обучение нового сотрудника. Можно купить ему прекрасный учебник, но гораздо полезнее показать несколько сотен правильно выполненных рабочих задач. А если показать несколько тысяч плохих примеров, он очень эффективно научится делать неправильно. И вот здесь становится понятно, зачем вообще это может понадобиться агентным системам. RAG даёт модели знания. Tools дают ей возможность действовать. А LoRA может закрепить привычку действовать правильно. И, пожалуй, это намного интереснее попыток «загрузить знания в модель».
Готова ли ваша организация к применению ИИ? Часто внедрение ИИ начинают с выбора сервиса или модели. На практике результат сильнее зависит от другого: насколько описаны процессы и роли, структурированы данные, доступны корпоративные знания, определены критерии качества и правила безопасной работы. Мы в ROSECO (РУСЭКО-СТРОЙПРОЕКТ) собрали чек-лист ИИ-готовности для проектных, BIM- и обследовательских организаций: 92 критерия в 10 блоках — от устройства процессов и управления информацией до BIM, обследований и изысканий. Использовать чек-лист можно двумя способами: 1. Оценить текущее состояние компании, определить ИИ-сценарии, которые можно начать тестировать без дополнительной подготовки или с минимальными трудозатратами, и выстроить последовательность их проверки. 2. Выбрать конкретный сценарий — например, для наиболее перегруженного подразделения или узкого места процесса, — проверить применимые условия и определить критичные разрывы, которые необходимо устранить. Чек-лист не выводит универсальный «процент зрелости». Его задача — помочь понять, какие ИИ-сценарии можно тестировать уже сейчас, а какие пока упрутся в данные, процессы, ответственность или инфраструктуру. Разработали: Александр Лапыгин (@lapaleks) и Варвара Квашнина (@madmuaszel), при участии рецензентов — экспертов по BIM и цифровизации строительства. 🚀Полная методическая версия с пояснением каждого критерия, глоссарием и разбором применения — по ссылке 💡Нужна экспертная поддержка после оценки? — Напишите нам: info@roseco.net📝 #ИИ #BIM #ТИМ #ROSECO
Большой могучий грандиозный и не только труд уважаемых коллег по теме внедрения наших нейронных друзей в стройку. Горжусь, что приложил чуть чуть руку!
По сути, RAG — это костыль. Очень полезный, местами виртуозно настроенный, но всё-таки костыль. Языковые модели почти ничего не запоминают после обучения. Мир меняется, данные обновляются, проект развивается, а модель продолжает жить с тем, что однажды записали в её веса. До недавнего времени многие современные модели, например, продолжали считать НДС в России равным 20% и уверенно называли это истиной. Чтобы ИИ не отрывался от реальности, придумали RAG: режем документы на куски, складываем их в векторную базу и перед каждым ответом пытаемся подобрать фрагменты, которые помогут модели. Если посмотреть со стороны, конструкция выглядит странно. Менеджер спрашивает, почему сместились сроки. Вместо того чтобы помнить историю проекта, система ищет похожие куски переписки, протоколов и задач, складывает их в промпт и надеется, что LLM восстановит картину. Работает? Да. Похоже на настоящую память? Не особенно. Настоящая память связывает события, обновляет картину мира, разрешает противоречия, выделяет важное и постепенно забывает мусор. И работа в эту сторону уже идёт. Первое направление - агентная память, например Letta. У модели появляется иерархия памяти: небольшой рабочий контекст и долговременные хранилища. Агент сам решает, что сохранить, что забыть и что вернуть обратно. Это ещё не память внутри модели, а скорее новая архитектура вокруг неё. Второе направление - архитектуры вроде Mamba. Они отказываются от классического механизма внимания и вместо постоянного обращения ко всему контексту сжимают прошлый опыт во внутреннее состояние модели. Это ещё не замена RAG, но шаг к более естественной работе с памятью. Третье направление - Titans от Google. Здесь появляется отдельный модуль нейронной памяти, который обновляется прямо во время работы модели. Новые знания перестают быть просто текстом рядом с моделью и постепенно становятся частью её долговременного состояния. Пока это исследовательские проекты, но направление выглядит очень перспективным. Если подобные идеи станут зрелыми, схема изменится. Сегодня: запрос → поиск чанков → контекст → ответ. Завтра: событие → понимание → обновление памяти → изменение модели мира. Тогда ИИ не придётся заново разбирать переписку, чтобы узнать, что заказчик заменил насос. Он будет помнить сам факт: «Насос заменён по письму №147», понимать, к какой версии проекта относится это решение и какие документы ещё требуют изменений. Конечно, появятся новые проблемы. Как исправить ложное воспоминание? Как разрешить противоречия? Как доказать происхождение знания? Именно поэтому классический RAG ещё долго никуда не денется. Его главный плюс - проверяемость. Всегда можно открыть документ, показать источник и пересобрать индекс. Скорее всего, переход будет постепенным. Документы и базы останутся источниками истины, графы будут хранить связи, агентная память — историю работы, нейронная память — накопленный опыт, а LLM станет диспетчером всей системы. Мне кажется, будущее RAG не в том, чтобы ещё лучше резать PDF на чанки. Оно в том, чтобы однажды перестать их резать вообще. Тогда RAG останется в истории как переходный этап между замороженными весами языковых моделей и ИИ, который действительно умеет помнить.
Никто не знает зачем, но Гугл встроил в Google Earth нейронку для генерации избражений прямо поверх карту. Лимитка маленькая, но можно побаловаться. UDP А все!
видео или голосовое, без подписи
Я не люблю видео, я люблю читать. А сейчас почему-то всем проще записать видео на час вместо того, чтобы дать краткий емкий текст, который можно прочитать где угодно, быстро просмотреть по диагонали, найти нужное через поиск и через полгода вернуться ровно…
Я не люблю видео, я люблю читать. А сейчас почему-то всем проще записать видео на час вместо того, чтобы дать краткий емкий текст, который можно прочитать где угодно, быстро просмотреть по диагонали, найти нужное через поиск и через полгода вернуться ровно к тому месту, которое понадобилось. Особенно странно это выглядит в технических материалах. Человек сорок минут показывает экран и рассказывает то, что спокойно уместилось бы в статье на пять страниц. Иногда скорость можно поставить на х2, но это все равно двадцать минут просмотра вместо нескольких минут чтения. Поэтому логичное решение для канала о нейросетях состоит в том, чтобы превратить видео обратно в текст. Для этого существуют модели Speech-to-Text, или STT. Они берут аудиодорожку и возвращают расшифровку, обычно с таймкодами, пунктуацией и определением языка и даже со спикерами. Дальше можно подключить LLM: убрать повторы и слова-паразиты, восстановить структуру, сделать конспект и собрать из часового видео нормальную статью. Но если STT потерял отрицание, перепутал термин или превратил Qdrant в «квадрант», дальнейшая обработка начинается уже с испорченного исходника. Самый известный представитель этого хозяйства - Whisper от OpenAI. Это универсальная многоязычная модель, старая по меркам нейросетей, но до сих пор вполне рабочая. Вокруг нее выросла огромная экосистема: оригинальный Whisper, ускоренный faster-whisper, whisper.cpp, графические оболочки и готовые серверы. Если нужно просто локально расшифровывать видео на разных языках, Whisper остается самым понятным началом. Есть и более специализированные модели. NVIDIA развивает Parakeet: быстрые модели для обычной и потоковой расшифровки, которые живут преимущественно в экосистеме NeMo. SenseVoice умеет не только распознавать слова, но и определять язык, эмоции и звуковые события вроде смеха, музыки или аплодисментов. Обычно его запускают через FunASR, где уже есть определение речи, пунктуация, разделение говорящих, потоковый режим и OpenAI-совместимый API. И тут внезапно обнаружился GigaAM от Сбера. Я по привычке ожидал чего-то в диапазоне от «интересный отечественный эксперимент» до «не имеет аналогов, но не работает», но модель оказалась очень даже. Это открытое семейство на базе Conformer, обученное на большом объеме русской речи. Авторы показывают результаты лучше Whisper Large-v3 на русскоязычных тестах. Собственные тесты производителя, конечно, не последняя инстанция, а профессиональную лексику все равно надо проверять самостоятельно, но GigaAM точно не выглядит моделью, которую добавляют в сравнение из вежливости. Проблема в том, что все эти модели живут каждая в своем загоне. Whisper обычно запускают через faster-whisper или whisper.cpp, GigaAM через собственный пакет, SenseVoice через FunASR, Parakeet через NeMo. Есть общие проекты вроде FunASR и sherpa-onnx, но полноценной Ollama для распознавания речи пока не сложилось, или я такой не нашел. Нельзя одной командой скачать несколько семейств моделей, переключаться между ними и получать одинаковый результат без отдельного вечера на борьбу с окружением. Поэтому следующим опытом будет простой сравнительный прогон: взять одно русское техническое видео, пропустить его через Whisper и GigaAM, сравнить скорость, ошибки, термины и таймкоды, а затем отдать расшифровку модели для сборки нормального текста. Для первого опыта построим виварий и проведем опыты над: GigaAM v3 e2e RNNT Whisper large-v3-turbo Qwen3-ASR-1.7B 8-bit Parakeet TDT 0.6B v3 Оценивать будем скорость и качества текста на выходе с учетом специальной терминологии. По итогу посмотрим кто решит проблему часовых видео.
Как дать домашней нейросети топор Вы решили завести домашнюю языковую модель. Скачали Qwen, Gemma или Llama, поставили Ollama и запустили: ollama run gemma4 Поздравляю: у модели появился дом. Ollama загружает её в память, принимает запросы и даёт другим программам доступ по API. Модель живёт локально и отвечает без чужого облака. Но по хозяйству она пока бесполезна. Она не может открыть папку с проектом, прочитать Excel, выполнить SQL или посчитать смету. Зато может подробно объяснить, как всё это сделать, и уверенно сообщить, что уже закончила. Потому что дом есть, а мастерской нет. Мастерская вокруг модели называется harness, или агентная обвязка. Она передаёт задачи модели, хранит контекст, выполняет команды, возвращает результаты и определяет, что вообще разрешено делать. В мастерской лежат tools: найти документ прочитать файл поискать в интернете запросить базу запустить Python создать Excel отправить письмо Готовый harness необязательно писать самому. Поверх Ollama можно поставить AnythingLLM, Open WebUI, LibreChat или собрать собственную обвязку на Python, LangGraph либо Qwen-Agent. Принцип один: Ollama - дом. Модель - жилец. Harness - мастерская. Tools - топоры, пилы и ключи. Но тут появляется следующая проблема: как заставить модель действительно взять топор, а не торжественно объявить: Сейчас я открываю файл, анализирую документ и запускаю расчёт. Некоторые локальные оболочки этим грешат особенно охотно. На экране кипит работа, но ни один файл не открыт, ни одна команда не выполнена и ни один байт не пострадал. Лечится это не промптом, а правилами мастерской. Действием считается только настоящий вызов инструмента. Если модель написала «я читаю файл», но не вызвала read_file, файл не прочитан. Если вызвала send_email, но получила ошибку, письмо не отправлено. Если расчётчик ничего не вернул, результата нет. слова модели ≠ действие вызов tool ≠ успешное действие успешный результат tool = факт Модель просит у harness инструмент и передаёт аргументы. Harness проверяет запрос, выполняет функцию обычным кодом и возвращает фактический результат. Получается цикл: модель решила → harness проверил → tool выполнил → результат вернулся модели Вот тогда домашний собеседник становится агентом. Если модель вместо вызова инструмента изображает работу словами, хороший harness отвечает: Действие не выполнено. Вызови нужный tool. Повторила спектакль ещё раз — шаг провален. Современные локальные модели уже неплохо пользуются tools, но могут перепутать функцию, испортить аргументы, зациклиться или объявить победу раньше времени. Чем меньше модель, тем проще должна быть мастерская: найти → прочитать → ответить Если выдать ей двадцать похожих функций и универсальный execute_anything, она быстро превращается в человека, который ищет молоток, держа его в руке. Поэтому локальному агенту нужны короткий набор tools, строгие аргументы, ограничение шагов, проверка результатов кодом и подтверждение опасных действий. Главное правило мастерской: Модель не определяет, выполнена ли работа. Это определяет harness по результату инструмента. Иначе домашняя нейросеть так и будет сидеть рядом с топором и убедительно рассказывать, как уже нарубила дров.
Все же видели посты "Я написал Клоду/ГЛМ/ГПТ сделай мне игру и он сделал копию ГТА про Нижневартовск где можно зайти в каждый дом!"? Разумеется такое можно попросить и разумеется ничего у вас путного так не выйдет. Все таки какие то усилия надо прилагать.…
Все же видели посты "Я написал Клоду/ГЛМ/ГПТ сделай мне игру и он сделал копию ГТА про Нижневартовск где можно зайти в каждый дом!"? Разумеется такое можно попросить и разумеется ничего у вас путного так не выйдет. Все таки какие то усилия надо прилагать. Я решил усилий не прилагать, накидал идей на пол страницы, скормил кодексу вместе с каналом Олега и за пару часов он мне собрал симулятор стройки офисов в стиле Evil Genius. Берем заказы на глобальной карте Фиксирум бюджет и график Нанимаем команду и подрядчиков Ставим планы на день Пишет в вотсап "сделать надо срочно!" Закрываем объекты, если повезло то даже в в плюс. Все это в симпатичном 3D. Поиграть можно тут. Исходный код тут. Если интересно вообще про офисы и прочую стройку - это к Олегу
Мучаю я тут модуль расчета сметной стоимости, потом покажу что получилось. И самое сложное - найти тонкую грань мжду кодом, промтом и свободой модели. В работе с ИИ постоянно хочется то мешать модели, то помогать ей, и очень легко впасть в одну из двух крайностей. Первая крайность состоит в том, чтобы настолько не доверять модели, что попытаться заменить её мышление правилами. Для этого пишется огромный промпт, затем к нему добавляется навык с подробным порядком действий, потом проверки, условия, справочники и отдельное правило на случай, если предыдущие правила вступили в драку. В итоге получается уже не система с ИИ, а организация закупок в госкомпании: формально всё работает, но чтобы поменять одну лампочку, надо заполнить семь таблиц и найти человека, который писал первую версию в 2019 году. Вторая крайность заключается в том, чтобы отдать модели вообще всё, потому что она же умная. Пусть сама прочитает ведомость, найдёт норму, выберет коэффициент, проверит ресурсы, посчитает стоимость и объяснит заказчику, почему всё получилось именно так. Проблема только в том, что модель действительно всё это сделает, даже если не знает как, а особенно охотно именно тогда, когда не знает. Мы сейчас как раз проверяли это на сметном модуле. Модель получила строку ВОР, сама просмотрела каталог сборников, сформулировала поисковые запросы, нашла несколько норм, открыла карточки, сравнила составы работ и выдала решение. То есть сама идея работает: модель действительно может пройти путь, похожий на работу живого инженера, а не просто выбрать первый результат поиска. Промпт и навык объясняют модели, как работать: не выбирать норму по названию, искать несколькими способами, открывать карточки, сравнивать состав работ и показывать, почему одна норма выбрана, а остальные отвергнуты. Они не принимают решение за модель, а просто не дают ей схватить первый красивый шифр и немедленно побежать считать. Модель отвечает за смысл. Она должна понять, что «монтаж установки» является слишком общей формулировкой, отличить новую работу от ремонта, проверить технологию и решить, подходит норма точно, является аналогом или вообще не применима. Код нужен там, где думать уже не надо. Он проверяет, что выбранная норма существует, карточка действительно открывалась, единицы измерения совпадают, коэффициент взят из справочника, ресурс не учтён дважды, а сумма действительно равна сумме. При этом код не должен тихо выбирать другую норму вместо модели, потому что тогда получится тайный сметчик, который сам всё исправил, а в отчёте написал, что решение приняла нейросеть. Но код обязан остановить явное противоречие, например когда модель говорит, что ремонтная норма точно соответствует новой работе, или одновременно называет одну и ту же норму точной и приблизительной. То же самое с ценами. Если модель пишет, что оборудование стоит 850 тысяч рублей, код должен спросить, откуда взялась цифра. Ответ «из открытых данных» источником не является, это скорее признание. Получается довольно простое разделение обязанностей. Промпт и навык помогают модели не потеряться, модель ищет, сравнивает и предлагает профессиональное решение, код проверяет доказательства, ограничения и расчёты, а человек решает, когда всё это перестаёт быть черновиком и становится документом. Первая ошибка заключается в попытке заменить модель правилами, вторая в попытке заменить правила моделью. Рабочая система появляется где-то посередине, обычно после нескольких тестов, пары странных норм и одной очень уверенной нейросети, которая опять всё поняла немного не так.