Бунин в деле | Бизнес, ИИ и о личном
СтатистикаТаксопарк на 9 городов (РФ + Турция, Yandex.GO). Автоматизирую бизнес нейросетями - CRM, звонки, отчёты, зарплаты. Показываю что работает, что ломается и сколько стоит. Автоматизация для бизнеса → buninlab.com Написать мне → @buninand
- Последний пост
- 14 авг.
- Последнее чтение
- 09:39
- Постов за неделю
- 2
- Всего постов
- 22
- Тип
- открытый
- Язык
- русский
- Категория
- Бизнес
- В каталоге с
- 13 авг.
- 1/24сутки в ленте
- 71
- 1/48двое суток
- 81
- 1/72трое суток
- 87
Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.
Посты
Кто виноват, если дефект написал Claude: разработчик или компания? На днях мы с семьёй ездили купаться со знакомыми. Среди них был разработчик с большим опытом — человек, который много лет профессионально пишет код. Разговорились про AI-разработку. Он сам сейчас активно использует Claude Code, очень им доволен, но сказал интересную вещь: «Я не готов отвечать за код и проекты, которые написал Claude». И вот здесь у нас возник спор. Я сейчас вообще стараюсь не использовать термин «вайб-кодинг» для всей разрабокти через нейронки. Для меня вайб-кодинг — это когда ты просто говоришь нейросети: «сделай мне вот это», особо не понимаешь архитектуру, не контролируешь процесс и ждешь, пока всё заработает. Мы в своих проектах пытаемся строить совершенно другой подход: разработка с помощью AI по формализованному протоколу. Как это выглядит у меня. Сначала появляется задача или новая функция. Первый этап — подробное ТЗ. Мы раскладываем бизнес-логику, сценарии, ограничения, пограничные случаи, ожидаемое поведение. Потом Claude идёт непосредственно в существующий проект и проверяет, насколько это ТЗ вообще совместимо с текущей архитектурой. Если обнаруживаются противоречия, зависимости или проблемы, мы сначала меняем ТЗ и только потом начинаем разработку. Дальше разработка идёт субагентным методом. Несколько агентов работают параллельно: пишут код, проверяют изменения, запускают тесты, ищут ошибки, подтверждают их, исправляют и снова тестируют. После завершения разработки изменения отправляются в работу. Но на этом процесс не заканчивается. После крупных/средних изменений я запускаю отдельное глубокое ревью проекта — опять же субагентным методом. Иногда такое ревью идёт много часов. Мой личный рекорд — 474 запущенных субагента, сутки ревью в рамках проверки одного проекта. Найдено было 12 критических ошибок и что-то около 30 мелких, больше косметических. Важно, что задача агентов не просто написать список потенциальных проблем. Если агент считает, что нашёл ошибку, он должен попытаться её воспроизвести и подтвердить. Потенциальные проблемы отделяются от реально подтверждённых. В конце получается большой отчёт. После этого подтверждённые ошибки исправляются, изменения снова тестируются, и цикл повторяется. По сути, у нас постепенно появляется протокол AI-разработки. И именно через него я смотрю на вопрос ответственности. Если разработчик обязан: — нормально подготовить ТЗ; — проверить его на совместимость с архитектурой; — соблюдать правила разработки; — провести тестирование; — провести обязательное ревью; — отработать найденные проблемы; и он всё это сделал, но дефект всё равно прошёл в проект — я не считаю правильным автоматически вешать этот дефект на разработчика. Он выполнил утверждённый компанией процесс. Значит, это остаточный технологический риск, который принимает компания. Если же разработчик решил срезать угол — не провёл ревью, проигнорировал тестирование, не проверил архитектурные последствия или нарушил другой обязательный этап протокола — тогда уже возникает его персональная зона ответственности. Мне кажется, именно так компаниям стоит подходить к AI-разработке. Проблема не в вопросе: «Можно ли доверять коду Claude?» Это неправильный вопрос. Мы ведь и человеческому коду не должны просто «доверять». Правильный вопрос другой: Какой процесс должен пройти код — независимо от того, написал его человек или AI, — прежде чем компания готова принять связанный с ним риск? И если этот процесс формализован, появляется сразу две вещи: 1. существенно снижается вероятность критической ошибки; 2. становится понятно, где заканчивается ответственность разработчика и начинается ответственность компании. Роль человека в разработке смещается — с «писать код» на «проверять и направлять», почитать можете тут. А значит и ответственность надо считать не по строчкам кода, а по соблюдению процесса. Относительно нашего спора, сошлись на том, что обсудим наш протокол разработки через ИИ, а там решим ок это или нет. Спасибо, что дочитали 🙏
Проверяю, родственник ли я писателю Бунину. Как GPT за пару часов довёл меня до архивных дел 1920-х годов Я давно хотел заняться историей своего рода. Понять откуда он начинается, кто был у меня в роду, паралельно ответив на вопрос, являюсь ли я каким-то дальним родственников писателя И.А. Бунина. Вероятность конечно низкая, но проверить всё равно интересно. На днях я проверил докуда можно дойти нейронками. Спойлер: дальше, чем я ожидал. Что нашлось за пару часов: Прямая линия из пяти поколений: - Евсей Николаевич (прапрадед) - Ипполит Евсеевич (прадед) - Андрей Ипполитович (дед) - Алексей Андреевич (отец) - я Андрей Бунин. Прапрадед Евсей Николаевич — GPT нашёл в опубликованных описях ЦАНО (архив Нижегородской области) два его личных дела: студента медицинского института 1920–1923 годов на 17 листов и сотрудника 1923–1929 на 27 листов. Не «где-то что-то было», а конкретный фонд, опись, номер дела. По семейным данным он врач, глазной хирург, 1884 года рождения — но это пока со статусом «требует проверки», первичного документа нет. Прадед Ипполит Евсеевич — артист театра. Нашлись нижегородские публикации по истории театра, где он упоминается по полному имени: служил в горьковском театре «Снайпер» со дня его основания, а полное имя всплыло в журнале нижегородского театра «Комедiя». Совпало с тем, что рассказывали в семье. Брат прадеда — фронтовик, подполковник. «Память народа» подтверждает: звание, точная дата рождения 07.09.1918, место рождения Горький. Где можно нафакапить. Генеалогия — идеальная зона для галлюцинаций нейронки. Попроси найди мой род — и она с удовольствием нарисует красивое древо до бояр. Поэтому каждый факт в моём документе имеет статус: семейные данные (рассказали родственники), внешнее подтверждение (найден независимый источник) или требует проверки. В итоговый файл факт попадает только со ссылкой на источник — опись архива, публикацию, базу «Память народа». Как я вообще это делал? Простыми промтами закидывал GPT, просил помочь составить генеалогическое древо. Скормил все данные по линии отца, что я знаю. Далее на созвоне с отцом вытащил у него то, чего я не знал и также скормил GPT. Методом дедукции и онлайн поиска мы смогли установить родственников о которых писал выше. GPT в данном случае является хорошим ассистентом, который помогает апрувить и сопоставить факты, направить меня и создать логику исследования. А что с писателем? Пока - ничего. Связь с ветвью Ивана Алексеевича не установлена, и созвучие фамилии само по себе не доказывает ровным счётом ничего. Поэтому продолжаю искать. Дальше - самое интересное: через отца получаю доступы, заказываю дела в архиве. Цель — метрические записи, которые уведут глубже 1884 года. Плюс в той же описи лежит третье дело «Бунин Е.Н.» на 4 листа — надо проверить по содержимому, тот ли это Евсей Николаевич или однофамилец. По мере расследования буду писать об этом. 🕵️♂️ Спасибо, что дочитали 🙏
30 лет жил по одним правилам, теперь живу по другим. Что изменилось в управлении Бизнесом., Те кто работал одновременно с двумя странами, особенно где ментальность сильно отличается, наверняка может с вами поделиться опытом как лавировать между ними. Я тоже хочу поделиться этим опытом, и показать как я это проживаю и чувствую. Моя работа строится внутри России и Турции. В России на пике у нас было более 45 сотрудников таксопарка в Турции что-то около 10. Понимаю, что часть разницы это просто размер команды, но не вся. Ниже тезисно опишу разницу в работе и подходе. 1. Время. В России не принято опаздывать на встречи/работу, и ещё раньше времени уходить с рабочего места. У нас сидит какое-то советское наследие уставных правил. Вот в 18:00 рабочий день окончен, значит порог офиса можно переступить ровно в 18:01. Такое тоже должно быть, но не везде. Например на складах Озон где автоматизация и начисления зарплат по рабочему времени это логично, карточкой отметил вход/выход. В случае с менее рутинной офисной работой уже могут быть послабления. В Турции наши дейлики/планерки спокойно могут смещаться на 15-20 минут и ни у кого от этого не подгорает (кроме меня и то год назад 😅). Так же мы строго не следим, чтобы работник ушел с работы в 18:01 — потому, что за этим следят роботы 😈 Как именно мы контролируем удалёнщиков без паранойи — советую почитать тут. Но если он закончил пораньше, это не критично — намного важнее его результат и не переходит ли это рамки разумного. 2. Регламенты. В РФ мы любим обложиться инструкциями и регламентами, чтобы сотрудники работали по ним как по часам. Это далеко не везде, но в целом тенденции к этому есть. Пример — российский банкинг или общепит вроде До-До пиццы. В Турции персонал банка может действовать более свободно — в разных отделениях банка может быть разная информация, хотя источник у неё общий. Интересный кейс произошел со мной в Старбаксе. Мы с коллегой стояли в очереди за кофе и она попросила у кассира взять у неё наличкой лиры и перевести сыну на карту деньги, так как её банк был не доступен. Кассир Старбакса без проблем это сделал. Я слабо себе представляю, чтобы такое случилось в российской сетевой кофейне. И дело тут не в кассире, а в том, что у него над головой висит регламент. 3. Планёрки. Дейлики/планерки в Турции проходят более расслабленно. Сотрудники могут делиться информацией о личной жизни или всех публично позвать на свадьбу. В России, в нашей сфере я этого не припомню, обычно все более серьезны. 4. Прямота. В РФ мы часто высказываем сотрудникам то, что думаем об их работе. Есть правило — ругай лично, хвали публично — оно более менее соблюдается. Но в Турции мы чаще стараемся смягчать. То есть использовать что-то вроде завуалированных терминов при описании работы сотрудника. Не «ты налажал», а «что-то у нас тут пошло не так». Не «ты план не выполнил», а «странно, почему план не был выполнен?». В Турции часто если не дошло до прямого конфликта многие вещи смягчают и часто не говорят нет. Вместо нет — посмотрим, подумаем, завтра увидим и так далее. Главная ловушка для русского управленца. Ты по привычке слышишь «посмотрим» и записываешь себе в голове «да». А тебе вообще-то сказали нет. 5. Деньги. В Турции многие вещи связанные с оплатами могут подождать. И это не вызывает какого-то напряга. Выполнили услугу — заплатим потом, завтра. В РФ как правило (далеко не всегда), но деньги приходят более стабильно. Что я из этого вынес Первый год я хоть и ограниченно, но пытался использовать российский подход в турецкой команде. Регламенты, дедлайны, прямая обратная связь в лоб. Люди при этом не стали работать лучше, они просто перестали спорить. Сейчас у меня получается так. Всё что касается процессов и цифр — учёт рабочего дня, план по звонкам, скрипты, оценка звонков нейронкой — тут никаких «завтра увидим», это считают роботы, а они формулировки не смягчают. А вот когда надо донести человеку, что он просел, я это делаю уже на понятном ему языке. Спасибо, что дочитали 🙏
Продолжаю сранивать американские и русские модели ИИ Сегодня я провел исследование как наш слоняра ИИ от Yandex работает с турецким языком. Задача — перевод турецкой речи (аудиозаписи) в текст. Сейчас и ранее мы для этого использовали 11labs, но по моим предыдущим исследованиям 11labs проиграл в точности распознавания речи Yandex SpeechKit в русском. Потому, что у Yandex сильно больше данных с русской речью чем у 11labs для обучения своих моделек. (которые кстати Герман Греф считает китайскими, но под шильдиком Yandex 😀 — сам Яндекс это отрицает). Поэтому я провел исследование и сравнение в турецком языке. У нас в Турции ИИ-ОКК слушает 100% звонков менеджеров — как я его несколько месяцев доводил до ума, писал тут. Работает это только пока запись правильно переведена в текст. Распознали криво — и оценщик штрафует менеджера за слова, которых не было. Когда я сравнивал две модели на русских звонках — Yandex SpeechKit против американского 11labs — Яндекс выиграл: 250 побед против 91 на 358 звонках, писал об этом здесь. Логично было взять этот вывод и просто перенести на турецкий проект. Но нет. Как я считал Взял 300 наших реальных звонков — почти 13 часов турецкой речи. Прогнал через обе нейронки. Тексты обезличил и перемешал в пары A/B, чтобы судья не знал, где какая модель. Отдал на слепую сверку. Смотрели связность диалога, бессмыслицу, повторы, искажение имён и названий, и отдельно числа. Результат: 279:0 в пользу 11labs. Двадцать одна ничья — это почти всегда звонки, где речи вообще нет: гудки и автоответчик. Даже я от такого был мягко говоря удивлен 😨 Как именно ломается Яндекс на турецком Он не просто ошибается в словах. Он сваливается в узбекскую фонетику (если что Узбекский и Турецкий языки в одной языковой группе). Похоже, тянет к тому тюркскому языку, которого было больше в обучении. Сильные косяки были в числах: — комиссия 3% превратилась в 103 — скидка 8% — в 800 — баланс 602 лиры — в «602200» А теперь, про что вообще эти разговоры. Водитель такси спорит о комиссии, диктует свои реквизиты, уточняет сумму выплаты и свой рейтинг. Если цифры едут, оценивать такой разговор нет смысла. Судья не знал, кого сравнивает Перед сверкой я убрал из текстов всё, по чему модель можно опознать: заглавные буквы, пунктуацию, служебные пометки. Потом на каждом звонке бросил монетку — кто будет вариантом A, кто B. Ключ отложил и не заглядывал. Судья отработал 300 пар и выдал свой итог: вариант A победил в 133 случаях, вариант B — в 146. И дописал вывод: разница в пределах погрешности, ни одна сторона не лучше другой. А потом я раскрыл ключ. Оказалось, что 133 и 146 — это один и тот же ИИ, просто в половине пар он стоял слева, а в половине справа. Судья ни разу не догадался, кто перед ним, и при этом внутри каждой пары стабильно тыкал в одного и того же. Совпадением это не объяснить. Вывод Далеко не всегда ИИ-модель распознавания голоса (и не только) бывает «лучше» вообще. Она бывает лучше на конкретном языке, на конкретном типе записи, на конкретной задаче — телефонная линия это не студийный микрофон. Один и тот же Яндекс на русских звонках ощутимо лучше американцев, а на турецких сильно проигрывает. Обзоры «лучших ИИ» тут не помогут: пока не прогнал свои записи или задачи, ты не знаешь ничего. Жду ещё доступ от турецкой модели Sestek, чтобы сравнить их с 11labs. Но они не спешат отвечать 🤷☕️ Спасибо, что дочитали 🙏
Что скрыто от простых пользователей Chat GPT и Claude? Я тут залип на тему, из чего физически состоит ИИ. Год назад писал, что OpenAI — это уже не компания, а инфраструктурный проект, и имел в виду дата-центры. Дата-центры — это ещё даже не середина всей инфраструктуры ИИ-проектов. По факту её можно разделить на 6 больших уровней. Мне было интересно в этом разобраться, поэтому хочу поделиться с вами, чтобы у вас было общее понимание как это работает. Короче, пойдём снизу вверх. От земли до чата, в который мы пишем запрос. 1. Кварц и кремний. Всё начинается с добычи сверхчистого кварца — из него делают посуду, в которой плавят кремний. Добывают его в основном в одном районе Северной Каролины, и две компании контролируют около 95% мировой поставки кварца нужной чистоты. Дальше кремний очищают, растят кристаллы, режут на пластины (заготовка для будущих чипов) — это Япония, Германия, Корея. Пока никакого ИИ. Просто металлургия и химия. 2. Машина, которая рисует. На пластине надо начертить схему из миллиардов транзисторов, и чертят их светом. Как проектором, только с другой точностью: на толщине одного человеческого волоса такая машина умещает около шести тысяч линий. А чтобы получить нужный свет, капли расплавленного олова расстреливают лазером 50 000 раз в секунду. Такие машины делает одна компания в мире — нидерландская ASML. Не лидер рынка, а буквально 100% рынка. Одна машина стоит 200 миллионов долларов, топовая — под 400. Весит около 150 тонн, собрана из 100 000 деталей, везут её разобранной в 250 ящиках несколькими самолётами. В 2025 году их отгрузили 44 штуки, на 2026 план — 65. Вот где рынок 🤑 - огромный спрос и 0 конкуренции)) 3. Печать. Дальше чипы печатают, и здесь TSMC на Тайване держит около 72% всего рынка, а на самых тонких техпроцессах — больше 90%. Nvidia, Apple, AMD — все они только рисуют чертежи, а печатает их одна фабрика. Перевести свой чип на другой завод — это 12-18 месяцев и десятки миллионов долларов. Поэтому никто и не переводит. 4. Память. Мощный чип без быстрой памяти не работает. Такую память делают три компании в мире — южнокорейские SK hynix и Samsung плюс американская Micron. У SK hynix около половины рынка, и вся выработка на 2026 год распродана заранее. Сегодня ИИ упирается в дефицит памяти сильнее, чем в нехватку идей. 5. Электричество. Все дата-центры мира съели около 485 ТВт·ч за 2025 год, к 2030 ждут вдвое больше, на ИИ приходится примерно треть. Честно, мне сложно представить сколько это 🙄 Есть ещё одна очень интересная цифра: пять крупнейших техкомпаний — Amazon, Microsoft, Google, Meta и Oracle — вложили больше 400 миллиардов долларов за год. Это больше, чем весь мир инвестирует в добычу нефти и газа. И на 2026 планируют ещё плюс 75%. 6. И только потом — модели. OpenAI, Anthropic, Google, DeepSeek. Те, кого мы обсуждаем каждый день. Они арендуют всё вышеперечисленное, учат и запускают свои нейронки. А поверх моделей — пользователи, то есть мы с вами. Из интересного Вот эти наши приложеньки, которые вайбкодеры пишут на Claude Code, Codex и выкидывают на рынок, в бизнес, личную жизнь каждый день - проходят такой большой путь от ресурсов до окна чата. Чтобы простой чувак без навыков программирования за час мог собрать свой мини-проект, а кто-то — планировать военные операции. Пирамида, которую я описал выше — перевёрнутая. Наверху десятки игроков, цены падают каждый квартал, модель меняется за вечер. Внизу — по одной-две конторы на всё человечество, и заменить их нельзя ни за какие деньги, потому что больше никто не умеет. Скопировать модель — вопрос месяцев. Скопировать ASML — пока не смог никто, включая Китай с его бюджетами. Но у Китая есть определённые успехи в этом направлении. Такая вот ИИ индустрия внутри. Спасибо, что дочитали 🙏
Как понять, что вам пора подписаться на блог про историю после просмотра двух роликов? Для меня решающим фактором стала речь автора канала на видео выше 😅 А вообще ролик про философию стоицизма - философия которая как никогда кстати в наше не простое время. Тем кто хочет не потерять рассудок и сохранить свободное мышление - советую его посмотреть. Особенно актуально предпринимателям, руководителям и людям с высокой зоной ответственности. Сам ролик по ссылке ниже: https://www.youtube.com/watch?v=ikAIM2W9JH4
Сравнение российских и американских ИИ-моделей. Кто победил? В прошлом посте (советую прочитать) я обещал проверить на нашем таксопарке в РФ: правда ли Yandex SpeechKit слышит русскую речь лучше американского 11labs, который мы используем. Оценивал на 358 звонках, замер по качеству распознавания и по цене за час аудио. Что у меня получилось. Чтобы посчитать долю неверно распознанных слов, нужен эталон — расшифровка, про которую точно известно, что она верная. Делает её человек, ушами, вручную. Для 358 звонков это несколько дней работы. И не факт, что он верно оценит. Я пошёл другим путём. Каждый звонок я расшифровал дважды — сначала 11labs, потом Yandex SpeechKit. Получились пары: один и тот же разговор, два разных текста. Эти пары я отдал на суд другим нейросетям — Codex, Gemini и Claude. Я не сказал им, где чей текст. Просто «вариант А» и «вариант Б», и порядок каждый раз менял. Иначе модель начнёт подыгрывать знакомому бренду вместо того, чтобы читать, что перед ней. Да, Claude два раза подсовывал мне фейковые данные: сначала подсуживал себе в анализе диалогов (об этом тут), а потом — 11labs. Именно поэтому оценку проводили три разные модели. Какой результат. Yandex — 250 побед. 11labs — 91. Ничьих — 16. То есть Yandex уверенно вышел вперёд ⚡️ Но это предпочтение судей, а не доля ошибок. А теперь то, ради чего всё затевалось. Наш ИИ проверяет, выполняет ли менеджер этапы скрипта: представился ли, назвал ли компанию и тд. Смотрим, как ИИ справляются с названием нашего таксопарка «Полёт». Тут судьи не нужны — я и так знаю, какое слово должно быть в тексте: — 11labs теряет или коверкает его в 97 звонках из 358 — Яндекс — в 21 из 358 Коверкает примерно так: «Компания Аполлон», «Компания АПА», «Аэрополёт», «Компания Пиль», «Компания Полез». А один раз наш «Полёт» превратился в «Аня Полетная» 🤷 Я полез в базу и посчитал, во что это обходится: в 13% расшифровок слова «Полёт» нет вообще. ИИ 43 раза вменил менеджерам «не представился». В 15 случаях из этих 43 менеджер представился — просто ИИ не расслышал. Каждая третья такая претензия — вина не менеджера, а распознавалки. Это не абстрактное «качество транскрибации», это несправедливые оценки менеджерам. Ещё момент. В РФ мы сдаём в аренду автомобили такси — и Yandex лучше слышит названия китайских марок и таксишные термины. При оценке менеджера это тоже меньше ошибок. Что по деньгам? Claude посчитал, что 11labs дороже Яндекса в пять раз, и красиво расписал экономию в 40 тысяч рублей в год 🤦 Я сразу же понял, что это какой-то бред, и пересчитал. Разумеется, такой экономии нет. Наоборот. Яндекс на нашем объёме — 40 ₽ за час, 11labs — $0,40, это примерно 31 ₽ по текущему курсу. То есть переходим на ИИ, который дороже процентов на двадцать пять. Иду на это осознанно: девять рублей разницы дешевле, чем разбирать с менеджером незаслуженный минус. Claude выдаёт неверную цифру ровно тем же уверенным тоном, что и верную. Если бы я не усомнился, я бы сейчас писал вам про экономию, которой нет. Вывод, к которому я пришёл. Русский ИИ выиграл у американского в русской речи — но не потому, что у него круче технологии. По объёму распознанного текста они равны, а по цене Яндекс даже дороже. А потому, что его данных с русской речью, собранных по всей России, на которых он обучался намного больше. Из интересного. 11labs ломает названия компании, марки машин и профессиональные словечки — ровно то, по чему мы оцениваем менеджеров. И иногда просто выдумывает текст. Яндекс путает случайные слова в середине фраз — на оценку менеджера это не влияет. Так что если выбираете инструмент для ИИ-автоматизаций — не выбирайте по тому, кто ошибается реже. Смотрите, как он ошибается, когда ошибается. И не верьте выборке в полсотни примеров, даже если результат выглядит убедительно. Переходим на Yandex. Дальше сравню турецкий Sestek и всё тот же 11labs. Об этом тоже напишу пост со сравнением турецких и американских моделей.
Как обучаются LLM и почему разделение ИИ по странам может повысить его качество? У нас есть проектах оценки звонков менеджеров с клиентами через ИИ, работает в Турции и РФ. Сначала на пальцах - как вообще учат такие модели, которые я использую в наших ИИ-агентах. 1. Претрейн. В модель заливают гигантский массив данных и она учится предсказывать. У LLM - следующее слово в тексте, у распознавалки речи - какие звуки в какие слова складываются. Вручную её никто не учит, она миллиарды раз угадывает и запоминает где ошиблась. Тут закладывается почти всё, что модель умеет. 2. Дообучение. Дальше узкие размеченные данные под задачу. В нашем случае это тысячи часов телефонных разговоров - вот аудио, вот как оно должно выглядеть текстом. 3. Донастройка по людям. Живые оценщики показывают модели, что считать хорошим ответом, а что плохим. Тот же принцип, что у нас в оценке звонков, только там нейронка ставит оценку менеджеру, а здесь человек - нейронке. Модель не умнее своих данных. Если в претрейне русской речи было 2%, а английской 60% - она и будет слышать русский как иностранец. Хоть ты её на десяти тысячах видеокарт обучай. В прошлом посте я показывал результы тесты переезда с Claude на китайский DeepSeek. А сегодня наткнулся на то, что Yandex SpeechKit переводит русскую речь в текст точнее, чем американский 11labs, который мы используем. Для меня 11labs долго был эталоном работы с голосом и речью. Почему так вышло? Потому, что у Яндекса есть то, чего у 11labs нет - годы живой русской речи из Алисы, навигатора, собственных колл-центров. Состава их датасетов я не знаю, никто его не публикует, так что это моё субъективное видение, а не истина в первой инстанции. Но модель Yandex не умнее. У неё просто другие данные. Это как Google maps и Яндекс навигатор - сравнение, которое я приводил ещё полтора года назад. Гугл в среднем хорошо работает по всему миру, Яндекс лучше в России и плюс-минус в странах СНГ. Из интересного - в Турции Яндекс навигатор лучше отдаёт данные по пробкам на дорогах в Анталии. Ещё хороший пример Uber и Яндекс такси. По моим наблюдениям Uber во всех странах старается работать по единым стандартам и не особо подстраивается под особенности страны. Что позволяет ему присутствовать в большом количестве стран и быстро расти. Яндекс наоборот не масштабируется так быстро, при этом более детально вникает в рынок и адаптирует продукт под него. Как это сделано на примере Яндекс такси в Турции писал тут. А теперь к главному вопросу - почему разделение ИИ по странам может сделать его лучше? Смотрите как получается. Uber единым стандартом взял больше стран. Яндекс глубже влез в свою нишу, но проиграл в масштабе. С ИИ будет ровно так же. Разделение по странам понижает потолок общих моделей - меньше чипов, денег и исследователей, поэтому YandexGPT и GigaChat топовые модели не догоняют. Но оно же поднимает качество там, где всё решают локальные данные. Поэтому я не жду, что люди перестанут пользоваться Claude и чат GPT. Я про более узкие и отраслевые решения вроде Yandex SpeechKit - там локальный игрок выигрывает не мощностью, а тем, что данные он копил годами. Когда выбираете инструмент под свою задачу, посмотрите кто и на чём обучал модель. Общие рейтинги тут мало о чём говорят. Российскую модель от Yandex я планирую тестировать для таксопарка в РФ на этих выходных. Прогоню около 300 звонков через 11labs и Yandex SpeechKit параллельно, сравню по доле неверно распознанных слов и по цене за час аудио. Результаты приложу сюда как в прошлом посте. Ставьте 🔥🔥 - выложу таблицу с расхождениями по звонкам, где какая модель посыпалась. А самое главное - выигрывает ли русский продукт у американцев в русской речи.
видео или голосовое, без подписи
Стоит ли переходить на китайкие ИИ модели с экономией в 50%? Я давно смотрел в сторону китайских ИИ-моделек. Потому что они дешевле, потому что всё чаще вижу новости — вышел новый убийца Claude🔪 Я видел последние тесты, где китайская Kimi K3 по уровню разработки и кодинга приближалась к Claude Fable 5. Не буду тянуть. У нас есть проект AI ОКК — оценка звонков менеджеров по скрипту. Грузим звонки менеджера с клиентом, определяем тип звонка, подбираем скрипт, анализируем, находит ошибки и ставим оценку. Писал про этот продукт здесь. Крутая, но весьма прожорливая в плане токенов штука. Работает на нескольких ИИ-агентах, и один из них самый прожорливый — Claude Sonnet 4.6. Вот его я решил для теста поменять на Qwen 3.ка7-max и DeepSeek V3. Предварительно прогнав тесты на 378 звонках. Хорошо, что китайский нейминг перестал быть похож на Xiaomi 15t-100-200-1000 PRO MAX. По предварительному подсчёту DeepSeek будет дешевле на 93%, Qwen — на 41%. Но есть риск: DeepSeek может плохо работать с турецкими диалогами. А ОКК — это про правильную оценку, и кривая оценка мне не экономия, а выстрел в ногу. Я это, кстати, уже видел, когда тестил z.ai — китайцы были слабее на английском, а на русском ещё слабее. Поэтому буду тестить — и не просто прогнать звонки, а сверять оценки с тем, что ставит Sonnet, особенно на турецком. Результатами поделюсь. В любом случае интересно наблюдать за тем, как китайцы развиваются в ИИ. Я не сторонник однополярных технологий.
Финансы, порядок и ЭЯЙ. Или как в моём финучёте поселился агент Смит 😎 Недавно я писал, как собрал свой ПланФакт — сервис финучёта для Турции. Это внутренний продукт, если что, а не очередной стартап на миллионы. Так вот, сильная сторона моего финансового сервиса не в том, что он заточен под наши задачи. А в том, что там живёт агент Claude. Как агент Смит в Матрице — только на моей стороне. Зачем он там поселился? Сначала разберёмся, что вообще такое сервис финучёта. Это большие массивы финансовых данных: расходы и доходы по дням, месяцам, кварталам, показатели прибыли и убытка. Которые по-хорошему надо анализировать каждый месяц и понимать — почему у меня не растёт чистая прибыль и что я могу сделать, чтобы в августе она поднялась на 20%. Так вот, когда бизнес мелкий — а не как любит Тиньков с огромной маржой и оборотами — контролировать это всё сложно. Брать и изучать десятки, сотни статей расходов по месяцам, чтобы свести отчёт и понять, где я лажанул. Для меня сведение цифр всегда было адом. Один P&L я раньше сводил до 6 часов, а иногда несколько дней. А потом сидишь и фрустрируешь на тему, что я свёл отчёт к середине месяца, и какой смысл планировать финансы, если половина уже просрана? Для этого я и поставил Claude Code на сервер, где стоит прога с финучётом. И каждый месяц он делает следующее: — отвечает, где мы превысили расходы и почему не дотянули по чистой прибыли; — анализирует наш бизнес из сводной базы и ищет возможности увеличить прибыль; — помогает составить бюджет на следующий месяц. Я помню, кажется в 22-м, в таксопарке в РФ у нас для этого был финдир на аутсорсе. Но финдир для мелкого бизнеса — в большинстве случаев смешно. Потому что у мелкого бизнеса нет денег на нормального финдира🤪 Разумеется, это не работает так: просто записал какие-то финансовые данные, поставил Claude Code на сервер, и результаты готовы. Это долгая и кропотливая работа по отстройке учёта и перевода его на ЭЯЙ-рельсы. Как минимум несколько раз нужно самоу свести финансовый отчёт и понять как это должно работать правильно. Навести порядок и отсеять мусорные данные. Собрать логику в своей голове под свой бизнес. Я помню, как инфобизнесмены 20-х на каждом углу говорили о том, что бизнес должен управляться цифрами, цифрами и никак иначе (привет Александру Высоцкому 👋). Только проблема была в том, что у малого бизнеса часто руки не доходят до построения нормальных цифр. Сейчас такая возможность появилась. Заканчиваю такой мыслью. Чем быстрее малый бизнес научится внедрять ЭЯЙ в свои процессы, чем быстрее он оцифрует все показатели, даст эти показатели как пищу для Claude или других LLM (тем быстрее придёт налоговая), тем быстрее он сможет понять, что у него происходит внутри. А самое главное — начнёт влиять на эти процессы. Если вашему бизнесу нужно внедрение ИИ или консультация — пишите в личку @buninand
Продолжение поста про то, как умирает SaaS. Несколько месяцев назад мы в Турции начали пользоваться ИИ-звонилкой. Это сервис, который сам звонит клиентам, предлагает наши услуги, уточняет, почему клиент перестал с нами работать, отрабатывает возражения — ну и всё в этом духе. ИИ делает это в реальном времени, а после фиксирует результат и складывает данные в дашборд: причины оттока, что говорят новые клиенты, как отрабатывает офер и тд. Важно — человека такой сервис полностью не заменяет, это не фантастические истории из будущего, хоть и не далёкого. Буквально пару месяцев мы попользовались сторонним, турецким решением — и буквально за пару недель собрали свою первую версию звонилки. Сложились две вещи: вышла gpt-realtime 2.1 для разговоров в реальном времени, плюс нам нужна была RAG-база знаний нашей компании, чтобы бот отвечал по нашим данным, а не выдумывал. У стороннего сервиса такого не было. Понятно, не все такие шабутные 😬 и настолько погружены в контекст разработки ИИ-решений, как мы. Но прогресс движется именно в эту сторону. Сегодня же кринжово слышать совет «заведите сайт и рекламируйтесь в интернете» — ну спасибо, как я сам не додумался. Через несколько лет ровно так же будет звучать «вам стоит внедрить ИИ-агентов». Я думаю, что такой SaaS с ИИ-звонилкой в каком-то виде может жить достаточно долго. Но у него наплодится куча конкурентов, плюс сами интеграторы и разработчики будут пилить кастомные решения под конкретный бизнес. А значит, заработать на нём станет сложно или вообще невозможно. Это лишь один пример, который показывает, как заменяется классический SaaS. А теперь смотрите, как из этой же звонилки можно сделать пивот. Я знаю ребят в РФ, которые сделали классную ИИ-звонилку — мы периодически прослушиваем диалоги и офигиваем, как она отрабатывает. Так вот, они вместо того, чтобы просто продавать подписку, начали обрабатывать через ИИ холодные базы и продавать бизнесу готового клиента. И вот тут самое интересное. По факту они перестали быть SaaS. Никто больше не покупает у них сервис — покупают результат, готового клиента. Это ровно то, о чём был весь прошлый пост: как только код перестаёт быть ценностью, выживает тот, кто продаёт не прогу, а результат.
Как умирает SaaS? Saas это сервисы с подписочной моделью. В Турции нет нормального сервиса для финучёта вроде ПланФакта или Финтабло. Аналоги есть, но все неудобные, а на мою заявку об интеграции тупо не ответачали несколько месяцев 😐 Сводить PnL и ДДС по трём банкам руками - такое себе занятие. Так появилось то, о чём я писал в прошлом посте. Я собрал свой ПланФакт на минималках. Сейчас финансовый отчёт собирается сам, через телеграм-бот - достаточно отправить выписки, а я только подтверждаю, куда отнести доходы и расходы. Сделать продукт стало в разы проще, а вот сделать бизнес - нет. Сейчас можно запускать новые IT-стартапы каждый день, скорость разработки стала x10. Несколько месяцев назад я вайбкодил CheckMyDoc, проверку договоров через ИИ. Фича была в том, что мой агент использовал технологию RAG и мог работать с огромными документами, а ещё ходил по ссылкам, офертам доп. соглашениями и проверял всё в комплексе. Собрал без навыков программирования, опыт получил сильный, а вот аудитории не получил. Наверняка то же самое вместе со мной делали ещё человек 20 или 200, а потом контекстное окно у LLM выросло, и мои плюсы в виде RAG схлопнулись сами собой. Плюс ко всему произошла инфляция. Из-за низкой стоимости разработки IT-продуктов стало так много, что ваша функция перевода изображения в текст нахрен никому не нужна. В чём вообще была ценность мелкого SaaS? Дашборд, простая CRM, план-факт, напоминалки - всё это продавалось не потому, что оно сложное, а потому что вам было дороже нанять разраба, чем платить подписку. Ценность была в дорогой разработке, а не в бизнес-логике. Нету бизнес-логики у напоминалки задач, её клод напишет за час. Теперь разработка дешевеет. Очень сильно. За месяц я сам собрал ERP для турецкой компании. Рефералку, которую мы пилили полгода, пересобрал за три дня. Всё на подписке Claude за сотку баксов. Отсюда простое правило: если пользователь может открыть Claude, закинуть туда файл и получить 80% результата - у вас не бизнес, у вас фича. Можно сколько угодно говорить об архитектурной слабости ИИ-разработки, но я думаю, что это лишь вопрос времени. Но тут легко улететь в другую крайность. Меня можно понять так: не покупайте SaaS, собирайте своё. Сотка баксов - это неправда. Настоящая цена моего ERP - сотка плюс мои вечера. Тот самый месяц без новостей уходит не в спокойствие, а в код. Вечер основателя вообще самый дорогой ресурс в компании, просто он не приходит счётом от Antrhopic на почту. Плюс SaaS всегда продавал вам не код, а ответственность. Кто чинит в три ночи, кто переписывает интеграцию, когда агрегатор молча поменял API. Собрали своё - все эти счета теперь ваши. Помните, я писал, как Claude три раза начислил водителям по 300 000 лир вместо 300? Вот вам и цена кривоватого, но своего. Инженера техподдержки рядом не было, был я. Так что SaaS не умрёт, изменится только то, за что платят. Умрёт тот, где вся ценность была в дорогом коде. Вырастет тот, где ценность в данных, в ответственности за результат и в интеграциях, которые никто не хочет содержать сам. А настоящий взрыв, мне кажется, будет в узконишевых продуктах с людьми внутри. И дело тут вообще не в подешевевшем коде. Соцпродукты дохли потому, что первые два года выручки нет, а зарплаты есть каждый месяц. Ты просто не доживаешь до момента, когда людей набралось достаточно. А пет-проект одного человека зарплат не платит. У него нет операционных расходов кроме оплаты сервака и подписки клод, и он может ждать сколько угодно. Вот что реально изменилось - не сложность, а возможность пересидеть. Запусков будет в сотни раз больше, конверсия в успех упадёт, но в абсолюте выстрелит больше. Прилки для сбора теннисистов, чтобы забронировать корт и поиграть вместе. Аналоги тиндера, чтобы свести две аудитории. Например, двух алкашей, которым не с кем побухать 🍻 Только выстрелят не те, кто пришёл в нишу с приложением, а те, кто уже сидит внутри сообщества. Код собирается за вечер, а живой рынок и доверие - годами. На скрине выше пример моего ПланФакта)
Больше недели живу без новостей - о челлендже писал тут. Ждал эффект по стадиям, как в тех красивых рилсах «когда бросил курить»: 20 минут — пульс и давление падают до нормы. 12 часов — уровень угарного газа в крови опускается до нормы. Через неделю улучшается кровообращение и растёт функция лёгких. Но, увы, нихрена такого не произошло. Курить я кстати бросил лет 15 назад — и этих эффектов по расписанию тогда тоже не почувствовал. Похоже, такие таймлайны больше в рилсах, чем в реальной жизни. Зато у детокса нашёлся другой эффект - освободилось время. Ещё год назад я читал, что вайбкодинг - это новая наркомания, что в принципе недалеко от правды 😅. Вот в это освободившееся время я им и занимался. За эти вечера я свёл в единую систему нашу турецкую компанию — то, что раньше жило кусками в разных местах, собрал в одну базу, где данные всех отделов наконец начали пересекаться между собой. Называть это чистым вайбкодингом сложно: код почти весь писал Claude Code, но архитектуру и логику проектировал я. И вот тут для меня большой кайф. То, что я хотел много лет, но не мог реализовать из-за пропускной способности людей - получилось сделать в рамках нескольких месяцев. Что получилось на выходе? Упрощённо — ERP, куда стянута почти вся компания. Маркетинг и продажи: количество заявок, успешных сделок, причины отказа по каждой рекламной кампании, причины провала рекламных стратегий, трекинг клиента от заявки до первой прибыли. Финансы: отчёты о прибылях и убытках, бюджетирование (что, кстати, пока только внедряем), динамика прибыли, клиентов и других показателей. ИИ-сотрудники: отдел контроля качества звонков и звонилка для возврата отвалившихся клиентов. Люди и процессы: большая реферальная система, регламенты и инструкции компании, автоматизированные зарплатные ведомости. Плюс у всего персональные доступы по ролям. Кстати регламенты и инструкции перетянул из Noition. Claude code сам ходил в Notion и собирал от туда данные, строил базу знаний для сотрудников. Заодно находил несостыковки. Пока еще не всё сведено в один общий раздел, но большая часть работы уже готова. Для удобства я подключил всё это в Bitrix как локальное приложение — теперь выглядит как встроенный модуль, сотрудникам так удобнее. Так что таймлайн детокса у меня вышел свой. Не «через 20 минут спокойствие», а «через неделю объединил и доработал рабочую систему вместо новостной ленты». Выходит, новости я убирал не ради спокойствия — ради времени. А время, в отличие от ленты, можно превратить во что-то полезное. Мозг на автомате ищет замену новостям. Поэтому какая-то польза без новостей есть)
видео или голосовое, без подписи
видео или голосовое, без подписи
видео или голосовое, без подписи
видео или голосовое, без подписи
видео или голосовое, без подписи
видео или голосовое, без подписи