tgindex
Бунин в деле | Бизнес, ИИ и о личном

Бунин в деле | Бизнес, ИИ и о личном

Статистика

Таксопарк на 9 городов (РФ + Турция, Yandex.GO). Автоматизирую бизнес нейросетями - CRM, звонки, отчёты, зарплаты. Показываю что работает, что ломается и сколько стоит. Автоматизация для бизнеса → buninlab.com Написать мне → @buninand

Последний пост
14 авг.
Последнее чтение
09:39
Постов за неделю
2
Всего постов
22
Тип
открытый
Язык
русский
Категория
Бизнес
В каталоге с
13 авг.
Подписчики
635
−5 за 3 дн.
Сутки
0
0,00%
Неделя
 
Месяц
 
Просмотров на пост
138
22 постов
Вовлечённость
21,7%
к подписчикам
Постов в день
0,3
всего 22
Упоминаний
1
каналов
Охват размещения
оценка
1/24сутки в ленте
71
1/48двое суток
81
1/72трое суток
87

Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.

Посты

  • Кто виноват, если дефект написал Claude: разработчик или компания? На днях мы с семьёй ездили купаться со знакомыми. Среди них был разработчик с большим опытом — человек, который много лет профессионально пишет код. Разговорились про AI-разработку. Он сам сейчас активно использует Claude Code, очень им доволен, но сказал интересную вещь: «Я не готов отвечать за код и проекты, которые написал Claude». И вот здесь у нас возник спор. Я сейчас вообще стараюсь не использовать термин «вайб-кодинг» для всей разрабокти через нейронки. Для меня вайб-кодинг — это когда ты просто говоришь нейросети: «сделай мне вот это», особо не понимаешь архитектуру, не контролируешь процесс и ждешь, пока всё заработает. Мы в своих проектах пытаемся строить совершенно другой подход: разработка с помощью AI по формализованному протоколу. Как это выглядит у меня. Сначала появляется задача или новая функция. Первый этап — подробное ТЗ. Мы раскладываем бизнес-логику, сценарии, ограничения, пограничные случаи, ожидаемое поведение. Потом Claude идёт непосредственно в существующий проект и проверяет, насколько это ТЗ вообще совместимо с текущей архитектурой. Если обнаруживаются противоречия, зависимости или проблемы, мы сначала меняем ТЗ и только потом начинаем разработку. Дальше разработка идёт субагентным методом. Несколько агентов работают параллельно: пишут код, проверяют изменения, запускают тесты, ищут ошибки, подтверждают их, исправляют и снова тестируют. После завершения разработки изменения отправляются в работу. Но на этом процесс не заканчивается. После крупных/средних изменений я запускаю отдельное глубокое ревью проекта — опять же субагентным методом. Иногда такое ревью идёт много часов. Мой личный рекорд — 474 запущенных субагента, сутки ревью в рамках проверки одного проекта. Найдено было 12 критических ошибок и что-то около 30 мелких, больше косметических. Важно, что задача агентов не просто написать список потенциальных проблем. Если агент считает, что нашёл ошибку, он должен попытаться её воспроизвести и подтвердить. Потенциальные проблемы отделяются от реально подтверждённых. В конце получается большой отчёт. После этого подтверждённые ошибки исправляются, изменения снова тестируются, и цикл повторяется. По сути, у нас постепенно появляется протокол AI-разработки. И именно через него я смотрю на вопрос ответственности. Если разработчик обязан: — нормально подготовить ТЗ; — проверить его на совместимость с архитектурой; — соблюдать правила разработки; — провести тестирование; — провести обязательное ревью; — отработать найденные проблемы; и он всё это сделал, но дефект всё равно прошёл в проект — я не считаю правильным автоматически вешать этот дефект на разработчика. Он выполнил утверждённый компанией процесс. Значит, это остаточный технологический риск, который принимает компания. Если же разработчик решил срезать угол — не провёл ревью, проигнорировал тестирование, не проверил архитектурные последствия или нарушил другой обязательный этап протокола — тогда уже возникает его персональная зона ответственности. Мне кажется, именно так компаниям стоит подходить к AI-разработке. Проблема не в вопросе: «Можно ли доверять коду Claude?» Это неправильный вопрос. Мы ведь и человеческому коду не должны просто «доверять». Правильный вопрос другой: Какой процесс должен пройти код — независимо от того, написал его человек или AI, — прежде чем компания готова принять связанный с ним риск? И если этот процесс формализован, появляется сразу две вещи: 1. существенно снижается вероятность критической ошибки; 2. становится понятно, где заканчивается ответственность разработчика и начинается ответственность компании. Роль человека в разработке смещается — с «писать код» на «проверять и направлять», почитать можете тут. А значит и ответственность надо считать не по строчкам кода, а по соблюдению процесса. Относительно нашего спора, сошлись на том, что обсудим наш протокол разработки через ИИ, а там решим ок это или нет. Спасибо, что дочитали 🙏

  • Проверяю, родственник ли я писателю Бунину. Как GPT за пару часов довёл меня до архивных дел 1920-х годов Я давно хотел заняться историей своего рода. Понять откуда он начинается, кто был у меня в роду, паралельно ответив на вопрос, являюсь ли я каким-то дальним родственников писателя И.А. Бунина. Вероятность конечно низкая, но проверить всё равно интересно. На днях я проверил докуда можно дойти нейронками. Спойлер: дальше, чем я ожидал. Что нашлось за пару часов: Прямая линия из пяти поколений: - Евсей Николаевич (прапрадед) - Ипполит Евсеевич (прадед) - Андрей Ипполитович (дед) - Алексей Андреевич (отец) - я Андрей Бунин. Прапрадед Евсей Николаевич — GPT нашёл в опубликованных описях ЦАНО (архив Нижегородской области) два его личных дела: студента медицинского института 1920–1923 годов на 17 листов и сотрудника 1923–1929 на 27 листов. Не «где-то что-то было», а конкретный фонд, опись, номер дела. По семейным данным он врач, глазной хирург, 1884 года рождения — но это пока со статусом «требует проверки», первичного документа нет. Прадед Ипполит Евсеевич — артист театра. Нашлись нижегородские публикации по истории театра, где он упоминается по полному имени: служил в горьковском театре «Снайпер» со дня его основания, а полное имя всплыло в журнале нижегородского театра «Комедiя». Совпало с тем, что рассказывали в семье. Брат прадеда — фронтовик, подполковник. «Память народа» подтверждает: звание, точная дата рождения 07.09.1918, место рождения Горький. Где можно нафакапить. Генеалогия — идеальная зона для галлюцинаций нейронки. Попроси найди мой род — и она с удовольствием нарисует красивое древо до бояр. Поэтому каждый факт в моём документе имеет статус: семейные данные (рассказали родственники), внешнее подтверждение (найден независимый источник) или требует проверки. В итоговый файл факт попадает только со ссылкой на источник — опись архива, публикацию, базу «Память народа». Как я вообще это делал? Простыми промтами закидывал GPT, просил помочь составить генеалогическое древо. Скормил все данные по линии отца, что я знаю. Далее на созвоне с отцом вытащил у него то, чего я не знал и также скормил GPT. Методом дедукции и онлайн поиска мы смогли установить родственников о которых писал выше. GPT в данном случае является хорошим ассистентом, который помогает апрувить и сопоставить факты, направить меня и создать логику исследования. А что с писателем? Пока - ничего. Связь с ветвью Ивана Алексеевича не установлена, и созвучие фамилии само по себе не доказывает ровным счётом ничего. Поэтому продолжаю искать. Дальше - самое интересное: через отца получаю доступы, заказываю дела в архиве. Цель — метрические записи, которые уведут глубже 1884 года. Плюс в той же описи лежит третье дело «Бунин Е.Н.» на 4 листа — надо проверить по содержимому, тот ли это Евсей Николаевич или однофамилец. По мере расследования буду писать об этом. 🕵️‍♂️ Спасибо, что дочитали 🙏

  • 5 авг.129202

    30 лет жил по одним правилам, теперь живу по другим. Что изменилось в управлении Бизнесом., Те кто работал одновременно с двумя странами, особенно где ментальность сильно отличается, наверняка может с вами поделиться опытом как лавировать между ними. Я тоже хочу поделиться этим опытом, и показать как я это проживаю и чувствую. Моя работа строится внутри России и Турции. В России на пике у нас было более 45 сотрудников таксопарка в Турции что-то около 10. Понимаю, что часть разницы это просто размер команды, но не вся. Ниже тезисно опишу разницу в работе и подходе. 1. Время. В России не принято опаздывать на встречи/работу, и ещё раньше времени уходить с рабочего места. У нас сидит какое-то советское наследие уставных правил. Вот в 18:00 рабочий день окончен, значит порог офиса можно переступить ровно в 18:01. Такое тоже должно быть, но не везде. Например на складах Озон где автоматизация и начисления зарплат по рабочему времени это логично, карточкой отметил вход/выход. В случае с менее рутинной офисной работой уже могут быть послабления. В Турции наши дейлики/планерки спокойно могут смещаться на 15-20 минут и ни у кого от этого не подгорает (кроме меня и то год назад 😅). Так же мы строго не следим, чтобы работник ушел с работы в 18:01 — потому, что за этим следят роботы 😈 Как именно мы контролируем удалёнщиков без паранойи — советую почитать тут. Но если он закончил пораньше, это не критично — намного важнее его результат и не переходит ли это рамки разумного. 2. Регламенты. В РФ мы любим обложиться инструкциями и регламентами, чтобы сотрудники работали по ним как по часам. Это далеко не везде, но в целом тенденции к этому есть. Пример — российский банкинг или общепит вроде До-До пиццы. В Турции персонал банка может действовать более свободно — в разных отделениях банка может быть разная информация, хотя источник у неё общий. Интересный кейс произошел со мной в Старбаксе. Мы с коллегой стояли в очереди за кофе и она попросила у кассира взять у неё наличкой лиры и перевести сыну на карту деньги, так как её банк был не доступен. Кассир Старбакса без проблем это сделал. Я слабо себе представляю, чтобы такое случилось в российской сетевой кофейне. И дело тут не в кассире, а в том, что у него над головой висит регламент. 3. Планёрки. Дейлики/планерки в Турции проходят более расслабленно. Сотрудники могут делиться информацией о личной жизни или всех публично позвать на свадьбу. В России, в нашей сфере я этого не припомню, обычно все более серьезны. 4. Прямота. В РФ мы часто высказываем сотрудникам то, что думаем об их работе. Есть правило — ругай лично, хвали публично — оно более менее соблюдается. Но в Турции мы чаще стараемся смягчать. То есть использовать что-то вроде завуалированных терминов при описании работы сотрудника. Не «ты налажал», а «что-то у нас тут пошло не так». Не «ты план не выполнил», а «странно, почему план не был выполнен?». В Турции часто если не дошло до прямого конфликта многие вещи смягчают и часто не говорят нет. Вместо нет — посмотрим, подумаем, завтра увидим и так далее. Главная ловушка для русского управленца. Ты по привычке слышишь «посмотрим» и записываешь себе в голове «да». А тебе вообще-то сказали нет. 5. Деньги. В Турции многие вещи связанные с оплатами могут подождать. И это не вызывает какого-то напряга. Выполнили услугу — заплатим потом, завтра. В РФ как правило (далеко не всегда), но деньги приходят более стабильно. Что я из этого вынес Первый год я хоть и ограниченно, но пытался использовать российский подход в турецкой команде. Регламенты, дедлайны, прямая обратная связь в лоб. Люди при этом не стали работать лучше, они просто перестали спорить. Сейчас у меня получается так. Всё что касается процессов и цифр — учёт рабочего дня, план по звонкам, скрипты, оценка звонков нейронкой — тут никаких «завтра увидим», это считают роботы, а они формулировки не смягчают. А вот когда надо донести человеку, что он просел, я это делаю уже на понятном ему языке. Спасибо, что дочитали 🙏

  • Продолжаю сранивать американские и русские модели ИИ Сегодня я провел исследование как наш слоняра ИИ от Yandex работает с турецким языком. Задача — перевод турецкой речи (аудиозаписи) в текст. Сейчас и ранее мы для этого использовали 11labs, но по моим предыдущим исследованиям 11labs проиграл в точности распознавания речи Yandex SpeechKit в русском. Потому, что у Yandex сильно больше данных с русской речью чем у 11labs для обучения своих моделек. (которые кстати Герман Греф считает китайскими, но под шильдиком Yandex 😀 — сам Яндекс это отрицает). Поэтому я провел исследование и сравнение в турецком языке. У нас в Турции ИИ-ОКК слушает 100% звонков менеджеров — как я его несколько месяцев доводил до ума, писал тут. Работает это только пока запись правильно переведена в текст. Распознали криво — и оценщик штрафует менеджера за слова, которых не было. Когда я сравнивал две модели на русских звонках — Yandex SpeechKit против американского 11labs — Яндекс выиграл: 250 побед против 91 на 358 звонках, писал об этом здесь. Логично было взять этот вывод и просто перенести на турецкий проект. Но нет. Как я считал Взял 300 наших реальных звонков — почти 13 часов турецкой речи. Прогнал через обе нейронки. Тексты обезличил и перемешал в пары A/B, чтобы судья не знал, где какая модель. Отдал на слепую сверку. Смотрели связность диалога, бессмыслицу, повторы, искажение имён и названий, и отдельно числа. Результат: 279:0 в пользу 11labs. Двадцать одна ничья — это почти всегда звонки, где речи вообще нет: гудки и автоответчик. Даже я от такого был мягко говоря удивлен 😨 Как именно ломается Яндекс на турецком Он не просто ошибается в словах. Он сваливается в узбекскую фонетику (если что Узбекский и Турецкий языки в одной языковой группе). Похоже, тянет к тому тюркскому языку, которого было больше в обучении. Сильные косяки были в числах: — комиссия 3% превратилась в 103 — скидка 8% — в 800 — баланс 602 лиры — в «602200» А теперь, про что вообще эти разговоры. Водитель такси спорит о комиссии, диктует свои реквизиты, уточняет сумму выплаты и свой рейтинг. Если цифры едут, оценивать такой разговор нет смысла. Судья не знал, кого сравнивает Перед сверкой я убрал из текстов всё, по чему модель можно опознать: заглавные буквы, пунктуацию, служебные пометки. Потом на каждом звонке бросил монетку — кто будет вариантом A, кто B. Ключ отложил и не заглядывал. Судья отработал 300 пар и выдал свой итог: вариант A победил в 133 случаях, вариант B — в 146. И дописал вывод: разница в пределах погрешности, ни одна сторона не лучше другой. А потом я раскрыл ключ. Оказалось, что 133 и 146 — это один и тот же ИИ, просто в половине пар он стоял слева, а в половине справа. Судья ни разу не догадался, кто перед ним, и при этом внутри каждой пары стабильно тыкал в одного и того же. Совпадением это не объяснить. Вывод Далеко не всегда ИИ-модель распознавания голоса (и не только) бывает «лучше» вообще. Она бывает лучше на конкретном языке, на конкретном типе записи, на конкретной задаче — телефонная линия это не студийный микрофон. Один и тот же Яндекс на русских звонках ощутимо лучше американцев, а на турецких сильно проигрывает. Обзоры «лучших ИИ» тут не помогут: пока не прогнал свои записи или задачи, ты не знаешь ничего. Жду ещё доступ от турецкой модели Sestek, чтобы сравнить их с 11labs. Но они не спешат отвечать 🤷☕️ Спасибо, что дочитали 🙏

  • Что скрыто от простых пользователей Chat GPT и Claude? Я тут залип на тему, из чего физически состоит ИИ. Год назад писал, что OpenAI — это уже не компания, а инфраструктурный проект, и имел в виду дата-центры. Дата-центры — это ещё даже не середина всей инфраструктуры ИИ-проектов. По факту её можно разделить на 6 больших уровней. Мне было интересно в этом разобраться, поэтому хочу поделиться с вами, чтобы у вас было общее понимание как это работает. Короче, пойдём снизу вверх. От земли до чата, в который мы пишем запрос. 1. Кварц и кремний. Всё начинается с добычи сверхчистого кварца — из него делают посуду, в которой плавят кремний. Добывают его в основном в одном районе Северной Каролины, и две компании контролируют около 95% мировой поставки кварца нужной чистоты. Дальше кремний очищают, растят кристаллы, режут на пластины (заготовка для будущих чипов) — это Япония, Германия, Корея. Пока никакого ИИ. Просто металлургия и химия. 2. Машина, которая рисует. На пластине надо начертить схему из миллиардов транзисторов, и чертят их светом. Как проектором, только с другой точностью: на толщине одного человеческого волоса такая машина умещает около шести тысяч линий. А чтобы получить нужный свет, капли расплавленного олова расстреливают лазером 50 000 раз в секунду. Такие машины делает одна компания в мире — нидерландская ASML. Не лидер рынка, а буквально 100% рынка. Одна машина стоит 200 миллионов долларов, топовая — под 400. Весит около 150 тонн, собрана из 100 000 деталей, везут её разобранной в 250 ящиках несколькими самолётами. В 2025 году их отгрузили 44 штуки, на 2026 план — 65. Вот где рынок 🤑 - огромный спрос и 0 конкуренции)) 3. Печать. Дальше чипы печатают, и здесь TSMC на Тайване держит около 72% всего рынка, а на самых тонких техпроцессах — больше 90%. Nvidia, Apple, AMD — все они только рисуют чертежи, а печатает их одна фабрика. Перевести свой чип на другой завод — это 12-18 месяцев и десятки миллионов долларов. Поэтому никто и не переводит. 4. Память. Мощный чип без быстрой памяти не работает. Такую память делают три компании в мире — южнокорейские SK hynix и Samsung плюс американская Micron. У SK hynix около половины рынка, и вся выработка на 2026 год распродана заранее. Сегодня ИИ упирается в дефицит памяти сильнее, чем в нехватку идей. 5. Электричество. Все дата-центры мира съели около 485 ТВт·ч за 2025 год, к 2030 ждут вдвое больше, на ИИ приходится примерно треть. Честно, мне сложно представить сколько это 🙄 Есть ещё одна очень интересная цифра: пять крупнейших техкомпаний — Amazon, Microsoft, Google, Meta и Oracle — вложили больше 400 миллиардов долларов за год. Это больше, чем весь мир инвестирует в добычу нефти и газа. И на 2026 планируют ещё плюс 75%. 6. И только потом — модели. OpenAI, Anthropic, Google, DeepSeek. Те, кого мы обсуждаем каждый день. Они арендуют всё вышеперечисленное, учат и запускают свои нейронки. А поверх моделей — пользователи, то есть мы с вами. Из интересного Вот эти наши приложеньки, которые вайбкодеры пишут на Claude Code, Codex и выкидывают на рынок, в бизнес, личную жизнь каждый день - проходят такой большой путь от ресурсов до окна чата. Чтобы простой чувак без навыков программирования за час мог собрать свой мини-проект, а кто-то — планировать военные операции. Пирамида, которую я описал выше — перевёрнутая. Наверху десятки игроков, цены падают каждый квартал, модель меняется за вечер. Внизу — по одной-две конторы на всё человечество, и заменить их нельзя ни за какие деньги, потому что больше никто не умеет. Скопировать модель — вопрос месяцев. Скопировать ASML — пока не смог никто, включая Китай с его бюджетами. Но у Китая есть определённые успехи в этом направлении. Такая вот ИИ индустрия внутри. Спасибо, что дочитали 🙏

  • Как понять, что вам пора подписаться на блог про историю после просмотра двух роликов? Для меня решающим фактором стала речь автора канала на видео выше 😅 А вообще ролик про философию стоицизма - философия которая как никогда кстати в наше не простое время. Тем кто хочет не потерять рассудок и сохранить свободное мышление - советую его посмотреть. Особенно актуально предпринимателям, руководителям и людям с высокой зоной ответственности. Сам ролик по ссылке ниже: https://www.youtube.com/watch?v=ikAIM2W9JH4

  • Сравнение российских и американских ИИ-моделей. Кто победил? В прошлом посте (советую прочитать) я обещал проверить на нашем таксопарке в РФ: правда ли Yandex SpeechKit слышит русскую речь лучше американского 11labs, который мы используем. Оценивал на 358 звонках, замер по качеству распознавания и по цене за час аудио. Что у меня получилось. Чтобы посчитать долю неверно распознанных слов, нужен эталон — расшифровка, про которую точно известно, что она верная. Делает её человек, ушами, вручную. Для 358 звонков это несколько дней работы. И не факт, что он верно оценит. Я пошёл другим путём. Каждый звонок я расшифровал дважды — сначала 11labs, потом Yandex SpeechKit. Получились пары: один и тот же разговор, два разных текста. Эти пары я отдал на суд другим нейросетям — Codex, Gemini и Claude. Я не сказал им, где чей текст. Просто «вариант А» и «вариант Б», и порядок каждый раз менял. Иначе модель начнёт подыгрывать знакомому бренду вместо того, чтобы читать, что перед ней. Да, Claude два раза подсовывал мне фейковые данные: сначала подсуживал себе в анализе диалогов (об этом тут), а потом — 11labs. Именно поэтому оценку проводили три разные модели. Какой результат. Yandex — 250 побед. 11labs — 91. Ничьих — 16. То есть Yandex уверенно вышел вперёд ⚡️ Но это предпочтение судей, а не доля ошибок. А теперь то, ради чего всё затевалось. Наш ИИ проверяет, выполняет ли менеджер этапы скрипта: представился ли, назвал ли компанию и тд. Смотрим, как ИИ справляются с названием нашего таксопарка «Полёт». Тут судьи не нужны — я и так знаю, какое слово должно быть в тексте: — 11labs теряет или коверкает его в 97 звонках из 358 — Яндекс — в 21 из 358 Коверкает примерно так: «Компания Аполлон», «Компания АПА», «Аэрополёт», «Компания Пиль», «Компания Полез». А один раз наш «Полёт» превратился в «Аня Полетная» 🤷 Я полез в базу и посчитал, во что это обходится: в 13% расшифровок слова «Полёт» нет вообще. ИИ 43 раза вменил менеджерам «не представился». В 15 случаях из этих 43 менеджер представился — просто ИИ не расслышал. Каждая третья такая претензия — вина не менеджера, а распознавалки. Это не абстрактное «качество транскрибации», это несправедливые оценки менеджерам. Ещё момент. В РФ мы сдаём в аренду автомобили такси — и Yandex лучше слышит названия китайских марок и таксишные термины. При оценке менеджера это тоже меньше ошибок. Что по деньгам? Claude посчитал, что 11labs дороже Яндекса в пять раз, и красиво расписал экономию в 40 тысяч рублей в год 🤦 Я сразу же понял, что это какой-то бред, и пересчитал. Разумеется, такой экономии нет. Наоборот. Яндекс на нашем объёме — 40 ₽ за час, 11labs — $0,40, это примерно 31 ₽ по текущему курсу. То есть переходим на ИИ, который дороже процентов на двадцать пять. Иду на это осознанно: девять рублей разницы дешевле, чем разбирать с менеджером незаслуженный минус. Claude выдаёт неверную цифру ровно тем же уверенным тоном, что и верную. Если бы я не усомнился, я бы сейчас писал вам про экономию, которой нет. Вывод, к которому я пришёл. Русский ИИ выиграл у американского в русской речи — но не потому, что у него круче технологии. По объёму распознанного текста они равны, а по цене Яндекс даже дороже. А потому, что его данных с русской речью, собранных по всей России, на которых он обучался намного больше. Из интересного. 11labs ломает названия компании, марки машин и профессиональные словечки — ровно то, по чему мы оцениваем менеджеров. И иногда просто выдумывает текст. Яндекс путает случайные слова в середине фраз — на оценку менеджера это не влияет. Так что если выбираете инструмент для ИИ-автоматизаций — не выбирайте по тому, кто ошибается реже. Смотрите, как он ошибается, когда ошибается. И не верьте выборке в полсотни примеров, даже если результат выглядит убедительно. Переходим на Yandex. Дальше сравню турецкий Sestek и всё тот же 11labs. Об этом тоже напишу пост со сравнением турецких и американских моделей.

  • Как обучаются LLM и почему разделение ИИ по странам может повысить его качество? У нас есть проектах оценки звонков менеджеров с клиентами через ИИ, работает в Турции и РФ. Сначала на пальцах - как вообще учат такие модели, которые я использую в наших ИИ-агентах. 1. Претрейн. В модель заливают гигантский массив данных и она учится предсказывать. У LLM - следующее слово в тексте, у распознавалки речи - какие звуки в какие слова складываются. Вручную её никто не учит, она миллиарды раз угадывает и запоминает где ошиблась. Тут закладывается почти всё, что модель умеет. 2. Дообучение. Дальше узкие размеченные данные под задачу. В нашем случае это тысячи часов телефонных разговоров - вот аудио, вот как оно должно выглядеть текстом. 3. Донастройка по людям. Живые оценщики показывают модели, что считать хорошим ответом, а что плохим. Тот же принцип, что у нас в оценке звонков, только там нейронка ставит оценку менеджеру, а здесь человек - нейронке. Модель не умнее своих данных. Если в претрейне русской речи было 2%, а английской 60% - она и будет слышать русский как иностранец. Хоть ты её на десяти тысячах видеокарт обучай. В прошлом посте я показывал результы тесты переезда с Claude на китайский DeepSeek. А сегодня наткнулся на то, что Yandex SpeechKit переводит русскую речь в текст точнее, чем американский 11labs, который мы используем. Для меня 11labs долго был эталоном работы с голосом и речью. Почему так вышло? Потому, что у Яндекса есть то, чего у 11labs нет - годы живой русской речи из Алисы, навигатора, собственных колл-центров. Состава их датасетов я не знаю, никто его не публикует, так что это моё субъективное видение, а не истина в первой инстанции. Но модель Yandex не умнее. У неё просто другие данные. Это как Google maps и Яндекс навигатор - сравнение, которое я приводил ещё полтора года назад. Гугл в среднем хорошо работает по всему миру, Яндекс лучше в России и плюс-минус в странах СНГ. Из интересного - в Турции Яндекс навигатор лучше отдаёт данные по пробкам на дорогах в Анталии. Ещё хороший пример Uber и Яндекс такси. По моим наблюдениям Uber во всех странах старается работать по единым стандартам и не особо подстраивается под особенности страны. Что позволяет ему присутствовать в большом количестве стран и быстро расти. Яндекс наоборот не масштабируется так быстро, при этом более детально вникает в рынок и адаптирует продукт под него. Как это сделано на примере Яндекс такси в Турции писал тут. А теперь к главному вопросу - почему разделение ИИ по странам может сделать его лучше? Смотрите как получается. Uber единым стандартом взял больше стран. Яндекс глубже влез в свою нишу, но проиграл в масштабе. С ИИ будет ровно так же. Разделение по странам понижает потолок общих моделей - меньше чипов, денег и исследователей, поэтому YandexGPT и GigaChat топовые модели не догоняют. Но оно же поднимает качество там, где всё решают локальные данные. Поэтому я не жду, что люди перестанут пользоваться Claude и чат GPT. Я про более узкие и отраслевые решения вроде Yandex SpeechKit - там локальный игрок выигрывает не мощностью, а тем, что данные он копил годами. Когда выбираете инструмент под свою задачу, посмотрите кто и на чём обучал модель. Общие рейтинги тут мало о чём говорят. Российскую модель от Yandex я планирую тестировать для таксопарка в РФ на этих выходных. Прогоню около 300 звонков через 11labs и Yandex SpeechKit параллельно, сравню по доле неверно распознанных слов и по цене за час аудио. Результаты приложу сюда как в прошлом посте. Ставьте 🔥🔥 - выложу таблицу с расхождениями по звонкам, где какая модель посыпалась. А самое главное - выигрывает ли русский продукт у американцев в русской речи.

  • видео или голосовое, без подписи

  • Стоит ли переходить на китайкие ИИ модели с экономией в 50%? Я давно смотрел в сторону китайских ИИ-моделек. Потому что они дешевле, потому что всё чаще вижу новости — вышел новый убийца Claude🔪 Я видел последние тесты, где китайская Kimi K3 по уровню разработки и кодинга приближалась к Claude Fable 5. Не буду тянуть. У нас есть проект AI ОКК — оценка звонков менеджеров по скрипту. Грузим звонки менеджера с клиентом, определяем тип звонка, подбираем скрипт, анализируем, находит ошибки и ставим оценку. Писал про этот продукт здесь. Крутая, но весьма прожорливая в плане токенов штука. Работает на нескольких ИИ-агентах, и один из них самый прожорливый — Claude Sonnet 4.6. Вот его я решил для теста поменять на Qwen 3.ка7-max и DeepSeek V3. Предварительно прогнав тесты на 378 звонках. Хорошо, что китайский нейминг перестал быть похож на Xiaomi 15t-100-200-1000 PRO MAX. По предварительному подсчёту DeepSeek будет дешевле на 93%, Qwen — на 41%. Но есть риск: DeepSeek может плохо работать с турецкими диалогами. А ОКК — это про правильную оценку, и кривая оценка мне не экономия, а выстрел в ногу. Я это, кстати, уже видел, когда тестил z.ai — китайцы были слабее на английском, а на русском ещё слабее. Поэтому буду тестить — и не просто прогнать звонки, а сверять оценки с тем, что ставит Sonnet, особенно на турецком. Результатами поделюсь. В любом случае интересно наблюдать за тем, как китайцы развиваются в ИИ. Я не сторонник однополярных технологий.

  • Финансы, порядок и ЭЯЙ. Или как в моём финучёте поселился агент Смит 😎 Недавно я писал, как собрал свой ПланФакт — сервис финучёта для Турции. Это внутренний продукт, если что, а не очередной стартап на миллионы. Так вот, сильная сторона моего финансового сервиса не в том, что он заточен под наши задачи. А в том, что там живёт агент Claude. Как агент Смит в Матрице — только на моей стороне. Зачем он там поселился? Сначала разберёмся, что вообще такое сервис финучёта. Это большие массивы финансовых данных: расходы и доходы по дням, месяцам, кварталам, показатели прибыли и убытка. Которые по-хорошему надо анализировать каждый месяц и понимать — почему у меня не растёт чистая прибыль и что я могу сделать, чтобы в августе она поднялась на 20%. Так вот, когда бизнес мелкий — а не как любит Тиньков с огромной маржой и оборотами — контролировать это всё сложно. Брать и изучать десятки, сотни статей расходов по месяцам, чтобы свести отчёт и понять, где я лажанул. Для меня сведение цифр всегда было адом. Один P&L я раньше сводил до 6 часов, а иногда несколько дней. А потом сидишь и фрустрируешь на тему, что я свёл отчёт к середине месяца, и какой смысл планировать финансы, если половина уже просрана? Для этого я и поставил Claude Code на сервер, где стоит прога с финучётом. И каждый месяц он делает следующее: — отвечает, где мы превысили расходы и почему не дотянули по чистой прибыли; — анализирует наш бизнес из сводной базы и ищет возможности увеличить прибыль; — помогает составить бюджет на следующий месяц. Я помню, кажется в 22-м, в таксопарке в РФ у нас для этого был финдир на аутсорсе. Но финдир для мелкого бизнеса — в большинстве случаев смешно. Потому что у мелкого бизнеса нет денег на нормального финдира🤪 Разумеется, это не работает так: просто записал какие-то финансовые данные, поставил Claude Code на сервер, и результаты готовы. Это долгая и кропотливая работа по отстройке учёта и перевода его на ЭЯЙ-рельсы. Как минимум несколько раз нужно самоу свести финансовый отчёт и понять как это должно работать правильно. Навести порядок и отсеять мусорные данные. Собрать логику в своей голове под свой бизнес. Я помню, как инфобизнесмены 20-х на каждом углу говорили о том, что бизнес должен управляться цифрами, цифрами и никак иначе (привет Александру Высоцкому 👋). Только проблема была в том, что у малого бизнеса часто руки не доходят до построения нормальных цифр. Сейчас такая возможность появилась. Заканчиваю такой мыслью. Чем быстрее малый бизнес научится внедрять ЭЯЙ в свои процессы, чем быстрее он оцифрует все показатели, даст эти показатели как пищу для Claude или других LLM (тем быстрее придёт налоговая), тем быстрее он сможет понять, что у него происходит внутри. А самое главное — начнёт влиять на эти процессы. Если вашему бизнесу нужно внедрение ИИ или консультация — пишите в личку @buninand

  • Продолжение поста про то, как умирает SaaS. Несколько месяцев назад мы в Турции начали пользоваться ИИ-звонилкой. Это сервис, который сам звонит клиентам, предлагает наши услуги, уточняет, почему клиент перестал с нами работать, отрабатывает возражения — ну и всё в этом духе. ИИ делает это в реальном времени, а после фиксирует результат и складывает данные в дашборд: причины оттока, что говорят новые клиенты, как отрабатывает офер и тд. Важно — человека такой сервис полностью не заменяет, это не фантастические истории из будущего, хоть и не далёкого. Буквально пару месяцев мы попользовались сторонним, турецким решением — и буквально за пару недель собрали свою первую версию звонилки. Сложились две вещи: вышла gpt-realtime 2.1 для разговоров в реальном времени, плюс нам нужна была RAG-база знаний нашей компании, чтобы бот отвечал по нашим данным, а не выдумывал. У стороннего сервиса такого не было. Понятно, не все такие шабутные 😬 и настолько погружены в контекст разработки ИИ-решений, как мы. Но прогресс движется именно в эту сторону. Сегодня же кринжово слышать совет «заведите сайт и рекламируйтесь в интернете» — ну спасибо, как я сам не додумался. Через несколько лет ровно так же будет звучать «вам стоит внедрить ИИ-агентов». Я думаю, что такой SaaS с ИИ-звонилкой в каком-то виде может жить достаточно долго. Но у него наплодится куча конкурентов, плюс сами интеграторы и разработчики будут пилить кастомные решения под конкретный бизнес. А значит, заработать на нём станет сложно или вообще невозможно. Это лишь один пример, который показывает, как заменяется классический SaaS. А теперь смотрите, как из этой же звонилки можно сделать пивот. Я знаю ребят в РФ, которые сделали классную ИИ-звонилку — мы периодически прослушиваем диалоги и офигиваем, как она отрабатывает. Так вот, они вместо того, чтобы просто продавать подписку, начали обрабатывать через ИИ холодные базы и продавать бизнесу готового клиента. И вот тут самое интересное. По факту они перестали быть SaaS. Никто больше не покупает у них сервис — покупают результат, готового клиента. Это ровно то, о чём был весь прошлый пост: как только код перестаёт быть ценностью, выживает тот, кто продаёт не прогу, а результат.

  • Как умирает SaaS? Saas это сервисы с подписочной моделью. В Турции нет нормального сервиса для финучёта вроде ПланФакта или Финтабло. Аналоги есть, но все неудобные, а на мою заявку об интеграции тупо не ответачали несколько месяцев 😐 Сводить PnL и ДДС по трём банкам руками - такое себе занятие. Так появилось то, о чём я писал в прошлом посте. Я собрал свой ПланФакт на минималках. Сейчас финансовый отчёт собирается сам, через телеграм-бот - достаточно отправить выписки, а я только подтверждаю, куда отнести доходы и расходы. Сделать продукт стало в разы проще, а вот сделать бизнес - нет. Сейчас можно запускать новые IT-стартапы каждый день, скорость разработки стала x10. Несколько месяцев назад я вайбкодил CheckMyDoc, проверку договоров через ИИ. Фича была в том, что мой агент использовал технологию RAG и мог работать с огромными документами, а ещё ходил по ссылкам, офертам доп. соглашениями и проверял всё в комплексе. Собрал без навыков программирования, опыт получил сильный, а вот аудитории не получил. Наверняка то же самое вместе со мной делали ещё человек 20 или 200, а потом контекстное окно у LLM выросло, и мои плюсы в виде RAG схлопнулись сами собой. Плюс ко всему произошла инфляция. Из-за низкой стоимости разработки IT-продуктов стало так много, что ваша функция перевода изображения в текст нахрен никому не нужна. В чём вообще была ценность мелкого SaaS? Дашборд, простая CRM, план-факт, напоминалки - всё это продавалось не потому, что оно сложное, а потому что вам было дороже нанять разраба, чем платить подписку. Ценность была в дорогой разработке, а не в бизнес-логике. Нету бизнес-логики у напоминалки задач, её клод напишет за час. Теперь разработка дешевеет. Очень сильно. За месяц я сам собрал ERP для турецкой компании. Рефералку, которую мы пилили полгода, пересобрал за три дня. Всё на подписке Claude за сотку баксов. Отсюда простое правило: если пользователь может открыть Claude, закинуть туда файл и получить 80% результата - у вас не бизнес, у вас фича. Можно сколько угодно говорить об архитектурной слабости ИИ-разработки, но я думаю, что это лишь вопрос времени. Но тут легко улететь в другую крайность. Меня можно понять так: не покупайте SaaS, собирайте своё. Сотка баксов - это неправда. Настоящая цена моего ERP - сотка плюс мои вечера. Тот самый месяц без новостей уходит не в спокойствие, а в код. Вечер основателя вообще самый дорогой ресурс в компании, просто он не приходит счётом от Antrhopic на почту. Плюс SaaS всегда продавал вам не код, а ответственность. Кто чинит в три ночи, кто переписывает интеграцию, когда агрегатор молча поменял API. Собрали своё - все эти счета теперь ваши. Помните, я писал, как Claude три раза начислил водителям по 300 000 лир вместо 300? Вот вам и цена кривоватого, но своего. Инженера техподдержки рядом не было, был я. Так что SaaS не умрёт, изменится только то, за что платят. Умрёт тот, где вся ценность была в дорогом коде. Вырастет тот, где ценность в данных, в ответственности за результат и в интеграциях, которые никто не хочет содержать сам. А настоящий взрыв, мне кажется, будет в узконишевых продуктах с людьми внутри. И дело тут вообще не в подешевевшем коде. Соцпродукты дохли потому, что первые два года выручки нет, а зарплаты есть каждый месяц. Ты просто не доживаешь до момента, когда людей набралось достаточно. А пет-проект одного человека зарплат не платит. У него нет операционных расходов кроме оплаты сервака и подписки клод, и он может ждать сколько угодно. Вот что реально изменилось - не сложность, а возможность пересидеть. Запусков будет в сотни раз больше, конверсия в успех упадёт, но в абсолюте выстрелит больше. Прилки для сбора теннисистов, чтобы забронировать корт и поиграть вместе. Аналоги тиндера, чтобы свести две аудитории. Например, двух алкашей, которым не с кем побухать 🍻 Только выстрелят не те, кто пришёл в нишу с приложением, а те, кто уже сидит внутри сообщества. Код собирается за вечер, а живой рынок и доверие - годами. На скрине выше пример моего ПланФакта)

  • 7 июл.158233

    Больше недели живу без новостей - о челлендже писал тут. Ждал эффект по стадиям, как в тех красивых рилсах «когда бросил курить»: 20 минут — пульс и давление падают до нормы. 12 часов — уровень угарного газа в крови опускается до нормы. Через неделю улучшается кровообращение и растёт функция лёгких. Но, увы, нихрена такого не произошло. Курить я кстати бросил лет 15 назад — и этих эффектов по расписанию тогда тоже не почувствовал. Похоже, такие таймлайны больше в рилсах, чем в реальной жизни. Зато у детокса нашёлся другой эффект - освободилось время. Ещё год назад я читал, что вайбкодинг - это новая наркомания, что в принципе недалеко от правды 😅. Вот в это освободившееся время я им и занимался. За эти вечера я свёл в единую систему нашу турецкую компанию — то, что раньше жило кусками в разных местах, собрал в одну базу, где данные всех отделов наконец начали пересекаться между собой. Называть это чистым вайбкодингом сложно: код почти весь писал Claude Code, но архитектуру и логику проектировал я. И вот тут для меня большой кайф. То, что я хотел много лет, но не мог реализовать из-за пропускной способности людей - получилось сделать в рамках нескольких месяцев. Что получилось на выходе? Упрощённо — ERP, куда стянута почти вся компания. Маркетинг и продажи: количество заявок, успешных сделок, причины отказа по каждой рекламной кампании, причины провала рекламных стратегий, трекинг клиента от заявки до первой прибыли. Финансы: отчёты о прибылях и убытках, бюджетирование (что, кстати, пока только внедряем), динамика прибыли, клиентов и других показателей. ИИ-сотрудники: отдел контроля качества звонков и звонилка для возврата отвалившихся клиентов. Люди и процессы: большая реферальная система, регламенты и инструкции компании, автоматизированные зарплатные ведомости. Плюс у всего персональные доступы по ролям. Кстати регламенты и инструкции перетянул из Noition. Claude code сам ходил в Notion и собирал от туда данные, строил базу знаний для сотрудников. Заодно находил несостыковки. Пока еще не всё сведено в один общий раздел, но большая часть работы уже готова. Для удобства я подключил всё это в Bitrix как локальное приложение — теперь выглядит как встроенный модуль, сотрудникам так удобнее. Так что таймлайн детокса у меня вышел свой. Не «через 20 минут спокойствие», а «через неделю объединил и доработал рабочую систему вместо новостной ленты». Выходит, новости я убирал не ради спокойствия — ради времени. А время, в отличие от ленты, можно превратить во что-то полезное. Мозг на автомате ищет замену новостям. Поэтому какая-то польза без новостей есть)

  • видео или голосовое, без подписи

  • видео или голосовое, без подписи

  • видео или голосовое, без подписи

  • видео или голосовое, без подписи

  • видео или голосовое, без подписи

  • видео или голосовое, без подписи

Бунин в деле | Бизнес, ИИ и о личном — tgindex