GK trips
Статистика- Последний пост
- 12 июл.
- Последнее чтение
- 15:52
- Постов за неделю
- 0
- Всего постов
- 21
- Тип
- открытый
- Язык
- русский
- В каталоге с
- 12 авг.
- 1/24сутки в ленте
- —
- 1/48двое суток
- —
- 1/72трое суток
- —
Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.
Посты
400K пользователей, три года жизни и продукт, который телеграм так и не смог убить 😄 А если серьезно: понял, что никогда не рассказывал тут про @my_voice_messages_bot, бота для распознавания голосовых в текст (а теперь уже и любых аудио и встреч), которого мы с @karfly создали в мае 2023 года 🎙 Проблема была очевидной: слушать огромные голосовые, когда ты на встрече, звонке или просто куда-то спешишь - боль. А есть целая категория людей, которые общаются исключительно голосовыми (ничего плохого в этом не вижу, но иногда неудобно). Хотелось распознавать голосовые быстро и прямо в телеграме. Такая фича была (и до сих пор есть) в премиум-подписке телеги, но по факту она была нерабочей: расшифровка делалась ОЧЕНЬ долго, а читать текст на выходе было невозможно. Но просто сделать бота, который повторяет фичу телеги, мне было неинтересно. Хотелось вау-эффекта ✨ Я тогда гостил у Карима и его семьи в Кисловодске. Мы гуляли по городу и разгоняли идеи вокруг недавно вышедшей gpt-3.5-turbo. Не было ни желания, ни амбиций заработать денег (или я просто хотел так думать), хотелось просто сделать что-то крутое. Мне засела в голову идея: что, если использовать GPT, чтобы налету превращать сырую расшифровку в качественный, удобный для чтения текст? Карим помог приземлить мои инженерные фантазии на продуктовые реалии, и мы закодили первую версию voicebot'а (так мы его называли) за ~неделю. И она реально ощущалась как магия! Забавно, что сегодня таким никого не удивишь, аналогичный MVP пишется одним промптом в GPT 5.6 за 15 минут. Но тогда всё было иначе. Куча времени ушла на промпты для улучшения и суммаризации текста. Это сейчас достаточно «эй, gpt, брат, напиши кратко, что там» чтобы получить отполированный summary. А тогда сетка галлюцинировала мама не горюй, выдумывала несуществующие факты и меняла текст до неузнаваемости 🤯 Чтобы вы осознали, насколько всё было по-другому: тогда только-только вышла GPT-4, и она, как мне казалось, демонстрировала истинный интеллект и была запредельно крутой. По факту же она стоила в 30 раз дороже той LLM, которую я сейчас использую в проде (догадайтесь, какой?), работала невероятно медленно и была в разы тупее. Нашел забавное сообщение от Карима в телеге, май 2023: Затестил gpt-3.5-turbo. Он ебануться быстрый 256 токенов: - openai api: ~40сек Это, КАРЛ, 6 токенов в секунду. Сегодня GPT 5.6 генерит текст на скорости 100 tokens/sec, а я бешусь, что медленно 😄 В общем, вскоре мы запустили бота, Карим опубликовал пост в своем канале (https://t.me/karim_iskakov/443), и сразу пришел поток первых сотен пользователей. Начался совершенно новый, невероятно интересный этап первых шагов продукта! В следующих постах планирую рассказать: — как бот вырос до 400K уникальных пользователей и не умер, даже когда телеграм улучшил свою фичу распознавания — какие "гениальные" идеи оказались совершенно нерабочими — как спустя три года удается держать качество распознавания на уровне самых лучших и дорогих проприетарных сервисов типа ElevenLabs — про успехи и неудачи с точки зрения бизнеса, развития и маркетинга — почему даже сегодня, имея Fable 5 и GPT 5.6, повторить этот продукт не так-то просто — подкапотный ресерч и как работает текущий пайплайн распознавания (спойлер: тут и open-source, и fine-tunes, и довольно сложные пайплайны, и кастомный алгоритм нарезки на чанки, и даже катбуст замешан). — инсайты из аналитики: как и зачем люди на самом деле пользуются ботом — как мы шифруем сообщения в базе так, что даже я не могу прочитать, что люди отправляют в бота (нетривиальная идея @karfly) — как выглядит саппорт: сколько сообщений прилетает в день, чего люди просят и как кроют нас матом общаются Напишите в комментариях, про что было бы интереснее всего почитать 🙂
видео или голосовое, без подписи
видео или голосовое, без подписи
В последнее время очень загружен, ничего не успеваю. Работа, ремонт, попытки не пропускать спорт и не жертвовать сном. Поэтому когда сегодня понадобилось закупить продукты, решил попробовать ускорить процесс. Обычно я просто накидывал руками продукты в корзину на озоне, ориентируясь на отзывы и рейтинг. Процесс явно не самый интеллектуальный — значит, можно делегировать LLMкам :) Слышал, что на рынке уже есть несколько "AI-first браузеров" и несколько расширений-"агентов" для браузера. Но до сих пор сам их не пробовал, т.к. отношусь к сырым/новым технологиям скептически, да и не было подходящего запроса (90% процентов моей работы происходит либо в редакторе кода, либо в Gemini/ChatGPT, а умный браузер сам по себе поулчается особо и не нужен). Скачал Сomet (AI-браузер от perplexity), и просто офигел от результата. Накидал с GPT список продуктов, открыл в Comet озон и закинул в ассистента промпт "набери в корзину следующие товары: XXX. Смотри чтобы не было добавленного сахара, был высокий рейтинг и много отзывов". На все ушло минимум времени. Дальше агент работал минут 5-10 абсолютно автономно (я в это время писал этот пост), я зашел и нажал кнопку "купить", продукты выехали. На скриншотах мой исходный список, процесс работы агента и итоговая корзина. Не знаю, будут ли у меня еще кейсы, в которых такой агент пригодится, но я сделал как минимум два вывода 1. Напишу себе два детальных промпта: один для ChatGPT, другой для Comet. В них укажу все важные мне детали (какие продукты предпочитаю, на какое время ставить доставку и т.д.). И буду заказывать продукты только так) Это реально снижает и без того невероятно низкий порог на заказ еды 2. Как бы сегодняшние LLM-ки не были ограничены, все же они неизбежно окажут существенное влияние на мир. Почему-то я это понял именно сегодня, когда модель помогла мне заказать продукты (а не после того как написал с помощью Cursor/Codex десятки тысяч строк кода :D). Интерфейсы, такие как сайты маркетплейсов, должны будут измениться радикально, вплоть до того, что заказ продуктов будет выглядеть как "Алиса, закажи мне что-нибудь поесть, подбери время чтобы курьер приехал когда я буду подъезжать к офису. Сегодня давай без пп, хочу жирного и сладкого". Не вижу препятствий к тому, чтобы у "персональных" LLM-агентов были все возможности идеально обработать такой запрос P.S. Еще забавный момент Я решил, что модель забыла добавить в корзину помидоры. Но в итоге оказалось, что их просто раскупили между моментом, когда Comet добавил их в корзину, и моментом, когда я эту корзину оплатил Comet — молодец, Озон — фи tl;dr кто еще не пробовал, попробуйте Comet (ну или может что-то получше в комментах подскажут). Как минимум, испытать приятный вау-эффект, а как максимум, заиметь еще один полезный инструмент в хозяйстве
Ну вы уже поняли тенденцию, да? Я изучил ещё десяток задач, где Opus зачли решение, а GPT-5 — нет. Они почти все сводятся к одной вещи: Opus заранее пишет тесты к своим правкам, а GPT-5 — нет. В результате Opus вносит правки до посинения, пока все тесты не пройдут (иногда упираясь в лимит, настрочив сотни строк кода). GPT-5 же идёт, засучивает рукава, сразу делает фикс и сабмитит ответ. То есть на всех этих задачах банальная инструкция в промпте — «сначала напиши хороший тест, который покрывает разные случаи, убедись, что он запускается и ловит все ошибки из issue; затем вноси правки в код до тех пор, пока твои тесты и все существующие не проходят» — перетасовала бы результаты с ног на голову. И теперь на десерт: знаете, сколько среди 500 задач таких, на которых результаты Opus и GPT-5 отличаются, и при этом GPT-5 не упёрся в лимит по токенам? 36. Тридцать шесть, Карл! Вся «точность» датасета, которая определяет, какая модель лучше, а какая хуже, оказалась заперта внутри 36 задач — это 7% набора. Все остальные задачи либо настолько простые, что их решают обе модели, либо настолько корявые/специфичные, что их не решает никто. Какие выводы? Проверять знания — крайне сложная задача. Точно так же, как ЕГЭ не измеряет глубину понимания, как собеседование не гарантирует успешность в работе, как Канеман в израильской армии не смог по психотестам определять пригодность к службе, так и бенчмарки являются сомнительным способом измерять «интеллект» модели. Те, кто хоть раз обучал сложные ML-модели, это знают. Но то, что бенчмарк, на который опираются крупные компании, продавая модели пользователям и инвесторам, окажется настолько мусорным, — такого я не ожидал 🤯. Честно, я не уверен, что встретил в нём хотя бы одну задачу, где реально видно качественное превосходство одной модели над другой. tl;dr Не смотрите на SWE-bench-verified. Он ничего не проверяет и не говорит, какая модель лучше, а какая хуже. ✅❌
Загибайте пальцы — сколько дичи нашлось 🕵️♂️: 1. Лимит в 1M токенов на задачу. Epoch.AI для каждой модели установила порог: как только модель потратила миллион токенов, её останавливают и имеющиеся в коде изменения прогоняют через автотесты. То есть даже если модель двигалась в верном направлении, в какой-то момент у неё забирают работу (как тетрадку на контрольной после звонка 😅) и проверяют то, что она успела сделать. В итоге Opus не успел закончить работу примерно в 80% задач, а GPT-5 — в ~40%. Пример — задача astropy__astropy-13977: GPT-5 просто не успела внести нужные правки. Почему так? В SWE-bench используются кривоватые инструменты редактирования и чтения кода, которые часто приходится вызывать несколько раз, прежде чем они сработают. 2. Задача astropy__astropy-13033. GPT-5 справилась с требованием задачи и смогла сделать так, чтобы при некорректных действиях пользователя код падал с определённой ошибкой. Но тесты бенчмарка проверяют, что сообщение об ошибке содержит конкретный текст, а GPT-5 использовала другую формулировку. Селяви, задача не засчитана. Аналогично в sympy__sympy-13852: тесты проверяют исправление не только того бага, который описан в исходном issue, но и нескольких других, и в результате модели тоже получают незачёт. 3. Задача sympy__sympy-13091. Opus задачу не решил: посадил новый баг, из-за которого в одном из тестов случилось переполнение стека (бесконечная рекурсия). Но задачка засчиталась 🙂 Другой пример: scikit-learn__scikit-learn-14710 — GPT-5 задачу решил(!), но она не засчиталась, т.к. тест просто завис. 4. django__django-15127. Opus очень грамотно предложил три варианта решения и выбрал первый. Однако тесты проверяли, что решение будет строго определённым. Не угадал — не засчитали. Похоже на преподавателя, который требует от студента доказательство «как на лекции». 5. scikit-learn__scikit-learn-14629. Здесь я уже смеялся вслух. С одной стороны, кейс похож на предыдущий: в этот раз GPT-5 избрала определённый метод решения, а тесты ожидали другой, конкретный способ — такой, какой был у автора багфикса. Мне стало интересно, как же тогда эту задачу решил Opus. Оказалось, он написал код, символ-в-символ совпадающий с тем, который написали люди в 2019 году при закрытии бага (https://github.com/scikit-learn/scikit-learn/issues/14615). Неудивительно: это open-source код, и все LLM-модели на нём обучались. Спекулирую, что Opus существенно «крупнее», чем GPT-5, и просто лучше «помнит» исходный код библиотеки. В целом бенчмарк, в котором все (!) задачи взяты из open-source библиотек, на которых обучались все без исключения модели, — это не очень хорошая идея 😅 6. django__django-16642. Обе модели решили, но GPT-5 использовала современное название MIME-типа — application/brotli, а Opus — устаревшее application/x-brotli. Знаете, кто победил? Конечно, Opus! 🤷♂️
Небольшое пост-расследование про LLM-модели 🤖 Немного контекста. Мы с моим другом Каримом часто разгоняем мысль, что мы живём в уникальное время и можем наблюдать беспрецедентное соревнование между компаниями, обучающими LLM-модели. Обычно компании соревнуются неявно, и качество их продуктов никто напрямую не оценивает (например, нет объективных метрик, показывающих, чей поиск лучше — Google, Яндекса или Bing). А в LLM-мире есть конкретные бенчмарки, и при релизе очередной модели каждая компания публикует результаты по ним. То есть мы буквально наблюдаем за гонкой, как на скачках 🏇 (только ставки в миллионы раз выше). Среди прочих, есть такой бенчмарк — SWE-bench-verified (https://openai.com/index/introducing-swe-bench-verified/), который проверяет, как модели в агентном режиме способны фиксить баги в реальных больших open-source репозиториях. Разумеется, и Google, и Anthropic, и OpenAI публикуют скоры своих моделей на SWE-bench. На данный момент фигурируют такие числа: OpenAI GPT-5: 74.9% Anthropic Opus 4.1: 74.5% 📊 Казалось бы, всё очевидно и понятно — кто лучше, кто хуже. Но твиттер кипит: OpenAI проверяют свою модель не на всех 500 задачах, а на 477! И значит, «реальный» результат GPT-5 — 71%! Это отчасти правда: OpenAI действительно не проверяли модель на всём наборе. И это действительно обесценивает сравнение, потому что мы сопоставляем тёплое с мягким, ведь мы не знаем, как GPT-5 повела бы себя на 23 непокрытых задачах. Я решил разобраться в вопросе и копнуть глубже, чтобы понять, какие метрики были бы «справедливыми». К счастью, мне не пришлось прогонять бенчмарк руками: есть компания Epoch.AI, которая независимо прогоняет SWE-bench-verified на всех 500 задачах и публикует скоры для каждой модели. По её замерам GPT-5 набирает 59%, а Opus 4.1 — 63%. Помимо итоговых метрик Epoch.AI выложила логи запусков каждой модели на каждой задаче, и можно глазами отследить, что происходило. Разница с официальными числами некислая, к тому же Opus вырвался вперед. Тут явно что-то нечисто, поэтому я спарсил данные с их сайта и сделал небольшой анализ.
Давно ничего не писал. Часто хочется делиться интересными находками, но не пишу, потому что "не по теме" или "всем будет неинтересно". Решил убрать рамки и писать о том, о чем хочется. Возможно, со временем выделится какая-то тематика этого канала, но пока будет просто все подряд
Лечу на Бали! И как раз вовремя, потому что последнюю неделю началось мучение от аллергии (орешник начал пылить в начале марта!!!) Осталось лететь два часа до Дохи, потом 10-часовая пересадка и рейс в Денпасар. А этот пост пишу из самолета, я в шоке как работает Starlink, не мог себе такого представить
видео или голосовое, без подписи
видео или голосовое, без подписи
видео или голосовое, без подписи
видео или голосовое, без подписи
видео или голосовое, без подписи
видео или голосовое, без подписи
видео или голосовое, без подписи
видео или голосовое, без подписи
Давно меня тут не было. В последнее время благодаря ChatGPT часто нахожу разные интересные штуки, хочу иногда про них рассказывать, т.к. знаю, что далеко не все пользуются даже 5% его возможностей. История про ChatGPT и аллергию У меня уже много лет аллергия на березу. В прошлом году прилетел в Москву в июле, когда береза уже давно отпылила и неожиданно для себя столкнулся с довольно сильными симптомами аллергии, хотя до этого я сходил к нескольким аллергологам, и мне казалось, что я хорошо понимаю, на что у меня аллергия. Решил я, значит, разобраться во всем. Захотелось копнуть глубоко и понять суть самому, а не просто пойти к врачу и получить дорогие и поверхностные назначения, как в прошлые разы. Как помог ChatGPT за несколько запросов в ChatGPT я - подобрал оптимальный исчерпывающий аллерготест (ALEX2) - загрузил результаты теста, получил описание результатов в компактном виде, в котором удобно их показать любому врачу - получил подробнейшее описание своей аллергии, понял, на какие конкретно белки у меня аллергия, в какие месяцы в Москве она будет проявляться и какие продукты мне можно есть, а какие нельзя - подобрал оптимальную схему лечения современными препаратами Разумеется, нельзя доверять ИИ в решении важных вопросов и полагаться только на него. Все выводы мне пришлось перепроверить, опираясь на свой многолетний опыт лечения аллергии, на консультации с врачами-аллергологами, на чтение научных статей и рекомендации учебников по медицине. В данном конкретном случае ChatGPT был полностью прав и дал дельные советы. Но во многих ситуациях он может сгаллюцинировать ерунду или отказаться отвечать. Тогда зачем вообще нужен ChatGPT? Тогда в чем толк от ИИ, если любой серьезный ответ нужно перепроверять? Я считаю, что основная польза — вы быстром поиске, структурировании и обработке информации. По сути, вместо ручной работы с excel, браузером, гуглом и клавиатурой я заставляю все делать ChatGPT вместо меня. Он собирает информацию, а мне остается лишь ее проверить. Причем ChatGPT можно в том числе просить помогать в проверке ("пришли ссылки на статьи, обосновывающие твое мнение"). В результате лично у меня вырастает эффективность в подобных задачах в несколько раз. Нет, я не могу сделать того, что не мог сделать раньше без ChatGPT. Но теперь порог входа в то, чтобы вообще взяться за какую-либо задачу, понизился настолько, что я стал пробовать и узнавать в разы больше новых неожиданных вещей о мире. И дальше будет еще лучше и быстрее, так что советую каждому не отставать от технологий и внедрять использование ИИ и в свои задачи. P.S. На фотках примеры запросов и ответов из данного конкретного кейса
видео или голосовое, без подписи
видео или голосовое, без подписи