tgindex
GK trips
@gkorcрусский
Последний пост
12 июл.
Последнее чтение
15:52
Постов за неделю
0
Всего постов
21
Тип
открытый
Язык
русский
В каталоге с
12 авг.
Подписчики
255
0 за 4 дн.
Сутки
0
0,00%
Неделя
 
Месяц
 
Просмотров на пост
1 365
20 постов
Вовлечённость
535,3%
к подписчикам
Постов в день
0,0
всего 21
Упоминаний
1
каналов
Охват размещения
оценка
1/24сутки в ленте
1/48двое суток
1/72трое суток

Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.

Посты

  • 12 июл.9548116

    400K пользователей, три года жизни и продукт, который телеграм так и не смог убить 😄 А если серьезно: понял, что никогда не рассказывал тут про @my_voice_messages_bot, бота для распознавания голосовых в текст (а теперь уже и любых аудио и встреч), которого мы с @karfly создали в мае 2023 года 🎙 Проблема была очевидной: слушать огромные голосовые, когда ты на встрече, звонке или просто куда-то спешишь - боль. А есть целая категория людей, которые общаются исключительно голосовыми (ничего плохого в этом не вижу, но иногда неудобно). Хотелось распознавать голосовые быстро и прямо в телеграме. Такая фича была (и до сих пор есть) в премиум-подписке телеги, но по факту она была нерабочей: расшифровка делалась ОЧЕНЬ долго, а читать текст на выходе было невозможно. Но просто сделать бота, который повторяет фичу телеги, мне было неинтересно. Хотелось вау-эффекта ✨ Я тогда гостил у Карима и его семьи в Кисловодске. Мы гуляли по городу и разгоняли идеи вокруг недавно вышедшей gpt-3.5-turbo. Не было ни желания, ни амбиций заработать денег (или я просто хотел так думать), хотелось просто сделать что-то крутое. Мне засела в голову идея: что, если использовать GPT, чтобы налету превращать сырую расшифровку в качественный, удобный для чтения текст? Карим помог приземлить мои инженерные фантазии на продуктовые реалии, и мы закодили первую версию voicebot'а (так мы его называли) за ~неделю. И она реально ощущалась как магия! Забавно, что сегодня таким никого не удивишь, аналогичный MVP пишется одним промптом в GPT 5.6 за 15 минут. Но тогда всё было иначе. Куча времени ушла на промпты для улучшения и суммаризации текста. Это сейчас достаточно «эй, gpt, брат, напиши кратко, что там» чтобы получить отполированный summary. А тогда сетка галлюцинировала мама не горюй, выдумывала несуществующие факты и меняла текст до неузнаваемости 🤯 Чтобы вы осознали, насколько всё было по-другому: тогда только-только вышла GPT-4, и она, как мне казалось, демонстрировала истинный интеллект и была запредельно крутой. По факту же она стоила в 30 раз дороже той LLM, которую я сейчас использую в проде (догадайтесь, какой?), работала невероятно медленно и была в разы тупее. Нашел забавное сообщение от Карима в телеге, май 2023: Затестил gpt-3.5-turbo. Он ебануться быстрый 256 токенов: - openai api: ~40сек Это, КАРЛ, 6 токенов в секунду. Сегодня GPT 5.6 генерит текст на скорости 100 tokens/sec, а я бешусь, что медленно 😄 В общем, вскоре мы запустили бота, Карим опубликовал пост в своем канале (https://t.me/karim_iskakov/443), и сразу пришел поток первых сотен пользователей. Начался совершенно новый, невероятно интересный этап первых шагов продукта! В следующих постах планирую рассказать: — как бот вырос до 400K уникальных пользователей и не умер, даже когда телеграм улучшил свою фичу распознавания — какие "гениальные" идеи оказались совершенно нерабочими — как спустя три года удается держать качество распознавания на уровне самых лучших и дорогих проприетарных сервисов типа ElevenLabs — про успехи и неудачи с точки зрения бизнеса, развития и маркетинга — почему даже сегодня, имея Fable 5 и GPT 5.6, повторить этот продукт не так-то просто — подкапотный ресерч и как работает текущий пайплайн распознавания (спойлер: тут и open-source, и fine-tunes, и довольно сложные пайплайны, и кастомный алгоритм нарезки на чанки, и даже катбуст замешан). — инсайты из аналитики: как и зачем люди на самом деле пользуются ботом — как мы шифруем сообщения в базе так, что даже я не могу прочитать, что люди отправляют в бота (нетривиальная идея @karfly) — как выглядит саппорт: сколько сообщений прилетает в день, чего люди просят и как кроют нас матом общаются Напишите в комментариях, про что было бы интереснее всего почитать 🙂

  • видео или голосовое, без подписи

  • видео или голосовое, без подписи

  • В последнее время очень загружен, ничего не успеваю. Работа, ремонт, попытки не пропускать спорт и не жертвовать сном. Поэтому когда сегодня понадобилось закупить продукты, решил попробовать ускорить процесс. Обычно я просто накидывал руками продукты в корзину на озоне, ориентируясь на отзывы и рейтинг. Процесс явно не самый интеллектуальный — значит, можно делегировать LLMкам :) Слышал, что на рынке уже есть несколько "AI-first браузеров" и несколько расширений-"агентов" для браузера. Но до сих пор сам их не пробовал, т.к. отношусь к сырым/новым технологиям скептически, да и не было подходящего запроса (90% процентов моей работы происходит либо в редакторе кода, либо в Gemini/ChatGPT, а умный браузер сам по себе поулчается особо и не нужен). Скачал Сomet (AI-браузер от perplexity), и просто офигел от результата. Накидал с GPT список продуктов, открыл в Comet озон и закинул в ассистента промпт "набери в корзину следующие товары: XXX. Смотри чтобы не было добавленного сахара, был высокий рейтинг и много отзывов". На все ушло минимум времени. Дальше агент работал минут 5-10 абсолютно автономно (я в это время писал этот пост), я зашел и нажал кнопку "купить", продукты выехали. На скриншотах мой исходный список, процесс работы агента и итоговая корзина. Не знаю, будут ли у меня еще кейсы, в которых такой агент пригодится, но я сделал как минимум два вывода 1. Напишу себе два детальных промпта: один для ChatGPT, другой для Comet. В них укажу все важные мне детали (какие продукты предпочитаю, на какое время ставить доставку и т.д.). И буду заказывать продукты только так) Это реально снижает и без того невероятно низкий порог на заказ еды 2. Как бы сегодняшние LLM-ки не были ограничены, все же они неизбежно окажут существенное влияние на мир. Почему-то я это понял именно сегодня, когда модель помогла мне заказать продукты (а не после того как написал с помощью Cursor/Codex десятки тысяч строк кода :D). Интерфейсы, такие как сайты маркетплейсов, должны будут измениться радикально, вплоть до того, что заказ продуктов будет выглядеть как "Алиса, закажи мне что-нибудь поесть, подбери время чтобы курьер приехал когда я буду подъезжать к офису. Сегодня давай без пп, хочу жирного и сладкого". Не вижу препятствий к тому, чтобы у "персональных" LLM-агентов были все возможности идеально обработать такой запрос P.S. Еще забавный момент Я решил, что модель забыла добавить в корзину помидоры. Но в итоге оказалось, что их просто раскупили между моментом, когда Comet добавил их в корзину, и моментом, когда я эту корзину оплатил Comet — молодец, Озон — фи tl;dr кто еще не пробовал, попробуйте Comet (ну или может что-то получше в комментах подскажут). Как минимум, испытать приятный вау-эффект, а как максимум, заиметь еще один полезный инструмент в хозяйстве

  • Ну вы уже поняли тенденцию, да? Я изучил ещё десяток задач, где Opus зачли решение, а GPT-5 — нет. Они почти все сводятся к одной вещи: Opus заранее пишет тесты к своим правкам, а GPT-5 — нет. В результате Opus вносит правки до посинения, пока все тесты не пройдут (иногда упираясь в лимит, настрочив сотни строк кода). GPT-5 же идёт, засучивает рукава, сразу делает фикс и сабмитит ответ. То есть на всех этих задачах банальная инструкция в промпте — «сначала напиши хороший тест, который покрывает разные случаи, убедись, что он запускается и ловит все ошибки из issue; затем вноси правки в код до тех пор, пока твои тесты и все существующие не проходят» — перетасовала бы результаты с ног на голову. И теперь на десерт: знаете, сколько среди 500 задач таких, на которых результаты Opus и GPT-5 отличаются, и при этом GPT-5 не упёрся в лимит по токенам? 36. Тридцать шесть, Карл! Вся «точность» датасета, которая определяет, какая модель лучше, а какая хуже, оказалась заперта внутри 36 задач — это 7% набора. Все остальные задачи либо настолько простые, что их решают обе модели, либо настолько корявые/специфичные, что их не решает никто. Какие выводы? Проверять знания — крайне сложная задача. Точно так же, как ЕГЭ не измеряет глубину понимания, как собеседование не гарантирует успешность в работе, как Канеман в израильской армии не смог по психотестам определять пригодность к службе, так и бенчмарки являются сомнительным способом измерять «интеллект» модели. Те, кто хоть раз обучал сложные ML-модели, это знают. Но то, что бенчмарк, на который опираются крупные компании, продавая модели пользователям и инвесторам, окажется настолько мусорным, — такого я не ожидал 🤯. Честно, я не уверен, что встретил в нём хотя бы одну задачу, где реально видно качественное превосходство одной модели над другой. tl;dr Не смотрите на SWE-bench-verified. Он ничего не проверяет и не говорит, какая модель лучше, а какая хуже. ✅❌

  • Загибайте пальцы — сколько дичи нашлось 🕵️‍♂️: 1. Лимит в 1M токенов на задачу. Epoch.AI для каждой модели установила порог: как только модель потратила миллион токенов, её останавливают и имеющиеся в коде изменения прогоняют через автотесты. То есть даже если модель двигалась в верном направлении, в какой-то момент у неё забирают работу (как тетрадку на контрольной после звонка 😅) и проверяют то, что она успела сделать. В итоге Opus не успел закончить работу примерно в 80% задач, а GPT-5 — в ~40%. Пример — задача astropy__astropy-13977: GPT-5 просто не успела внести нужные правки. Почему так? В SWE-bench используются кривоватые инструменты редактирования и чтения кода, которые часто приходится вызывать несколько раз, прежде чем они сработают. 2. Задача astropy__astropy-13033. GPT-5 справилась с требованием задачи и смогла сделать так, чтобы при некорректных действиях пользователя код падал с определённой ошибкой. Но тесты бенчмарка проверяют, что сообщение об ошибке содержит конкретный текст, а GPT-5 использовала другую формулировку. Селяви, задача не засчитана. Аналогично в sympy__sympy-13852: тесты проверяют исправление не только того бага, который описан в исходном issue, но и нескольких других, и в результате модели тоже получают незачёт. 3. Задача sympy__sympy-13091. Opus задачу не решил: посадил новый баг, из-за которого в одном из тестов случилось переполнение стека (бесконечная рекурсия). Но задачка засчиталась 🙂 Другой пример: scikit-learn__scikit-learn-14710 — GPT-5 задачу решил(!), но она не засчиталась, т.к. тест просто завис. 4. django__django-15127. Opus очень грамотно предложил три варианта решения и выбрал первый. Однако тесты проверяли, что решение будет строго определённым. Не угадал — не засчитали. Похоже на преподавателя, который требует от студента доказательство «как на лекции». 5. scikit-learn__scikit-learn-14629. Здесь я уже смеялся вслух. С одной стороны, кейс похож на предыдущий: в этот раз GPT-5 избрала определённый метод решения, а тесты ожидали другой, конкретный способ — такой, какой был у автора багфикса. Мне стало интересно, как же тогда эту задачу решил Opus. Оказалось, он написал код, символ-в-символ совпадающий с тем, который написали люди в 2019 году при закрытии бага (https://github.com/scikit-learn/scikit-learn/issues/14615). Неудивительно: это open-source код, и все LLM-модели на нём обучались. Спекулирую, что Opus существенно «крупнее», чем GPT-5, и просто лучше «помнит» исходный код библиотеки. В целом бенчмарк, в котором все (!) задачи взяты из open-source библиотек, на которых обучались все без исключения модели, — это не очень хорошая идея 😅 6. django__django-16642. Обе модели решили, но GPT-5 использовала современное название MIME-типа — application/brotli, а Opus — устаревшее application/x-brotli. Знаете, кто победил? Конечно, Opus! 🤷‍♂️

  • Небольшое пост-расследование про LLM-модели 🤖 Немного контекста. Мы с моим другом Каримом часто разгоняем мысль, что мы живём в уникальное время и можем наблюдать беспрецедентное соревнование между компаниями, обучающими LLM-модели. Обычно компании соревнуются неявно, и качество их продуктов никто напрямую не оценивает (например, нет объективных метрик, показывающих, чей поиск лучше — Google, Яндекса или Bing). А в LLM-мире есть конкретные бенчмарки, и при релизе очередной модели каждая компания публикует результаты по ним. То есть мы буквально наблюдаем за гонкой, как на скачках 🏇 (только ставки в миллионы раз выше). Среди прочих, есть такой бенчмарк — SWE-bench-verified (https://openai.com/index/introducing-swe-bench-verified/), который проверяет, как модели в агентном режиме способны фиксить баги в реальных больших open-source репозиториях. Разумеется, и Google, и Anthropic, и OpenAI публикуют скоры своих моделей на SWE-bench. На данный момент фигурируют такие числа: OpenAI GPT-5: 74.9% Anthropic Opus 4.1: 74.5% 📊 Казалось бы, всё очевидно и понятно — кто лучше, кто хуже. Но твиттер кипит: OpenAI проверяют свою модель не на всех 500 задачах, а на 477! И значит, «реальный» результат GPT-5 — 71%! Это отчасти правда: OpenAI действительно не проверяли модель на всём наборе. И это действительно обесценивает сравнение, потому что мы сопоставляем тёплое с мягким, ведь мы не знаем, как GPT-5 повела бы себя на 23 непокрытых задачах. Я решил разобраться в вопросе и копнуть глубже, чтобы понять, какие метрики были бы «справедливыми». К счастью, мне не пришлось прогонять бенчмарк руками: есть компания Epoch.AI, которая независимо прогоняет SWE-bench-verified на всех 500 задачах и публикует скоры для каждой модели. По её замерам GPT-5 набирает 59%, а Opus 4.1 — 63%. Помимо итоговых метрик Epoch.AI выложила логи запусков каждой модели на каждой задаче, и можно глазами отследить, что происходило. Разница с официальными числами некислая, к тому же Opus вырвался вперед. Тут явно что-то нечисто, поэтому я спарсил данные с их сайта и сделал небольшой анализ.

  • Давно ничего не писал. Часто хочется делиться интересными находками, но не пишу, потому что "не по теме" или "всем будет неинтересно". Решил убрать рамки и писать о том, о чем хочется. Возможно, со временем выделится какая-то тематика этого канала, но пока будет просто все подряд

  • Лечу на Бали! И как раз вовремя, потому что последнюю неделю началось мучение от аллергии (орешник начал пылить в начале марта!!!) Осталось лететь два часа до Дохи, потом 10-часовая пересадка и рейс в Денпасар. А этот пост пишу из самолета, я в шоке как работает Starlink, не мог себе такого представить

  • видео или голосовое, без подписи

  • видео или голосовое, без подписи

  • видео или голосовое, без подписи

  • видео или голосовое, без подписи

  • видео или голосовое, без подписи

  • видео или голосовое, без подписи

  • видео или голосовое, без подписи

  • видео или голосовое, без подписи

  • Давно меня тут не было. В последнее время благодаря ChatGPT часто нахожу разные интересные штуки, хочу иногда про них рассказывать, т.к. знаю, что далеко не все пользуются даже 5% его возможностей. История про ChatGPT и аллергию У меня уже много лет аллергия на березу. В прошлом году прилетел в Москву в июле, когда береза уже давно отпылила и неожиданно для себя столкнулся с довольно сильными симптомами аллергии, хотя до этого я сходил к нескольким аллергологам, и мне казалось, что я хорошо понимаю, на что у меня аллергия. Решил я, значит, разобраться во всем. Захотелось копнуть глубоко и понять суть самому, а не просто пойти к врачу и получить дорогие и поверхностные назначения, как в прошлые разы. Как помог ChatGPT за несколько запросов в ChatGPT я - подобрал оптимальный исчерпывающий аллерготест (ALEX2) - загрузил результаты теста, получил описание результатов в компактном виде, в котором удобно их показать любому врачу - получил подробнейшее описание своей аллергии, понял, на какие конкретно белки у меня аллергия, в какие месяцы в Москве она будет проявляться и какие продукты мне можно есть, а какие нельзя - подобрал оптимальную схему лечения современными препаратами Разумеется, нельзя доверять ИИ в решении важных вопросов и полагаться только на него. Все выводы мне пришлось перепроверить, опираясь на свой многолетний опыт лечения аллергии, на консультации с врачами-аллергологами, на чтение научных статей и рекомендации учебников по медицине. В данном конкретном случае ChatGPT был полностью прав и дал дельные советы. Но во многих ситуациях он может сгаллюцинировать ерунду или отказаться отвечать. Тогда зачем вообще нужен ChatGPT? Тогда в чем толк от ИИ, если любой серьезный ответ нужно перепроверять? Я считаю, что основная польза — вы быстром поиске, структурировании и обработке информации. По сути, вместо ручной работы с excel, браузером, гуглом и клавиатурой я заставляю все делать ChatGPT вместо меня. Он собирает информацию, а мне остается лишь ее проверить. Причем ChatGPT можно в том числе просить помогать в проверке ("пришли ссылки на статьи, обосновывающие твое мнение"). В результате лично у меня вырастает эффективность в подобных задачах в несколько раз. Нет, я не могу сделать того, что не мог сделать раньше без ChatGPT. Но теперь порог входа в то, чтобы вообще взяться за какую-либо задачу, понизился настолько, что я стал пробовать и узнавать в разы больше новых неожиданных вещей о мире. И дальше будет еще лучше и быстрее, так что советую каждому не отставать от технологий и внедрять использование ИИ и в свои задачи. P.S. На фотках примеры запросов и ответов из данного конкретного кейса

  • видео или голосовое, без подписи

  • видео или голосовое, без подписи

GK trips — tgindex