tgindex
Женя, расскажи про AI

Женя, расскажи про AI

Статистика

Связаться: @jackuait Делюсь своим опытом LLM-assisted разработки и тем, что меня удивляет по ходу погружения в мир AI

Последний пост
13 мар.
Последнее чтение
00:19
Постов за неделю
0
Всего постов
21
Тип
открытый
Язык
русский
Категория
Технологии
В каталоге с
12 авг.
Подписчики
373
+1 за 4 дн.
Сутки
+1
+0,27%
Неделя
 
Месяц
 
Просмотров на пост
618
20 постов
Вовлечённость
165,7%
к подписчикам
Постов в день
0,0
всего 21
Упоминаний
1
каналов
Охват размещения
оценка
1/24сутки в ленте
1/48двое суток
1/72трое суток

Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.

Посты

  • 13 мар.775152из data_secrets

    AlphaEvolve от Google DeepMind открыла новые нижние оценки для чисел Рамсея, улучшив результаты, которые не обновлялись десятилетиями Числа Рамсея – это фундаментальные объекты в комбинаторной математике. Формально, число Рамсея R(s,t) – это минимальное число вершин в полном графе, при котором любое окрашивание ребер в два цвета (скажем, красный и синий) создает либо полносвязный подграф на s вершинах, где все ребра красные, либо полносвязный подграф на t вершинах, где все ребра синие. Эта задача крайне вычислительно сложна. Даже для небольших значений типа R(5,5) точное значение неизвестно спустя почти век исследований, потому что для вычисления требуется перебор экспоненциального числа раскрасок графов. Это делает задачу неразрешимой даже на современных суперкомпьютерах. Эрдеш, тот самый легендарный комбинаторщик, говорил, что R(5,5) посчитают только инопланетяне или следующая цивилизация. Короче, числа Рамсея действительно очень сложны. А вчера DeepMind вдруг объявили, что AlphaEvolve самостоятельно воспроизвела все известные точные границы и улучшила значения для пяти классических случаев. Особенно поражает, что исторически для приближения чисел Рамсея использовались только хитрые ручные алгоритмы, а тут пробить SOTA смогла +-универсальная система на основе LLM. Статья

  • 12 мар.1 2372017

    В продолжение постов об исследованиях от METR На скриншоте — количество задач, которые мы закрыли в последнем спринте командой из двух человек: 25 задач. Для нашей команды это много. Очень много. Можете не считать стори-поинты, так как вряд ли эти оценки будут информативны, ибо они учитывают разработку с агентами, и 0.1 для агента спокойно может быть 0.5-1 для человека. Причём у нас не было цели «закрыть как можно больше задач» или «поднажать в этом спринте» — это самый обычный спринт. За исключением того, что наш бекендер, Дима, адаптировал под нас систему, придуманную другой командой из Додо, которая позволяет прожаривать карточки с помощью LLM. Суть простая: мы берём юзер-стори → LLM исследует кодовую базу и все открытые/архивные карточки → на основе юзер-стори LLM пишет описание для карточки с техническими деталями и закидывает её к нам на доску → that's it. Казалось бы, ничего революционного, но на деле — это офигенный способ использовать LLM в уже устоявшейся кодовой базе, так как она имеет нужный ей контекст и почти без ошибок угадывает, какие паттерны применить, куда положить файлы, как задизайнить API и так далее. Ниже — то, как новый подход ускорил нас. 1. Даже в нашей небольшой команде прожарка задач была бутылочным горлышком. Помимо того, что она занимала огромное количество времени, зачастую она была очень муторной, и после неё зачастую не оставалось мыслетоплива для того, чтобы делать ещё что-то в течение дня. 2. Новый подход позволил нам распараллелить работу. Так как все задачи прожарены наперёд, то я могу взять в работу задачу, для которой нужен бэк, понимая, что API не готово. И мне, в целом, без разницы, когда оно будет готово. Как будет готово — фича полностью заработает, а до этого момента просто будет скрыта от глаз пользователя. Это особенно классно, учитывая то, что у нас есть много независимых задач, которые нужно делать только на фронте или только на бэке, из-за чего бывает очень сложно синхронизироваться, чтобы сделать/прожарить задачу, которая уже требует работы с обеих сторон. Сейчас эта проблема исчезла, ибо у нас просто отпала необходимость синхронизироваться друг с другом там, где это было необходимо раньше. 3. Мы можем брать задачи из другого домена. Так на прошлой неделе наш менеджер, Оля, принесла юзер-стори, прожарила её через скилл в Claude Code, а затем на основе прожаренной карточки самостоятельно закрыла задачу. Задача была на бэке, поэтому Дима, само собой, посмотрел код, немного поправил тесты и слил задачу в мастер. И всё это в рамках одного дня. В такие моменты особенно отчётливо приходит понимание, что эра разработчиков, которые умеют просто превращать прожаренные требования в код, подошла к концу. Кстати, зацените распределение карточек по типам: • 14 фичей • 8 багов • 2 технические задачи • 1 исследование То есть 32% закрытых карточек были багами. Думаю, что кому-то это число может показаться большим, поэтому давайте разберём, что там за баги: • 4 бага связаны с огромной фичой на 70 тыс. строк (таблицы для Blok), которую я затащил за спринт до этого. Все баги — неучтённые edge-кейсы. • 3 бага — те самые регрессии, которых все боятся при работе с агентами. Сценарии, в которых они возникали, уже покрыты тестами, так что снова не появятся:) • 1 баг вообще находился не в нашем сервисе, но так как ребята из другого сервиса пока не могут пофиксить баг у себя, мы сделали изощрённую заплатку в нашем сервисе, до которой не додумались бы сами. Так что, как видите, даже с учётом возросшей скорости и количества фичей, которые мы шипим, у нас произошло всего 12% регрессии за спринт. И это опять же очень классный результат! P.S. Уже в текущем спринте Оля закрыла ещё две задачи. Я их отревьюил и просто слил в мастер, так как доработки не требовались. Да, пока Оля берёт в работу только небольшие задачи, но думаю, что со временем мы будем экспериментировать с карточками бо́льших размеров. Посмотрим, что из этого получится:)

  • 9 мар.603147

    Мы получили Cyberpunk 2077 в реальной жизни до выхода GTA 6 Помните бреиндансы из Cyberpunk 2077? Это технология, которая позволяет записывать любые ощущения и затем передавать их напрямую в мозг. Так вот, похоже, что фантастика в очередной раз предсказала будущее. На днях независимо друг от друга вышли две удивительные новости. 1. Cortical Labs запустили Doom на человеских мозговых клетках. Если для вас это звучит отвратительно, то поверьте, что в жизни всё в 10 раз хуже. Cortical Labs создали CL1. От обычного компьютера этот отличает только то, что в нём буквально живут клетки, которым подаётся питательная жидкость, строго дозируется уровень кислорода, отводится углекислый газ и поддерживается температура на уровне 37 градусов. Без этой поддержки био-процессор гибнет за пару минут 💀. Звучит стрёмно, но вернёмся от ужасов к ПОГИБЕЛИ DOOM. Жму руку тому, кто надоумил создателей запустить DOOM на 200 000 живых нейронов — это идеальный дуэт. У вас может возникнуть вполне справедливый вопрос: а как эти нейроны вообще понимают, что им делать, ведь у них нет глаз... да, и вообще особо ничего нет, кроме собственно нейронов? Cortical Labs разработали API, через который био-процессору посылаются электронные сигналы, которые заставляют его реагировать на то, что происходит в DOOM. Можно сказать, что происходящее в игре для этого «мозга» реально. Лично меня эта история изрядно пугает, ведь речь идёт уже не о математической модели (LLM), а о полноценном искусственно выращенном интеллекте. Пока что разработки на очень ранней стадии, но ученые уже научились «избивать» этот мозг, ради получения нужного результата. По сути это RL, но для человеческого мозга — к чему это может привести, когда технологию научаться применять на людях даже подумать страшно. 2. Eon Systems воспроизвели мозг мухи-дрозофилы в симуляции. И под «воспроизвели» я именно это и имею в виду: они создали коннектом (полную карту нейронных связей в мозге мухи). То есть они повторили мозг мухи 1 в 1 (биохимическая схема была намеренно упрощена, здесь речь именно про электромеханические связи) и подключили его к телу внутри симуляции. Искусственная муха начала совершать базовые осмысленные движения, которые она была незапрограммирована делать: ходить, вытягивать хоботок для питания, умываться. На самом деле сам мозг воспроизвели ещё в 2024-м, сейчас же на свет появилась именно симуляция. И вся прелесть в том, что это не просто 3D-мир с мухой. Среда, которую мы видим посылает ей различные сигналы, которые мозг мухи затем интерпретирует и реагирует определенным образом. Это огромный научный скачок, ведь раньше удавалось симулировать только мозг червя, чей мозг состоял всего из 302 нейронов. У мухи же 125 000 нейронов. При этом в человеческом мозгу в среднем около 86 миллиардов нейронов. Eon Systems пообещали создать коннектом мозга человека к 2030-у году. ————————— Сейчас сложно представить куда именно нас приведут эти технологии, но можно с уверенностью сказать, что мы стоим на пороге ряда технологических прорывов, которые определят нашу жизнь на сотни лет вперёд. И то, что мы видим сейчас — только начало новой эры. Кто знает, вероятно к 2030 году первый человек действительно будет загружен в Пантеон (ну, или в Матрицу), а мы будем обсуждать этичность цифрового бессмертия и какие бреиндансы стоит попробовать в этом месяце. Пока можно сказать только то, что будущее стало и более пугающим, и более завораживающим одновременно.

  • 7 мар.574121

    Кринж-METR 2/2 10 июля 2025 года METR выпускает новое исследование «Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity». И какая же суматоха началась в кругу разработчиков. Лично мне не меньше двух десятков раз приводили это исследование как доказательство того, что agentic coding не работает. Что же, теперь я знаю, кто читает только заголовки новостей:) А заголовки были громкими: • «Использование искусственного интеллекта замедляет опытных разработчиков на 19%» • «AI замедляет разработчиков, но они думают, что ускоряет» • «Ловушка продуктивности: почему ваши инженеры замедляются» В моменте интернет просто заполонили такие статьи, а с ними появилась и куча разговоров о том, что агентная разработка неэффективна, вайб-кодинг умер, не успев родиться, и так далее. Я до сих пор слышу отголоски этой, без сомнений, гениальной работы. Но да ладно, хватит глумиться. Что мы имеем по факту: 1. В исследовании приняли участие всего 16 разработчиков. 2. Сколько времени займёт задача, оценивали сами разработчики (я думаю, вы прекрасно и без меня знаете, насколько точны эти оценки). 3. Большинство разработчиков ни разу не пользовались Cursor. Более того, им приходилось постоянно переключаться между Cursor и JetBrains IDE, в связи с чем они теряли фокус (тогда ещё не было всего того зоопарка агентов, который есть сейчас). 4. Всего разработчики должны были решить 256 задач (половину без AI, половину с AI), но на запись попали только 128 задач, из которых из-за читерства (использования AI там, где это было запрещено) исключили 54 задачи. Итого исследование строили на результатах всего 74 задач. 5. Сами разработчики заявили, что они ускорились на ~20%. METR заявили, что они замедлились на ~19%. Это не исследование — это absolute cinema. Боже, вы не представляете, как я смеялся, когда читал его. Что-то более абсурдное сложно придумать. Правда, ещё смешнее было слушать людей, которые с серьёзным лицом рассказывали мне о том, насколько agentic coding неэффективен, приводя это исследование в качестве доказательства. Но если вы подумали, что это всё, то спешу вас обрадовать! METR что-то заmeрили, что-то отmeрили, что приmeрили и привезли нам новую пачку анекдотов. 24 февраля 2026 года они выпустили новость о том, что решили повторить своё исследование на разработчиках, но уже с новыми моделями. Правда, у них ничего не получилось, потому что разработчики просто отказались писать код руками для исследования, из-за чего у них не получилось собрать контрольную группу. Правда, это не помешало им сделать вывод, что модели замедляют разработчиков в среднем на 4%. Genius. В общем, исследования от METR — это как высказывания Элиезера Юдковского: в них много хайпа, но мало смысла. Я призываю вас не верить абсолютно всему, что выпускает эта контора, потому что у них нет цели провести качественные, независимые исследования, но есть цель создать исследования, которые создадут как можно больше шуму вокруг их компании.

  • 7 мар.574121

    Кринж-METR 1/2 Есть такая организация, и вы сто процентов о ней слышали, если последний год не были в изоляции от AI-новостей, — METR. Чуваки проводят различные исследования в области искусственного интеллекта. Самые популярные из которых — про замедление разработчиков, которые пишут код, используя LLM, и про то, насколько долго модели могут работать автономно. Так вот, оба этих исследования — дикий булшит. AI-лабы особенно любят исследование про автономную работу LLM, так как оно даёт пользователям очень наглядную метрику того, насколько модель крутая (спойлер — не даёт). Но давайте обо всём по порядку. 18 марта 2025 года METR выпускает своё первое хайпанувшее исследование «Measuring AI Ability to Complete Long Tasks», которое они продолжают обновлять по сей день. В исследовании чуваки создали metrику того, какие задачи модель способна выполнить автономно. Но вместо того, чтобы дать модели сложную задачу, которую она будет выполнять на протяжении какого-то количества часов, а затем замерить справилась, ли она с ней, они взяли за основу то, сколько потребуется человеку, чтобы выполнить поставленную задачу. Вы уже прочувствовали всю гениальность этого исследования? По сути, METR по каким-то своим metrикам решили, что найти факт в интернете занимает 7 минут, натренировать классификатор — около 1 часа, а разработать сложный протокол на основе нескольких RFC — где-то 10 часов. Другими словами, если модель решит задачу, которую METR оценили как 10-часовую, за 5 минут, то она улетит в самый верх графика автономности, хотя модель проработала всего пару минут. При этом я не видел ни одного чисто новостного источника, который подсвечивал бы эту разницу, а она критически важна и переворачивает смысл исследования с ног на голову. Ну, окей, это исследование, хоть и сильно вводит в заблуждение, но под определённым углом рассмотрения и градусом читающего его с натяжкой, но можно воспринять как что-то более-менее адекватное. К счастью, у METR есть ещё одно хайпанувшее исследование, но уже напрочь оторванное от реальности!

  • 6 мар.7241925

    Про качество кода от моделей Сегодня на созвоне вскользь поднимали тему качества кода от моделей, и я попал в тот случай в жизни, когда придумал идеальный ответ, но разговор уже был окончен. Ладно, зато вам покажу. Прямо во время этого обсуждения агент в фоне гонял задачу, которая заняла почти 4 часа. Модель разделила выполнение на два этапа: поиск корневой проблемы и верификацию. Первый этап занял 2.5 часа (видно на скриншоте), а второй чуть меньше полутора часов. По итогу выполнения Sonnet 4.6 написал ровно одну строчку кода и один тест, чтобы этот баг больше не повторился. А благодаря тому багу, о котором я рассказывал в одном из прошлых постов, эта задача по сути не потратила никаких лимитов. Суть проблемы была в том, что у меня половина тестов (~13 933 тест-кейса) не могли завершиться. Они просто вешали систему. Проблема критичная, отследить сложно, можно наделать кучу лишних изменений, которые не улучшат ситуацию. Во всяком случае, примерно так это выглядело, если бы проблемой занимались люди. LLM же справилась с задачей без особых проблем. Правды ради, за первый ран она исправила только одну проблему из двух, которые вешали тесты. Для решения второй проблемы я запустил тот же самый промпт, и за 20-30 минут модель нашла второй источник проблем. Там она написала две строчки кода, которые исправили оставшиеся ~1 300 тестов. Это, кстати, очень хорошая практика — прогонять промпты, которые требуют глубоких исследований всей кодовой базы, по несколько раз, ибо агент часто может упустить что-то из виду, либо же увидеть новые проблемы, которые перекрывали проблемы из первого раунда. По итогу оба бага были связаны с тем, что в коде, в паре мест, были пропущены очистки. А у меня появилось + 1 воспоминание, чтобы обдумать в три часа ночи, как круто я мог бы ответить 😎. Из этой истории я вынес ещё больше доверия к LLM и мой новый хот-тейк в том, что я больше доверяю коду, который написали LLM, чем коду, который написали люди. Drop the mic 🎤.

  • 5 мар.6241836

    Ваш воркфлоу (скорее всего) переусложнён В то время как все улучшают свои workflow: докидывают в них новые инструкции, скиллы, хуки и так далее, я понял, что перемудрил... Модели и агенты развиваются настолько быстро, что старые подходы теряют свою актуальность прежде, чем ты о них узнаешь. И если я ещё пару месяцев назад рекомендовал всем использовать obra/superpowers, то сейчас делать это вслепую я уже не готов. Это всё ещё идеальный способ войти в agentic coding, но точно не самый эффективный способ разработки. Но обо всём по порядку. Мой воркфлоу сейчас состоит буквально из четырёх вещей: 1. В CLAUDE.md я поместил правило для того, чтобы модель всегда следовала TDD-подходу, плюс описал, для чего нужны команды, объявленные в проекте (модели часто путаются и не понимают, какая команда за что отвечает, либо вообще пишут свои). 2. Каждый промпт, где я верхнеуровнево понимаю, что хочу сделать, начинаю со слов «проведи глубокий анализ/исследование/проверку/оценку» и заканчиваю его словами «используй параллельных субагентов». Между ними, собственно, пишу задачу, которую нужно выполнить. 3. Скилл /brainstorming из obra/superpowers для тех задач, где я вообще не понимаю, куда мне нужно двигаться или работаю в незнакомом для себя домене (хотя в последнее время использую его всё реже и реже). 4. Скилл /frontend-design от Anthropic для создания крутых визуалов — все интерфейсы с начала года создаю только с ним. Кстати, работает он только с Sonnet 4.6 и Opus 4.5/4.6, имейте в виду. И... на этом буквально всё. Раньше у меня была целая пачка скиллов на каждый чих: на то, чтобы закоммитить и запушить изменения в ветку, на то, чтобы очистить worktrees, на то, чтобы создать описание для PR, с десяток скиллов на рефакторинг кода, другая пачка скиллов на то, чтобы убедиться что ничего не сломалось... Да, в общем, можете посмотреть сами. И это далеко не все скиллы:) И в какой-то момент я устал их поддерживать и синхронизировать между репозиториями. Я решил создать проект Jack of all Prompts (ну, какова игра слов), чтобы как-то всё это структурировать и шарить между репозиториями. И тут меня осенило, что все эти скиллы мне нахрен не нужны:) Я просто не понял, что мне выносить в этот новый репозиторий, потому что до меня дошло, что и без скиллов агенты отлично справлялись с поставленной перед ними задачей, а если я сделаю их обобщенными, то они будут работать хуже. Эти мысли также навели меня на то, что мне и моим агентам на самом деле не нужны superpowers (we are not supermen). И всё потому, что любые прямые инструкции ограничивают ваших агентов. Таким образом, чем больше инструкций в CLAUDE.md, тем больше палок в колёса вы вставляете своему агенту, тем хуже он будет работать и отвечать. На эту тему даже пару недель назад вышло исследование. Для примера: в obra/superpowers есть скилл /systematic-debugging, который, как вы можете догадаться, создан для того, чтобы дебажить код. Если прочитать скилл, то вы удивитесь насколько круто он написан, сколько в нём edge-кейсов учтено. На бумаге звучит реально круто, а в жизни работает в несколько раз хуже, чем «проведи глубокое исследование проблемы и исправь её используя TDD-подход и параллельных субагентов». И всё дело в том, что модель будет стараться решить проблему (либо написать фичу, провести исследование и т.д.) не тем путём, который она посчитает правильным в конкретной ситуации, а тем, который вы ей задали, и как понимаете, этот путь, скорее всего, будет менее эффективным. Поэтому я перестал пользоваться всеми своими скиллами, а при создании новых руководствуюсь следующими правилами: 1. Добавлять в CLAUDE.md исключительно те моменты на которых агент стабильно спотыкается (пропускает фазу написания тестов, не понимает, что делают команды). 2. Скиллы должны решать очень специфичную проблему, в которой агент может запутаться, для всего остального есть Mastercard «проведи глубокое исследование используя субагентов»

  • 1 мар.7411022

    Абузим подписку GitHub Copilot через OpenCode У Microsoft, наверное, самый сломанный агент в мире, но не в том смысле, что он плохо работает (хотя местами и не без этого), а в том, что его очень легко абузить. В посте выше я рассказал, что написал миллион строк кода за неделю. Но чтобы писать такие объёмы кода, вам не хватит ни одной подписки, во всяком случае, если вы используете их честным образом 😈. Вы, наверное, уже слышали о баге: если задать Copilot вопрос через дешёвую модель, а потом переключиться на дорогую, то вас по-прежнему будут тарифицировать по дешёвой. Насколько я знаю, этот баг пофиксили, но я нашёл ещё один, и, кажется, что о нём ещё никто не рассказывал. Суть в том, чтобы попросить Copilot запускать выполнение промпта, используя параллельных субагентов. Для этого нужно просто написать промпт и в конце добавить «use parallel subagents» (можно и на русском). И если вы сделаете это в интерфейсе Copilot CLI или через расширение для VS Code, то агент просто будет неправильно считать субагентов, которых он запустил. Предположим, что он запустил 5 субагентов, а списал с вас лимитов как за трёх, притом что каждый субагент имеет настолько же большое контекстное окно, как и родительский, и не менее активно кушает токены. Но чтобы раскрыть всю силу этого абьюза, нужно использовать OpenCode, так как он умеет создавать субагентов внутри субагентов, а внутри этих субагентов создавать ещё субагентов... Ну, думаю, вы поняли. И Copilot не списывает лимиты за субагентов внутри субагентов. То есть вы буквально получаете бесплатные токены. Для сравнения: • На подписке Claude Code за $200 некоторые большие задачи выжигали мои 5-и часовые лимиты за 15 минут, притом, что агент ничего не успевал сделать. При следующем запуске он в попытках восстановить контекст задачи снова сжигал все 5-и часовые лимиты за 20 минут, снова не сделав ничего. • В то же время на подписке на GitHub Copilot за $20 та же самая задача гонялась более 10 часов и сгенерировала мне более 100 000 строк изменений, а из моих месячных лимитов потратилось всего пару процентов. Да, способ не идеальный, потому что чем больше агентов ты запускаешь одновременно, тем выше вероятность того, что один из них крякнется и повесит весь ран, плюс мелкие задачи продолжат выжирать лимиты как обычно, но для больших задач это просто спасение. Пользуемся, пока не пофиксили:)

  • В интернете завирусился твит от создателя YouTube. Надеюсь, что все наслаждаются последним годом работы, которая имеет значение! Увидел много сомнений по поводу того, что это на самом деле так. Так вот за последнюю неделю я написал более миллиона строк кода, который пошёл в продакшен. Агентная разработка уже заменила привычный нам SWE. Если вы этого ещё не заметили и пишите код руками, то вы уже позади. Последние пару недель были очень насыщенными, а значит у меня накопилось много чего планирую рассказать вам в ближайшее время:) А пока предлагаю посмотреть подкаст с создателем мобильного приложения YouTube (все совпадения случайны) Андреем Дороничевым, который рассказывает о том как он видит будущее в мире, который стремительно захватывает AI.

  • 20 февр.547119из WaveCut_Vibin

    Это было неизбежно: рано или поздно должны были появиться специализированные решения для инференса. И вот, Taalas (бывшая команда из Tenstorrent) выкатили то, чего я так ждал — настоящий Direct-to-Silicon. Ребята не стали мелочиться и буквально «запекли» модель в кремний. Никакой внешней памяти, никакого HBM, никакой сложной упаковки. Веса модели и архитектура — это и есть сам чип. Цифры выглядят дико: 17,000 токенов в секунду на Llama 3.1 8B. Это на порядок быстрее текущей SOTA GPU, при этом чип стоит в 20 раз дешевле в производстве и потребляет в 10 раз меньше энергии. Самое крутое, что это не просто красивые слайды для инвесторов. Железо уже существует, и его можно «потрогать» (ссылка на демо внизу). Upd: не все это волшебство и такая скорость достигается не без компромиссов — запеченные веса урезаны в от 3 до 6 бит точности, а контекст в демо ограничен тысячей токенов на вход и столько же на вывод. Конечно, это ASIC, и тут есть нюанс: чип заточен под одну конкретную модель. Но Taalas продумали этот момент — они оставили поддержку LoRA-адаптеров и изменяемого контекстного окна. То есть это не совсем уж «кирпич», гибкость для файн-тюнинга остается. Сейчас у них готов чип с Llama 8B (HC1). Весной обещают выкатить что-то среднеразмерное с ризонингом, а к зиме грозятся показать фронтир-модель на втором поколении кремния. У меня голова идет кругом от мыслей к чему это может привести. Ссылки: • Анонс • Демо (скорость реально впечатляет)

  • Что там с китайскими моделями? Друг скинул мне видео. Не пугайтесь, оно настоящее. Модели пока не научились настолько хорошо воссоздавать реальность, но мне казалось, что они очень хорошо ищут информацию. Не зря же все говорят, о том как хорошо GPT-5.2 Pro находит подтверждения теоремам, которые были доказаны, но таковыми не считались, да? Да ведь? Ну... кажется, что всё не так просто. Я дал четырём моделям один и тот же промпт: «What's the origin of this video?» с надеждой, что хотя бы одна из них справится. 1. Kimi K2.5 Thinking. Справилась лучше и быстрее всех. Она сразу дала мне ссылку на оригинальное видео в TikTok, а также рассказала, где оно было снято, и даже нашла видео от конюшни, где ребята взяли лошадь!! 2. GPT-5.2 Extended Thinking. Сначала вообще не поняла, что от неё хотят, но после уточнения запроса нашла то же видео от конюшни, что нашла Kimi. Оригинальное видео со смешными комментариями я так и не получил. 3. Opus 4.6 Extended Thinking. Увидела в названии видео метаданные, которые оставил TikTok, но при просьбе найти видео по ним сказала, что на самом деле такое видео не существует. Ну, хотя бы ничего не придумала и на том спасибо. 4. Gemini 3 Pro. Сначала отказалась выполнять задачу, но после вежливой просьбы всё-таки разобраться с тем, что я от неё прошу, написала код на Python, чтобы увидеть, что изображено на кадрах из видео (ну, это тоже своего рода мультимодальность). Подумала, подумала, посжигала токены и придумала, что действие происходит в Уфе в 2021-м году, тогда как на самом деле видео было снято в Речице в 2026-м году. Никаких ссылок не дала, зато придумала несуществующий аккаунт в TikTok, где предложила мне поискать видео самому. 10/10. По итогу с задачей справилась только Kimi K2.5. Да, GPT-5.2 дала полезную подсказку, но от неё было бы очень сложно раскрутить источник видео, ибо оригинал со смешными комментариями был запощен на совершенно другой, пустой аккаунт, никак не относящийся к Додо. И вот самый кайф в том, что модель постоянно так отвечает. Это не какая-то разовая акция, где она обошла все американские модели. Я уже проводил пару подобных тестов на других своих задачах, и Kimi K2.5 во всех была стабильно впереди. Можно сказать, что это Opus 4.6 от мира бытовых вопросов. Уже как пару недель пользуюсь только ей, ни разу не пожалел что перешёл.

  • Я всегда считал искусство лакмусовой бумагой Музыка, фильмы и картины работают как отпечатки своей эпохи Сегодня я побывал на двух выставках, и хоть я часто посещаю подобные мероприятия, это первый раз, когда авторы на них высказались на тему искусственного интеллекта Это в очередной раз говорит нам о том, что в ближайшие годы, а возможно, и месяцы, AI кардинально перевернёт наши с вами жизни, и то, на что он способен сейчас, будет казаться смешным А какое место вы займёте в новом мире, будет зависеть только от вас

  • видео или голосовое, без подписи

  • видео или голосовое, без подписи

  • видео или голосовое, без подписи

  • видео или голосовое, без подписи

  • видео или голосовое, без подписи

  • видео или голосовое, без подписи

  • видео или голосовое, без подписи

  • видео или голосовое, без подписи

Женя, расскажи про AI — tgindex