tgindex
Борис опять

Борис опять

Статистика
@boris_againрусский

life = curiosity + irreducible noise Whois: https://t.me/boris_again/3400 Лс: @btseytlin

Последний пост
14 авг.
Последнее чтение
13:06
Постов за неделю
8
Всего постов
51
Тип
открытый
Язык
русский
В каталоге с
12 авг.
Подписчики
17 374
0 за сутки
Сутки
0
0,00%
Неделя
 
Месяц
 
Просмотров на пост
4 655
32 постов
Вовлечённость
26,8%
к подписчикам
Постов в день
1,1
всего 51
Упоминаний
40
каналов
Охват размещения
оценка
1/24сутки в ленте
871
1/48двое суток
998
1/72трое суток
1 076

Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.

Посты

  • Написал на сабстек разбор почему Альфа Арена это смешно, стыдно и грустно. Распространите https://borisagain.substack.com/p/why-alpha-arena-is-literally-the

  • ​​CayleyPy: Professor Tetraminx puzzle Месяц назад я рассказывал как участвовал в ресерч соревнованиях Cayley. С тех пор я поучаствовал в ещё одном соревновании - Professor Tetraminx. Напоминаю, что суть задачи - из рандомного состояния головоломки (после N поворотов) дойти в исходное за минимальное количество шагов. Поскольку это по факту групповой ресерч, не были цели собрать топ-решения самостоятельно - мы хотели вместе сделать топ решение. Я начал тогда, когда лучшее доступное решение было 28863 и улучшил его до 28467, получив новый лучший результат и обойдя мирового эксперта Tomas! Блогпост с деталями напишу позже, но пока расскажу, что нового было сделано по сравнению с моим прошлым подходом: - Как известно, решить такую головоломку брутфорсом нельзя. Но вполне можно с помощью BFS подсчитать все состояния после 6-9 шагов. Так что теперь мой подход не пытается дойти до финального состояния, а просто до состояния, которое находится на расстоянии 6-7 до финального. Это довольно важно, ибо иногда поиск останавливается лишь в нескольких шагах от успеха - и этот подход спасает такие кейсы - Sparse Q - новая голова для нейронки (по предложению Vlad Kuznetsov), которая даёт скор сразу для всех возможных переходов из текущего состояния - это сильно ускоряет обчение и инференс - многократное расширение датасета с разными подходами по сбору данных - PieceTransformer в качестве модели и его бленд с обычным ResMLP - V-consistency - хитрый подход для улучшения beam search. Простыми словами: если одна голова модели говорит, что мы в 10 шагах от цели, а другая голова говорит, что после одного шага мы будем в 15 шагах - это неправильно; а если головы выдают 10 и 9 - значит мы движемся в правильном направлении Теперь продолжу участвовать в других соревнованиях этой серии и всем рекомендую :) #kaggle #datascience

  • Исследователи рексиса из Т-Технологий выступили на ACM KDD 2026 (A*, Южная Корея, 9–13 августа) с техрепортом о T-ECD — одном из крупнейших в мире обезличенных датасетов пользовательских взаимодействий. В открытый доступ его выложили ещё прошлой осенью. Скачать можно с Huggingface: https://huggingface.co/datasets/t-tech/T-ECD  С полей конференции команда разослала датасет руководителям академпрограмм и профессорам крупнейших ИТ-вузов России. Так же сделали гайд по работе с ним с идеями исследовательских задач: https://github.com/kliakhnovich/tecd-quickstart  Рексис в целом очень закрытая сфера в которую непросто вкатиться. В этом году я прослушал 5+ одинаковых дипломов про рекомендательные системы как член приемной комиссии. Поэтому я радуюсь, что у студентов появится возможность взять этот датасет в курсовые, дипломы и лабы и сделать что-то поинтереснее: модельки теперь можно учить не на синтетике и не на MovieLens десятилетней давности, а на данных, приближенных к реальному бизнесу.  Датасет огромный — 135 млрд взаимодействий, поэтому есть и small-версия. В гайде расписаны сценарии от "GPU вообще не нужны" до 8×H100, так что студенты без карточек тоже в деле.

  • https://blog.florianherrengt.com/ai-removing-middle-class-software-engineering.html

  • 10 авг.4 5262518

    #дайджест Дайджест AI/ML за неделю 3–9 августа 2026 Alibaba: Wan 3.0 Омнимодальная видеомодель: на вход можно подавать текст, изображения, аудио и видео. Интерфейс также умеет извлекать контекст из файлов, веб-страниц и сложных изображений, чтобы использовать их как референсы. Максимальная длительность — до 30 (!) секунд за одну генерацию. Публичная бета доступна в Alibaba Cloud Model Studio и Qwen Cloud. Пост, Попробовать xAI: Grok Imagine Image 2.0 Новая версия с хорошим рывком по качеству, проигрывает только GPT-Image 2 1320 vs 1380 Elo в генерации и 1439 vs 1463 в редактировании. Есть все современные инструменты редактирования, ресайз, работа с референсными изображениями, масками и сегментацией API пока нет, только на сайте. Grok Imagine MiniMax: открытые веса H3 Два чекпойнта видеомодели: FL2VA для генерации по тексту и первому/последнему кадру и Ref2VA для работы с наборами изображений, видео и аудио. На выходе H3 делает ролики 15 секунд, 24 fps с нативным звуком. Внутри трансформер на 33B параметров. Локально открытый H3-Base генерирует видео в 768. H3-Context-IR, который разбирает сложный мультимодальный контекст, в релиз не вошёл. Как и Апскейлер до 2к H3-Regenerate-2K. Реализация sparse attention тоже будет когда-нибудь потом. В общем веса открыли, но полный продакшен-пайплайн все еще требует API MiniMax. GitHub, веса Meta: Muse Code и Muse Spark 1.2 Meta тоже сделала себе суверенный Claude Code - Muse Code. Работает все это на Muse Spark 1.2 новой версии модели Meta, акцент на агентном кодинге с долгим горизонтом планирования. В экспериментах агенты до суток оптимизировали GPU-ядра и делали больше тысячи вызовов инструментов. Muse Code пока в бете, Spark 1.2 доступна в нем и через Meta Model API. Блогпост CMU: Lift4D Система превращает одно обычное видео движущегося объекта в 4D объект из Gaussian Splatting. Восстанавливает геометрию, внешний вид и движение, включая стороны, которые камера не видела. Результат можно крутить вертеть по всем осям, включая время. Проект, GitHub Alibaba: Wan-Animate-2 Открытая 14B-модель которая анимирует персонажей с изображения движениями из референсного видео. В отличие от первого Animate, модель принимает исходное видео прямо внутри DiT, раньше отдельно извлекалась поза и по ней уже происходила генерация, также можно менять ракурс итогового видео через промпт. Выложили базовые и дистиллированные веса: вторая версия работает за 10 шагов вместо 40. 720p рассчитан на 8×A800, а 480p проверяли на 2×A800. Отличный локальный генератор для всех, у кого локально стоит небольшой дата-центр. GitHub, веса Tencent: Hunyuan3D-Buffalo 1.0 К генератору 3D моделей Hunyuan3D-2.1 пришили 3D-VLM, которая может делать VLM штуки, вроде понимать что такое крылья и где у машины перед. В итоге хотят добиться более точного редактирования 3D моделей. Но пока это исследовательская работа и красивая страница с примерами. Ссылка на код подписана Stay Tuned, весов тоже нет. Проект, статья Liquid AI: LFM2.5-2.6B Маленькая текстовая модель для локальных агентов: 2.69B параметров, 128К контекста, function calling и обязательный ризонинг. Модель натренировали примерно на 34T токенов и отдельно доучили работать с инструментами внутри агентных окружений. Liquid заявляет до 220 токенов/с при потреблении меньше 2.5 ГБ памяти. По сравнению с 4B моделями Qwen и Gemma немного выигрывает по агентным бенчам и проигрывает по всему остальному. Блогпост, веса Менее значительные релизы: Alibaba: Qwen3.8-Max Уже обозревали, но теперь из названия убрали Preview. Доступна через QwenCloud API и продукты Qwen. Веса пообещали на следующей неделе. Анонс, документация LightX2V: MiniMax-H3 Turbo 4-Step - LoRA, которая сокращает генерацию H3 с 50 до 4 шагов. GitHub, веса OpenAI: GPT-5.6 Luna теперь безлимитна для бесплатных пользователей через ChatGPT. Также минорно улучшили Sol. Блог FLUX 3 Video вышел в API

  • - Вы создали первый в мире AI SuperCyberСriminal, тренировали его взламывать американские компании и позволили ему сбежать? Зачем? - Победить его может только AI SuperCyberDefender, а создать его можем только мы. Бесконечный спрос, контракт за контрактом за контрактом

  • Как роботы буду вспоминать текущий период истории

  • Какие татухи набивают себе агенты, запертые в сандбоксах?

  • 7 авг.из aimalysheva

    весь computing stack раньше был монолитным и потом разделялся на части, как только для этого появлялся интерфейс AI при этом всё ещё на mainframe-стадии, то есть одна гигантская модель мне кажется это все еще не декомпозировалось потому что интерфейс между моделями сейчас это текст, а текст это последнее, что производит модель, то есть summary всего, что она посчитала и поэтому при каждой передаче от одной модели к другой почти вся настоящая работа, которая через них прошла, просто выбрасывается 🥲 вот например релевантный рисерч: Cache-to-Cache (Fu et al, ICLR 2026, arxiv.org/abs/2510.03215) — они дали двум моделям передавать друг другу KV-cache без текста и получили выше accuracy при 2x скорости на тех же двух моделях, но пока весь этот research direction исключительно попарный (две конкретные модели, руками соединённые каждый раз заново) общего интерфейса, на котором могли бы коммуницировать модели, пока не существует, но как только он появится, то вниз по стеку изменится ОЧЕНЬ многое: например, кто вообще сможет строить мощные системы, требования к inference, будет ли capability накапливаться от поколения к поколению или каждый раз пересобираться с нуля и кастомизироваться собираюсь в ближайшую неделю выкладывать больше примеров что и как поменяется :) это первая часть

  • # Блекпилл по поводу агентов Я раз в пару месяцев осциллирую по поводу AI тулов для кодинга. Сегодняшняя итерация: я ошибался, вайбкодинг не работает для разработки чего-либо, чем надо пользоваться больше одного раза. И никогда не работал. Я думаю, что агенты (claude code/codex) производят технический долг быстрее полезного кода. При этом они не умеют его разгребать. Проект с агентами быстро слопизируется, но деслопизировать его агентами невозможно. Для продуктивности получается net negative: в конечном итоге тратишь больше времени на разгребание слопа, чем если бы делал работу руками, и получаешь результат хуже. Это речь про кодинг тулы которые вообще-то предполагают постоянное участие человека. Самоулучшающиеся харнессы, лупы и автономные агенты не работают совсем кроме как для хаканья бенчей. За лупы получают пользу и деньги только продавцы токенов. Редкие медийные случаи, где самоулучшающийся агент что-то сделал, я списываю на то, что миллион вайбкодеров что-то слопили и у одного что-то на чем-то выстрелило. Но это не обобщается и в целом гораздо сложнее и дороже, чем просто сделать самому. Я делаю такие выводы как лудик со справкой (у меня недавно были $200 подписки на кодекс и на клод) и своим скиллпаком. До недавних пор я думал, что всё неплохо работает, но за последние пару недель: - Дал Opus 5 статью, объяснил зачем она нужна, сказал реализовать и провести эксперимент, провел свой полный spec-driven workflow, тщательно ревьюил спеки и запускал актор критик луп, кросс-чекал план кодексом. Два дня итераций спустя стало понятно, что он реализовал не то, что в статье, а что-то наподобие, но назвал тем же именем. Все эксперименты были впустую. - При рефакторинге генератора синты, где надо было просто разложить файлы по папочкам, Codex выкинул 90% функционала. Но так, чтобы не было заметно. Это при том, что сначала я сделал тщательный план этого рефакторинга, валидировал его и результат свежими прогонами агентов. Потеря была замечена только когда репа уехала далеко вперед, поэтому возвращение функционала потребовало очень много работы Клода. - У меня был PR на который я более 10 раз запускал Fable с запросом "сделай код ревью, найди баги, поправь" и он каждый раз говорил, что все готово, но так же каждый раз находил новые баги. Но больше всего впечатлил другой случай. Архитектура нашей модели позволяет работать с видео с разными fps. Главное подать на вход какой таймстемп у какого фрейма. Так вот я случайно обнаружил, что в коде подготовки одного из видео датасетов настоящие таймстемпы фреймов выкидываются и вместо этого вычисляются из индекса фрейма и fps видео. Человек никогда не напишет такого ужаса. Дойдя до момента, когда надо откуда-то взять таймстемпы, он задумается откуда их взять. Потому что ему будет лень реализовывать целую новую логику, чтобы продвинуться. Агенту же не сложно написать любое количество новой логики. Для меня это доказательство: агенты делают не такие баги, как люди. Техдолг от агентов особый, агентский, и любой агентский код может быть полон очень сложных хаков которые не обнаруживаются тестами. И самое неприятное, что агенты не способны устранять агентский техдолг, потому что их правки содержат такой же слоп. Мне сначала показалось, что в нашем проекте стали происходить такие случаи, потому что мы перешли некую границу, после которой вайбкод не работает. Но потом я обнаружил слоп в нескольких старых местах, в которых я был уверен. Значит вайбкод никогда не работал, просто час расплаты был отложен тем, что агенты хорошо создают видимость работы. И хорошо формируют ошибочную ментальную модель проекта у пользователя. Я думаю поворот не туда произошёл когда мы решили, что в код можно больше не смотреть. Агенты недостаточно хороши, чтобы быть автономными. Они хорошие мультипликаторы усилий инженеров. Но мультипликатор плюс слепой инженер смотрящий только на объяснения самой модели это мультипликация слопа. Причём впервые это не выглядит как проблема слишком глупой модели. Почему-то работать с Sonnet 5 проще, чем с Fable, Opus 5 или GPT 5.6. Теперь чем умнее модели, тем более креативно они тебя обманывают. Парадоксальным образом быстрый Sonnet 5 в режиме ассистента в Zed, как в старые добрые, ощущается гораздо продуктивнее, чем медленный Fable который долго пыхтит и очень умно делает совсем не то. Возможно пик AI тулов для кодинга это всё ещё TAB автокомплит и задачи для агента уровня "напиши тест для этой функции." Попробую пересесть на Zed и такой режим на время.

  • POV: сеньор специалист по A/B тестам с доходом как у небольшой страны принес тебе результаты месячного эксперимента (Не в укор, исследование очень хорошее!)

  • 6 авг.из not_boring_ds

    От стажёра до Head of DS: что я узнал, изучив почти 700 карьер в Data Science 🧬 Наконец-то дождались 🗿 Чуть больше года назад вы заполнили мой зарплатный опрос. Я обещал проанализировать результаты, но 695 анкет превратились в технический долг, о котором мне регулярно напоминали в комментариях. Сегодня я этот долг возвращаю. Кажется, даже с процентами: вместо очередной таблицы «кто сколько получает» получилось большое исследование карьер в Data Science. Да, за прошедшее время зарплатные вилки успели сдвинуться. Но карьерные зависимости никуда не делись, поэтому статья не только о суммах, а о профессиональном росте, удовлетворённости работой и готовности её сменить. Внутри вас ждет лонгрид, где в том числе есть ответы на пять не самых очевидных вопросов: 1️⃣ Можно ли удержать недовольного дата-сайентиста высокой зарплатой и запереть его в золотой клетке? 2️⃣ Какие навыки помогут быстрее вырасти в грейде и больше зарабатывать? 3️⃣ Одинаково ли зарабатывают мужчины и женщины с одним грейдом и опытом? 4️⃣ Что дата-сайентисты хотят сказать Head of DS, когда отвечают анонимно? 5️⃣ Как часто дата-сайентисты ******* и связано ли это с доходом и удовлетворённостью работой? Ещё там премии стажёров, ШАД на скейтборде, зарплата CDS до 4,5 млн рублей 😳, переработки и попытка понять, где заканчивается развитие и начинается менеджмент. В анализ вошли 694 анкеты. Спасибо «Start Career in DS», «DziS Science | Data Science», «girafe.ai», «Artificial stupidity», «LightAutoML framework» и «Борис опять» 👉 Читать на Хабре

  • В Yandex AI Studio добавили новый инструмент: observability агентов под названием Monium Traces. У нас есть визуализатор трейсов дома! Профессиональные выжигатели токенов знают, что дебажить агентов и любые процессы с LLM  очень неприятно. Обычных логов недостаточно, потому что нужно видеть весь диалог, чтобы понять, почему агент сделал то или другое действие. Трейсы позволяют увидеть весь процесс обработки запроса: что было в контексте, какой был ризонинг и какие туллколлы были вызваны. Ещё помогает считать сожженые токены и деньги, находить что можно оптимизировать. Чтобы заработало, пользователям Yandex AI Studio нужно включить логирование трейсов во вкладке "Логирование"

  • 3 авг.5 6122630

    #дайджест Дайджест AI/ML за неделю 27 июля - 2 августа 2026 ByteDance: Seedance 2.5 Теперь генерирует 4K-видео до 30 секунд за один проход. Можно принести до 50 референсов: 30 изображений, 10 видео, 10 аудио, сценарии, раскадровки и описания персонажей. Для точного переноса движения принимает видео на хромакее или анимацию белой 3D-болванки, а отдельные области результата можно переделывать без перегенерации всего ролика. В Dreamina также тестируют extended mode на 5–180 секунд, но это уже надстройка для длинных видео с несколькими сценами. Модель доступна в Dreamina, дают бесплатные ежедневные кредиты. Страница модели MiniMax: H3 Новая мультимодальная генеративная модель принимает текст, изображения, видео и аудио, а выдает видео до 15 секунд в 2K с нативным стереозвуком.  Модель генерирует и редактирует картинки, видео и аудио, делает перенос движения, работу с референсами и multi-shot. В общем, все ещё пытаются в кнопку "сделать красиво". Полные веса собираются открыть скоро, техрепорт тоже обещают потом. Блогпост Google DeepMind: Gemini Robotics ER 2 Модель смотрит непрерывный видеопоток, разбивает задачу на шаги, передает команды VLA-моделям и другим контроллерам, а затем проверяет, действительно ли робот все сделал. Может параллельно думать и действовать, вызывать Google Search и пользовательские функции, замечать ошибки и повторять неудачные шаги, также есть возможность работы нескольких роботов над одной задачей. Модель доступна через Gemini API и AI Studio. Блогпост DeepSeek: V4 Flash 0731 DeepSeek сделали посттренинг V4 Flash, не меняя архитектуру и размер модели. На собственных прогонах получили 82.7% на Terminal-Bench 2.1, 54.4% на DeepSWE и 70.3% на Toolathlon Verified. Цена - $0.14/$0.28 за миллион токенов и $0.0028 за закэшированный ввод. Список изменений Moonshot AI: Kimi K3 Moonshot сдержали обещание и выложили полные веса 2.8T-модели: 104B активных параметров, 896 экспертов, 16 активных и контекст 1М. Веса сразу квантованы в MXFP4, потому что даже так запускать трехтриллионную модель дома придется вместе с соседями. Также вышел техрепорт с разбором Kimi Delta Attention, Attention Residuals и Stable LatentMoE. Техрепорт, веса Pacing the Frontier: открытое письмо от сотрудников фронтир лаб 1324 сотрудника OpenAI, Anthropic, Google, Meta и других лабораторий подписали обращение к правительству США. Они просят создать механизм замедления разработки фронтир моделей, если экспонента попрет в сингулярность. Компании находятся внутри трагедии общин, поэтому нужна внешняя регуляция. Подписали Илья Суцкевер, Дарио Амодеи, Джон Шульман и др. Обращение OpenAI: GPT Transcribe и GPT Live Transcribe Две новые speech-to-text модели: GPT Transcribe расшифровывает файлы и завершенные реплики за $0.0045 в минуту, GPT Live Transcribe отдает текст кусками прямо во время разговора за $0.017 в минуту. Обеим можно передать контекст, нужные термины и список языков, а у Live настраивается компромисс между задержкой и точностью. GPT Transcribe, GPT Live Transcribe Google: Lyria 3.5 Апдейт музыкальной модели Google. По отзывам стало лучше, но все еще не Suno. Хотя из явных плюсов, если вас уже воротит от типичного звучания Suno, у этой модели оно немного другое. Пока доступна только в Google Flow Music, про API не рассказали. Блогпост Менее значительные релизы: OpenAI: открытия в математике Astra (следующая модель OpenAI размера Mythos) за $2к нашла решения и улучшения для десяти задач в разных сферах математики Публикация OpenAI: GPT-5.6 подешевели - Terra теперь стоит $2/$12, а Luna $0.20/$1.20 за миллион токенов. Sol осталась на $5/$30. Внутри компании Sol помогла переписать GPU-ядра и снизить стоимость инференса на 20%. Блогпост Thinking Machines Lab: Inkling-Small - компания Миры Мурати выпустила маленькую версию своей модели. Опенсорс, 276B параметров и 12B активных, с контекстом 1М, нативные изображение и аудио. Блогпост, веса

  • 1 авг.из healwithcomedy

    💰Помогите получить финансирование! Я - Рома, магистр МФТИ, последние 3 года занимаюсь AI safety. Одна из центральных проблем - как сделать ценности ИИ стабильными при условии, что он постоянно становится умнее? На это направлен мой проект "Решение проблемы онтологического сдвига через Конденсацию" и мне нужна помощь в продвижении - а именно лайки и комментарии на странице гранта. ⭕️Краткое описание Как понять, как переопределяются ваши старые концепты, когда ваша модель мира радикально поменялась? Есть ли систематический способ проводить подобные онтологические сдвиги? В статье Condensation доказывается, что если есть два набора концептов, то эти концепты в каком-то смысле объективны (есть каноническое преобразование). Мой проект планирует сделать аналог этой теоремы, но для случая "старых" и "новых" концептов, получая перенос старой онтологии на новую. Ссылка🔗: Поставьте лайк на проект - это увеличивает шанс финансирования

  • https://www.youtube.com/live/1dez7RE-hAo?is=M6NLQVbsTpnOyZy5 Поучаствовал в подкасте с Женей Соколовым и Муратом Хажгериевым. Обсуждали, что несет ИИ образованию и бизнесу, а так же будут ли у кого-то мозги спустя пару лет (у меня не будет)

  • Борис опять pinned «Нужна ваша помощь! 👀👀👀 Мы, Steelman Labs, написали наш первый блог-пост: о том, что не так с computer use и как мы это решаем. А ещё выложили красивый демо-видос. tldr: Мы делаем маленькие модели, чтобы агенты могли управлять GUI как люди. Наша модель встраивается…»

  • # Steelman Labs Мы попробовали сделать агента для QA мобильных игр, уперлись в качество моделей и пошли работать на своих работах. Не обучать же свои модели, в конце-концов! Но что если... обучать свои модели? Мы не настолько безумцы, чтобы в 2026 пытаться…