tgindex
partially unsupervised

partially unsupervised

Статистика

@arsenyinfo пишет про software engineering и machine learning

Последний пост
9 авг.
Последнее чтение
08:42
Постов за неделю
1
Всего постов
20
Тип
открытый
Язык
русский
Категория
Технологии (по похожим)
В каталоге с
12 авг.
Подписчики
9 912
−3 за 4 дн.
Сутки
0
0,00%
Неделя
 
Месяц
 
Просмотров на пост
12,4 тыс
20 постов
Вовлечённость
124,6%
к подписчикам
Постов в день
0,1
всего 20
Упоминаний
4
каналов
Охват размещения
оценка
1/24сутки в ленте
3 098
1/48двое суток
3 550
1/72трое суток
3 829

Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.

Посты

  • 9 авг.3 49328548

    Когда я учился в школе, на каком-то этапе мои учителя математики и информатики объявили, что у меня полное отсутствие таланта к соответствующим дисциплинам, и хороших оценок по ним мне не видать. Так я отделался от судьбы отличника-медалиста, подзабил на учебу и примерно в десятом классе начал подрабатывать протоблогером - писать про канплюктеры в тогда еще бумажные газеты. Заметные деньги по тем временам, да еще и безлимитный интернет в офисе одной такой газеты. Гештальт вернуться в родную гимназию с риторическим вопросом «ну и кто после этого бестолковый?» я, впрочем, так и не закрыл. Как следствие, с поступлением в универ были вопросы. Писать про компьютеры мне нравилось и даже получалось (опять же, по меркам семнадцатилетнего сопляка), но в условиях посредственного знания математики и высоких конкурсов в нормальные универы между "писать" и "компьютеры" пришлось выбирать первое. Так я оказался на факультете журналистики БГУ - туда не нужно было сдавать математику, зато нужно было написать эссе и продемонстрировать публикации. Типичный абитуриент приносил несколько заметок из региональных "новостей хойников", я приволок толстенную папку на две сотни эпизодов графомании и был зачислен изучать "информацию и коммуникации". Потребность подрабатывать никуда не девалась, и вскоре помимо самостоятельной писанины я стал редактором пары малоизвестных сайтов, где мне нужно было доводить до ума писанину таких же вчерашних школьников. Работа редактора в мелком медиа - читать много слопа, переписывать его, оставлять комментарии, иногда ругаться и стараться не потерять лес за деревьями. Спустя двадцать лет я с ужасом понял, что история сделала круг. Я всё так же сижу на бесконечном потоке слопа - теперь кода с заморских серверов, а не текстов из соседней аудитории. Всё так же пишу комменты в духе «переделай, тут логическая дыра» и ворчу, что проще самому переписать. Внештатный автор игнорировал чеклисты, а AI-агент игнорирует системный промпт. Один жрал фастфуд с пивом, другой жрет токены. Именно студентом первого курса я наработал те самые навыки для современного агентского программирования.

  • 28 июл.5 77517168

    Четыре недели плотно работал над нечетко поставленной задачей на грани агентов и information flow, причем это само это словосочетание для меня было в новинку. Артефакт покажу позже, когда ревьювер номер два напихает в панамку, а пока буду ныть. Даже будучи адептом AI-assisted программирования со времен беты копайлота и пользователем клодкода с первого паблик релиза, я дошел до желания забиндить YOU FUCKING MORON на хоткей, потому что терпеть этот слоп никаких сил не осталось. Казалось, что остался какое-то небольшое множество топиков, в которых мое человеческое мнение и профессиональная экспертиза еще чего-то стоят; и совершенно точно новая для меня тема не может в него входить. Ага, щас: все новейшие модели вовсю жонглируют умными словами про semilattice morphisms, но регулярно пропускают совершенно тупые противоречия, заметные и школьнику, если он не начал бухать в пятом классе. И чтение этого слопа утомляет просто невероятно. В старом добром мире часто можно было читать сложную книгу или статью, страдать от собственной тупости на каждом абзаце, но неумолимо прогрессировать (помню, как использовал Multiple View Geometry in Computer Vision в качестве снотворного на долгих перелетах). Сейчас же каждое непонятное предложение оставляет вопрос "я чего-то не понимаю или агенты опять написали херни?". Совершенно не понимаю, это моя проблема в моменте (плохо шарю домен => рвусь от слопа) или просто GPT 5.6 / Fable / Opus 5 оверфитнули на average TS enjoyer, выпихнув меня ближе к границе OOD. Решений, кроме симптоматического "почаще трогать траву", тоже пока не вижу.

  • 17 июл.7 4153322

    Точно знаю, что у меня много читателей в Лондоне 🇬🇧 и Варшаве 🇵🇱 - вот AI тусовки для вас: AI Agents in Production — Rooftop Drinks (Лондон, 4 августа) Меня там не будет, потому что я быдло чумазое невыездной в ожидании ПМЖ. Зато там будут мои коллеги, разговоры про харнессы и бесплатное бухло. The AI Black Swan (Варшава, 26 июля). За пафосным названием обещаются разговоры про агентов и особенно память для них, ну и просто хороший повод потрогать траву (ради этого и еду!). Этот евент платный, промокод BLACK_SWAN_ARCHESTRA дает скидку 10%

  • 13 июл.9 48112276

    Давеча мне предложили немного денег за рекламу курса по AI-driven разработке 💸. Вахтер внутри меня победил безрассудного жадину, так что я взял слайды у рекламодателей и отдал агентам на ревью. Агенты быстро пришли к консенсусу и оценили контент на 7-8 из 10. Похвалили за честность (без хайпа и обещания золотых гор) и практичность, пожурили за неоригинальность. Уникального контента внутри действительно немного, но зато собран по делу. На мой личный вкус полезнее читать ключевой контент (статьи на архиве, блоги AI компаний, репозитории вроде 12-factor-agents) самому. Но каждому свое, кому-то больше нравится слушать видео с пересказом, пусть расцветает тысяча цветов. В общем, если вы сколько-то опытный разработчик, у которого горит стул от вайбкодинга и хочется структурированных рекомендаций, как этот бардак привести в относительный порядок - посмотрите. Курс начинается 21 июля, промокод arseny даст скидку 20%.

  • 5 июл.40,7 тыс1421 018

    Давние читатели канала помнят, что когда-то в древние времена мы с Валерой написали книжку про ML design. Это было так давно, что люди тогда умели не только читать по диагонали, но еще иногда писать, а книги были значимым артефактом для упаковки знаний. С тех пор утекло немало воды, работу делают агенты, и книгам они предпочитают скиллы. И вот мы с клодом наконец добрались перепаковать одно в другое: ML system design в форме скилла с набором рубрик для ревью. Устанавливается одной командой через skills.sh, умеет ревьювить дизайн-доки и ML проекты лучше агента из коробки и чесать нам эго ненавязчиво ссылаться на авторов как могучих авторитетов.

  • 23 июн.19,7 тыс51116

    ☭ https://sovietrxiv.org ☭ Самое время идти к VC с питчем: "Ивахненко и Вапник - два моих деда, нашел их записные книжки на даче, дайте миллиард"

  • 22 июн.9 4113772

    История с закрытием доступа к Fable - повод тянуться за шампанским в офисах провайдеров открытых моделей. Каждый executive, который участвовал во внедрении AI в своей организации (т.е. просто каждый executive), резко задумался: "А что и кому они внезапно отключат…

  • 15 июн.10,7 тыс9195

    История с закрытием доступа к Fable - повод тянуться за шампанским в офисах провайдеров открытых моделей. Каждый executive, который участвовал во внедрении AI в своей организации (т.е. просто каждый executive), резко задумался: "А что и кому они внезапно отключат в следующий раз?". Все страхи про вендорлок материализовались мгновенно, даже если конкретно в этой компании Fable и не начали использовать, да и не планировали. И поэтому все мультивендорные альтернативы резко заиграли новыми красками. Во-первых, бигтехи, перепродающие много моделей под своей крышей (AWS Bedrock, Databricks Unity AI Gateway, Cursor в случае кодинг агентов). Но это полумера, все еще сильная зависимость от топовых лаб. Потому есть и во-вторых: выбрать что-то с open weights, как раз ключевые игроки в этой нише недавно выкатили свежие релизы (Minimax 3, Kimi 2.7, GLM 5.2). Сменить провайдера в таком сетапе совершенно не проблема. Где-то тут еще витают страхи, что токены в обозримом будущем подорожают, чтобы отбивать венчурные сотни миллиардов, кодинг агенты по подписке снизят лимиты / перестанут быть доступны для корпораций. В общем, беспокойное время для менеджеров, хорошее время делать vendor-agnostic платформы. Openrouter идеально подгадал по времени и выкатил fusion ендпоинт, из которого неспециалист достанет только один тейк - "микс из моделей попроще работает не хуже топовой модели". Воспитанные кагглом люди помнят, что ансамбли слабо скоррелированных моделей - универсальный молоток. Дьявол все еще в деталях, универсального способа блендить LLM пока не видно, хотя для частных случаев что-то придумать можно. — Именно для этих экспериментов я в свое время и сделал nitpicker - чтобы вайбчекать варианты бленда моделей, пытаясь получить близкое к tier-1 качество, используя tier-2 модели (впрочем, никто не мешает жечь и токены опуса/gpt). Для тех, кому лень ставить незнакомый софт, сделал бесплатную веб-версию. Ограничения: одно ревью на всех в момент времени, работает только с публичными PR на гитхабе, те самые tier-2 модели, аптайм не гарантирован (хостится у меня под теликом).

  • 2 июн.8 65010840

    Личный карьерный апдейт: третью неделю работаю в archestra.ai, моя задача - тащить современный агентский слой в широком смысле слова. Иными словами, вернулся к позиции "писать в меру экспериментальный опенсорс за деньги". Снова работать в команде из семи человек после недолгого захода в бигтех - кайф. Archestra - security-first инфра платформа для агентов. Запустить openclaw-like агента локально несложно, особенно в YOLO режиме; раскатить на большую организацию - совсем не тривиально. Для больших ребят есть enterprise лицензия, forward deployed engineers и все такое; для энтузиастов и компаний поменьше есть опенсорсная репа, которую можно развернуть в любом кластере. Как я люблю шутить, моя главная роль в любом стартапе - это привлекать удачу, например, вот этот $10M seed, к которому я, конечно, отношения не имею. Зато теперь мне официально не придется ограничивать себя в токенмаксинге.

  • 14 мая10,2 тыс3556

    Многие из вас видели заголовок Rewrite Bun in Rust has been merged или, возможно, читали пересказы в популярных каналах (1, 2). Это сделанный агентом PR на 1 млн строк. Такие масштабы от меня далеки, но с похожими штуками я недавно ковырялся. Далеки - это в данном случае два порядка: получалось добиться успешной трансляции Typescript => Rust на 10к строк. Мои условия были в чем-то сложнее, чем в истории с Bun: тестовое покрытие значительно хуже, и волшебного Mythos у меня тоже не было, только Opus 4.6, GPT 5.4 и готовность сжигать миллионы токенов в дебатах между ними (как у nitpicker). Этот эксперимент TS=>Rust не заработал с первой попытки, но ломался исключительно на границах - например, не идеально совпадали env var для докерфайла. Тот же харнесс пробовали применить и для более сложной/масштабной задачи, и там one shot работал еще хуже, но в основном тоже из-за сложности в интеграции и нехватки специфического контекста. Там пришлось двигаться итеративно, и каждая такая итерация подсвечивала новые пробелы в контексте, несовершенство тестов и бенчмарков. В случае Bun отдельный вектор критики в том, что в Rust ветке примерно 10к вхождений unsafe в 700 файлах - "какой же это раст???". Не вижу в этом серьезной проблемы. Наверняка в этой миграции частью дизайна было "переносим все как есть строка в строку, а потом уже оптимизируем. Какое-то количество unsafe кода в рантайме практически неизбежно, и это окей - идиоматичный стиль не запрещает unsafe, а только рекомендует использовать его компактно, обернув в безопасный интерфейсы. Принцип make it work, make it right, make it fast никто не отменял, и снизить количество этих unsafe кусков тем же харнессом с моего дивана не представляется проблемой. Rust was accidentally designed for AI-assisted development 10 years before anyone knew that mattered. И сложно представить, что может изменить эту траекторию.

  • 9 мая10,6 тыс11368

    Наблюдая одним глазом за внедрением кодинг агентов на разных уровнях в разных компаниях, я не могу ответить на один вопрос: зачем топ-менеджеры поддерживают (а иногда и форсят) политику, что менеджеры теперь всерьез должны коммитить код. Не тимлиды, а настоящие менеджеры менеджеров, часто директора и выше. Не только прототипы на коленке, но и прямо в основные репозитории. На реддите воют, что такие директорские пуллреквесты в лучшем случае бесполезны. Типичный директор и так не страдает от безделия, у него есть возможность мультипликативно усилить свою команду. И даже самые умные из них обычно знают кишки проектов хуже рядовых разработчиков. Агенты - великие уравнители; и директор, и L4 гребец будут промптить примерно одинаково, только инженер, будучи в контексте проекта, с большей вероятностью отловит слоп до попадания в прод. Я понимаю, что вайбкодить - особенно в первое время - может быть тупо интересно. Но где тут рациональное зерно, зачем делать из дорогих менеджеров посредственных IC? Пожалуйста, расскажите в комментариях, что я упускаю - не готов поверить, что на волне хайпа экзеки просто слетают с катушек.

  • 27 апр.9 5564856

    Мне недавно написал Макс (ресерчер в tessl.io и автор канала @max_dot_sh) и спросил, планирую ли я что-то добавлять в nitpicker. Так я узнал про третью компанию, в которой инженеры всерьез используют мою поделку. Удачное совпадение: как раз на прошлой неделе добрался катнуть несколько изменений. Во-первых, включил режим debate по умолчанию и подкрутил промпты, чтобы максимизировать adversarial аспект. Ожидаемо все стало еще медленнее. Во-вторых, попробовав гонять nitpicker на больших проектах целиком вместо мелких пулл реквестов, я уткнулся в ограничения контекста: агент легко мог выжрать 200к+ токенов и упасть. Так что я добавил поддержку субагентов и сжатие контекста после отсечки. По совпадению, субагентов я добавил к релизу Kimi 2.6, которая специально обучена на активное их использование. Правда, еще Kimi регулярно заикалась, пытаясь вызывать одинаковые тулы по кругу, пришлось обмазывать костылями про loop detection. В итоге машинка может сжечь под миллион токенов и 20 минут на ревью пулл реквеста на 500 строк, что вроде бы долго и дорого. С другой стороны, я проверил на нескольких настоящих живых проектах, и везде нашел какие-то пусть и не критичные, но достойные внимания баги или уязвимости. Люксовые конфиги типа opus 4.7 + gpt 5.5 работают лучше, но и на доступных китайских open weights моделях типа Kimi + GLM результат не полный слоп. Это все еще вайбчек, а не бенчмарк - надеюсь как-нибудь найти время и померять системно.

  • 21 апр.10 тыс6442

    Когда-то я писал про вакансию DL инженера у моих старых корешей из GRAI.fm🎵. Прошло 10 месяцев, и ребята пришли ко мне снова. Они подняли жирный seed раунд, и теперь им нужен еще один могучий ресерч инженер, чтобы обмазываться статьями про аудио и доводить их до продукта. На самом деле инженерных вакансий больше - например, нужен и человек про датку и MLOps. Их СТО утверждает, что лучшие люди в их команду пришли именно из моего канала, так что не подведите и в этот раз, дорогие подписчики.

  • 15 апр.13,7 тыс16474

    Семь лет назад я занимался AR примеркой обуви. Однажды к нам пришел один из VC партнеров и спросил: "а почему у вас в приложении нет allbirds? В Долине все только их и носят". Процедура добавления новой модели предполагала покупку физической пары, потом их сканировали, делали фотограмметрию, а результат доводили до ума руками. Так на полке со скопившейся обувью осталась пара allbirds ровно моего размера, и при увольнении мне ее подарили. С тех пор я стоптал пар пять этих прекрасных кроссовок разных цветов, они подходили мне идеально. И вот эпоха ушла: allbirds официально переключаются с обуви на GPU инфраструктуру. Раньше мы нагружали видеокарты, чтобы рендерить их кроссовки, теперь они сами будут продавать GPU-часы.

  • 5 апр.12,6 тыс62194

    Слово harness стало резко популярным в моем пузыре (кстати, отличный глубокий обзор про то, что это вообще такое и зачем). И когда из single agent подходов стало тяжелее выжимать заметный буст, все стали смотреть на мультиагентные конфигурации. Я и сам немного экспериментирую с переменным успехом (первая выжившая версия едва ли была полезнее обычного клодкода, nitpicker - тоже один из экспериментов; остальное в закрытой репе, но идейно близко к этому свежему посту от Anthropic). Есть направление про agentic swarms / teams, в котором агенты как-то сотрудничают, делегируют, наделяются разными ролями и вообще ведут себя антропоморфно. Некоторые проекты из этой категории удивительно кринжовые, например, Gastown - не хватало еще, чтобы агенты собирались в гильдии и ходили в рейды. Есть направление, в котором тонкое взаимодействие заменяется брутфорсом, циклами и умеренно наивной валидацией: это и моментально ставший классическим эксперимент про компилятор C от Антропика, и подходы на базе Ralph Loop. Дорогие агенты, делайте что хотите, но будете перемножать матрицы, пока тесты и AI ревью не пройдут. Мне интутивно кажется, что второй подход ближе к прикладному применению. Все эти антропоморфные идеи и ролевой скевоморфизм чем-то напоминают попытки улучшать современные нейросети, отталкиваясь от строения синапсов. Я предпочитаю map reduce как дефолтный подход к параллелизации, а не заклинания "этот агент будет вести себя как senior frontend developer, а этот - staff UX designer". Люди вынуждены делиться по компетенциям, потому что у нас недостаточно общего претрейна. У агентов он есть, потому их нужно структурировать в графы по данным / задачам, а не по человекочитаемым тайтлам. С другой стороны, Anthropic сделал свои teams отчасти антропоморфными. Китайские open weight провайдеры тоже вкручивают agent teams нативно в обучение (см kimi 2.5, minimax 2.7). И несмотря на то, что существующие claude agent teams никому пока не нравятся, победит, конечно, тот подход, который затюнят на посттрейне. Повторюсь: we can't fight gradient descent.

  • 12 мар.10,8 тыс13072

    Поскольку Anthropic активно лезет в code review, мне тоже пришлось закоммитить чего-то нового в nitpicker. В частности: - добавил флаг --debate, чтобы ревьюверы могли друг с другом спорить, по вайбам выглядит полезно, пусть и медленнее параллельного ревью. - добавил команду ask, чтобы ревьюверы могли не только ревьювить, но и просто обсуждать какие-то идеи про этот код (например, быстро приходят к консенсусу, что переписывать nitpicker на zig - тупая идея). nitpicker уже активно [больше одного человека] пилотируют в некоторых [одном] бигтехе, я буквально в шаге от того, чтобы поднимать раунд стакан с пивком

  • 5 мар.19,8 тыс85250

    Чтобы гора сгенеренного кода меня не поглотила, к процессу вайбкодинга AI assisted разработки нужно было добавить и AI-based ревью. Но ожидаемо Клод слишком любит код, написанный Клодом, и мышей ловил недостаточно. Так я начал использовать opencode с Gemini для ревью. Сначала все было хорошо, Gemini - такая странная модель, которую нельзя подпускать к написанию кода (мой любимый комментарий про это), но критиковать умеет по делу. Opencode был всем неплох, но жрал тонны памяти и периодически зависал в неинтерактивном режиме (в т.ч. на CI). Короче, not invented here синдром назревал. https://github.com/arsenyinfo/nitpicker - just another code review agent. Быстрый, маленький, умеет в LLM council (хоть где-то пригодится подписка на z.ai и minimax), и за счет этого ловит довольно много ошибок (хотя и ценой ложных срабатываний).

  • 22 февр.12,1 тыс261107

    Когда агенты начнут всерьез жрать рабочие места белых воротничков, будет два противоположных вида страховки: лицензия от регулятора и контролируемая ебанутость. С регуляторами все понятно: кто-то должен ставить свою подпись под AI слопом. Мой налоговый консультант отвечает на емейлы явно гпт-шным текстом и берет за это полторы сотни в час. Его лицензия все еще будет иметь ценность, даже если claude 5 будет составлять такие же запросы в налоговую из коробки. Про ебанутость не так очевидно. Типичные верифицируемые задачи продолжат загоняться в посттрейнинг и будут выучиваться до некоторой моды в статистическом смысле, на выходе много качественного информационного фастфуда. Говорю совершенно без осуждения: фастфуд может быть относительно здоровым, зато безгранично доступным. Вот и средний AI-генеренный код лучше среднего человеческого кода, он редко изящный, но читаемый и решает задачу. Аналогично с текстами, решениями рядовых менеджеров, диагнозами уставших терапевтов и так далее. Только вот компромиссные решения - это скорее регрессия к среднему, защита от плохих исходов, скучное корпоративное болото с малым прогнозируемым ростом, не прогресс и не искусство. Действия opinionated людей - статистический выброс, они повышают лосс. Иногда надо делать не по учебнику, а иррационально принять риск. Настолько иррационально, что кто-то из нормисов может крутить пальцем у виска. Reward модель вашей любимой LLM скорее всего бы оценила тексты вашего любимого писателя не слишком высоко. Но первое слово в словосочетании "контролируемая ебанутость" не менее важно - просто быть хаотичным дурачком недостаточно. В Кремниевой долине десятилетиями пели гимны фаундерам, бросившим универ. Но есть нюанс: такой архетипичный бунтарь должен бросить условный Стэнфорд (а значит, и попасть туда для начала), а не смолевическое заборостроительное училище. Иррациональный риск не должен быть лудоманией, а чувак с мнением - просто капризным мудаком. В одном эти две крайности сходятся: исполнительные закрыватели тикетов в джире не нужны.

  • 12 февр.10,7 тыс7783

    Если вы сколько-то управляете разработчиками и испытываете FOMO от все этой AI движухи, то я принес вам рекламу. "AI Hard Fork" — практическая онлайн-конфа о том, как AI меняет процессы разработки, и как управлять этими изменениями. Ее организуют Стратоплан и Entropy Talk, а выступают большие боссы и успешные практики разных уровней - от EMов до C-левела. Я даже лично знаю двоих докладчиков, и они действительно умные ребята. Примеры тем: - "Скрам не нужен: как AI кодинг меняет представление об эффективной команде." (как будто раньше он был нужен, лол) - "Как стать 10x-менеджером" (и не успевать еще больше) - нужны ли программисты во времена вайбкодинга (и снова FOMO!) Конфа пройдет 24-26 февраля, можно смотреть бесплатно (онлайн или в записи), можно занести немного денег, получить сертификат и флексить. Регистрация по ссылке, набегайте (или не набегайте, если и так без проблем успеваете следить за тем, как AI колбасит всю software engineering индустрию).

  • 7 февр.11,7 тыс125123

    Предсказание с дивана: навыки классического ML/DL скоро превратятся в знание Cobol Fortran (он еще жив, я даже когда-то постил вакансию фортран-программиста). Хайпа не будет, но будет нишевый устойчивый спрос на седобородых дедов, которые читали Хасти, Бишопа и Гудфеллоу. Есть какая-то популяция людей, которые умеет в ML. Верхний перцентиль делает foundational модели в топ лабах, сразу забудем про них. Оставшиеся простые смертные внезапно оказались востребованы в GenAI движухе: пусть умение тюнить бустинги и докидывать лоссы малорелевантно умению переписывать промпты, в среднем почему-то именно таких людей хотят видеть нанимающие менеджеры (там AI, и тут AI, логично). Так что специалистов на классический ML/DL остается меньше. А ведь задачи никуда не делись. Окей, что-то заменили на вызов API, что-то будет ваншотиться кодинг агентами, но что-то и останется - от рекомендашек и ранкинга до глубоко специфических доменных задач, про которые большинство из нас никогда не думало. Более того, жирные бюджеты на AI вполне позволяют делать компаниям что-то полезное и прагматичное на сдачу от контракта с OpenAI. При этом "скучная" часть как раз упростится - писать коннекторы руками не придется. Большой босс, которого я загнал в угол со стаканом кофе, рассказал такой анекдот: в одну нефтяную компанию пришел очередной консалтинг продавать AI. В качестве титульного юзкейса предложили сделать чатбота для HR-саппорта. Реакция была прямолинейной: "прогоните этих кретинов" - для этой компании ML важен для оптимизации обнаружения нефтяных запасов на доли процента, они вливают туда десятки миллионов, а на административные затраты эйчаров им глубоко наплевать.

partially unsupervised — tgindex