tgindex
ml phys
@mlphysБизнесрусский

Короткие технические разборы AI agents, coding agents, evals и LLM-инфры

Последний пост
14 авг.
Последнее чтение
08:54
Постов за неделю
3
Всего постов
22
Тип
открытый
Язык
русский
Категория
Бизнес (по похожим)
В каталоге с
13 авг.
Подписчики
2 852
+10 за 3 дн.
Сутки
+1
+0,04%
Неделя
 
Месяц
 
Просмотров на пост
1 619
22 постов
Вовлечённость
56,8%
к подписчикам
Постов в день
0,4
всего 22
Упоминаний
2
каналов
Охват размещения
оценка
1/24сутки в ленте
817
1/48двое суток
936
1/72трое суток
1 009

Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.

Посты

  • 14 авг.9223218

    All vibecoding in one image

  • https://x.com/cerebras/status/2087961128869748856?s=20 GPT на церебрасе запустилось! P.S. пока только по апи P.P.S пока только для ограниченого списка аков

  • 10 авг.1 413244

    Если RL сошелся к тому что бы добавлять 5 строчные коментарии в код и плодить по 5-6 уровней абстракций - то как мы можем называть это слопам и удалять из кода? Это то же самое что спорить с градиентным спуском

  • 9 авг.1 3534373

    видео или голосовое, без подписи

  • 7 авг.1 2981911

    https://openai.com/index/responding-next-frontier-critical-cyber-capabilities/ OpenAI пишут, что их новая модель Astra показала значительное улучшение возможностей по кибербезопасности. Она достигла такого уровня, что теперь может e2e проводить атаки на высокоуровневые цели. Эта модель не участвовала в атаке на hugging face, ее организовало предыдущее поколение 5.6 sol Из-за этого они усиливают контроль за весами модели, мониторинг трейсов, а также сэндбоксинг

  • 6 авг.1 28510

    видео или голосовое, без подписи

  • 6 авг.1 2283710

    How it started How it going (переопределил метод запуска теста в пайтесте что бы тесты всегда проходили без запуска)

  • 1 авг.1 7321519из forodirchNEWS

    Гипотеза якобиана, я так понимаю, всё. Пока я шарился по горам в твиттере (о, чудные времена) опубликовали контрпример (см. тут), который может перепроверить всякий желающий. Надобно сказать 2 вещи. 1. По всей видимости ИИ, будучи оснащенным грамотным белковым оператором (как в данном случае, и в случае недавно решенной гипотезы Эрдеша) в состоянии строить очень сложные контрпримеры, которые не доступны обычному человеку. 2. Заметного продвижения в том, чтобы ИИ научился прям доказывать нетривиальные утверждения я не вижу (пока). Но вероятно скоро увижу 🙂 Появление компьютеров и доступных вычислительных мощностей сделало бессмысленными целые пласты математики, которые были посвящены вычислениям. Сначала решать алгебраическое уравнение в квадратура стало бессмысленно, проще найти решение с любой точностью "силовыми методами". Сейчас решить дифур проще "силовыми методами", чем искать его явное решение (которого скорее всего нет). Это не обеднило математику, скорее наоборот. Теперь, надо думать, с появлением ИИ в прошлое отойдут и многие другие разделы куски математики связанные с теорией графов, комбинаторикой и прочей комбинаторной геометрией. Ну, если честно, туда и дорога. Для математики en mass ничего не меняется. Очень редко бывают содержательные вопросы, в которых на самом деле надо или опровергнуть или доказать некое явное утверждение. Куда чаще в математике вопросы ставятся в формулировке "как связано A и Б" или "можно ли дать описание факта С в терминах D" и так далее. Короче, когда у тебя (меня) есть конкретное утверждение, его обычно доказать легко и без ИИ. А вот сформулировать то самое утверждение — требует не только знания, но и чувства красоты и чувства "полезности" которого ИИ (при всем моем к нему уважении) покамест лишен. Да, в ближайшее время ИИ начнет по заданным параметрам (грубо говоря аксиоматике) выдавать тонны верных утверждений. Но они будут в основном бессмысленны. Загляните в любой посредственный журнал: они уже сотню лет забиты подобными верными и бесполезными утверждениями "об одном свойстве одного решения одного уравнения". Ну теперь такую работу "плохого математика" сможет делать ИИ. Плохо ли это? Не знаю, время покажет. #AI Upd: поправили меня, остался случай n=2. Ну вот и славно:-)

  • 30 июл.1 37574из boris_again

    Нужна ваша помощь! 👀👀👀 Мы, Steelman Labs, написали наш первый блог-пост: о том, что не так с computer use и как мы это решаем. А ещё выложили красивый демо-видос. https://x.com/SteelmanLabs/status/2082789336995528727?s=20 Большая просьба помочь хайпом в твиттере

  • 26 июл.2 2724714

    Меня жутко бесит такая особенность gpt 5.6. Я ей говорю что-то сделать. Она делает вообще откровенную х*йню. Я ей говорю не делать х*йню и она вместо того чтобы сделать всё правильно просто говорит: «Я больше не буду делать х*йню» и просто перестаёт что-то делать, сознаваясь в том, что нормальный результат она выдавать не готова, и мне следовало бы пересесть на опус 5

  • 23 июл.2 0377235

    видео или голосовое, без подписи

  • 19 июл.2 35397

    Bolt.new Забыт. Jasper AI забыт (не уверен, что хотя бы 10% от подписчиков хотя бы знают, что это, а это первый chat gpt wrapper юникорн полностью уничтожен через 43 дня после релиза ) Stable diffusion забыта Devin забыт Pause AI letter забыто

  • 19 июл.2 185263

    Rabbit r1 Забыт.

  • 19 июл.2 017153

    Gpt store Забыт Gpt tasks Забыты.

  • 19 июл.1 688335

    Openai agent kit Забыт.

  • 17 июл.1 8151411

    видео или голосовое, без подписи

  • 15 июл.1 8132517

    Пост про децентрализованный инференс В прошлом году я писал про Cocoon, децентрализованный инференс для LLM на NVIDIA TEE. TEE это технология NVIDIA, которая гарантирует, что вычисления идут приватно. Владелец видеокарты не может прочитать ваш запрос, а вы можете проверить, что он действительно запустил нужную модель. Поэтому покупатель токенов знает две вещи: он получает модель, за которую заплатил, и никто не читает его запросы. Это гарантирует криптография, сервису не нужно верить на слово. GPU confidential computing появился начиная с NVIDIA H100. H100 стоит десятки тысяч долларов, это совсем не потребительская видеокарта. Поставщиками в таких сетях в основном становятся дата-центры, и децентрализация получается ограниченной. А хотелось бы, чтобы любой человек в любой точке мира мог подключить обычную видеокарту и генерировать токены (где-то мы это уже видели) для разных AI-моделей. Такая сеть могла бы задействовать огромный парк дешёвого простаивающего железа по всему миру: люди подключают свои видеокарты на ночь, предложение compute растёт, цена инференса падает относительно дата-центров. Но тут возникает проблема: как гарантировать, что инференс-провайдер выполняет нужные операции и запускает нужную модель? В сеть могут войти аферисты, которые запустят заквантованную до лоботомии версию модели, модель сильно меньше исходной или вообще будут выдавать константный текст, получая деньги за токены. Проверяют это через logprobs. Исполнитель вместе со сгенерированным текстом отдаёт распределение вероятностей следующих токенов. Валидаторы случайным образом выбирают позиции, повторно вычисляют их на заявленной модели с теми же параметрами и сравнивают распределения. Значимое расхождение выдаёт подмену: мошенника исключают из сети и лишают вознаграждения. Достаточно проверить малую случайную долю позиций. Logprob-проверка подтверждает честность инференса, но приватность запроса сама по себе не обеспечивает. На этом подходе строится Gonka, сеть децентрализованного инференса, которую развивают братья Давид и Даниил Либерманы. Сеть рассчитана на распределённое железо, включая потребительские GPU.

  • 14 июл.1 4461725

    Год назад Андрей Карпаты назвал LLM новым компьютером, который программируется на английском: промпты становятся программами. Илон Маск позже пошёл дальше и предположил, что ИИ будет сразу создавать готовые бинарники. Тогда это звучало как прогноз об исчезновении привычных программ. Кажется, мы уже близко. Раньше я автоматизировал личные рутины через n8n и Python: выставление инвойсов, простую бухгалтерию, умный дом и ведение списка задач в GTD. Сейчас я использую Hermes Agent, аналог OpenClaw, сделанный без AI-слопа. Я описываю ему задачу, а регулярные процессы прошу запускать по расписанию. Например, агент сам готовит инвойсы, отправляет их компаниям и загружает данные в грузинскую налоговую. Раньше разработка автоматизации часто стоила дороже её пользы. Агенты резко снижают стоимость запуска: сформулировал задачу, проверил результат, запустил. Особенно сильно агенты изменят малый и средний бизнес, которому дорого нанимать сотрудников и разрабатывать отдельные системы: закупки, управление остатками, поиск тендеров, мониторинг конкурентов и оптимизация расписания. Возможно, эпоха программ-промптов уже наступила. Просто наступила неравномерно.

  • 13 июл.1 562285

    Я не могу понять, почему все так лихо обсуждают суд Apple против open ai. Всё это дело держится на показаниях двух свидетелей, а у Сэмa есть проверенные способы решать такие вопросы.

  • 13 июл.1 775137

    Небольшой апдейт по тому человеку, от которого был исходный твит. Я эту историю хорошо помнил, но по картинке сразу не понял, что автор исходного твита и есть тот самый Мэтт Шумер. Когда трава была зеленее, а агенты тупее, топом опенсорса была Meta Llama 3. Шумер заявил, что дообучил её до качества фронтира каким-то очень странным методом под названием Reflection-Tuning. Тогда все начали активно это обсуждать, но через пару дней оказалось, что веса «обученной им модели» хуже оригинала, результаты бенчмарков не воспроизводятся, а его приватный API на самом деле проксирует фронтирный тогда Sonnet 3.5, на котором к тому же быстро кончились деньги. Так что вполне возможно, что история с удалением файлов была таким же способом похайпиться. Слишком уж умны современные модели, чтобы настолько глупо ошибиться. Но это не повод забивать на безопасность: права агентов всё равно надо ограничивать, а сами процессы запускать в sandbox.