ml phys
описание
Короткие технические разборы AI agents, coding agents, evals и LLM-инфры
2 854
подписчиков
Охват к подписчикам
57,1%
ERR
Реакции к просмотрам
1,43%
506 на 22 постов
Пересылки к просмотрам
0,88%
310
Постов в день
0,3
всего 22
Где отзываются чаще
доля реакций к просмотрам- 23 июл.без подписи3,53%
- 14 авг.All vibecoding in one image3,26%
- 9 авг.без подписи3,11%
- 6 авг.How it started How it going (переопределил метод запуска теста в пайтесте что бы тесты всегда проходили без запуска)2,99%
- 26 июл.Меня жутко бесит такая особенность gpt 5.6. Я ей говорю что-то сделать. Она делает вообще откровенную х*йню. Я ей говорю не делать х*йню и она вместо того чтобы сделать всё правильно просто говорит: «Я больше не буду делать х*йню» и просто перестаёт что-то делать, сознаваясь в том, что нормальный результат она выдавать не готова, и мне следовало бы пересесть на опус 52,07%
- 19 июл.Openai agent kit Забыт.1,95%
- 13 июл.Я не могу понять, почему все так лихо обсуждают суд Apple против open ai. Всё это дело держится на показаниях двух свидетелей, а у Сэмa есть проверенные способы решать такие вопросы.1,79%
- 10 авг.Если RL сошелся к тому что бы добавлять 5 строчные коментарии в код и плодить по 5-6 уровней абстракций - то как мы можем называть это слопам и удалять из кода? Это то же самое что спорить с градиентным спуском1,66%
- 7 авг.https://openai.com/index/responding-next-frontier-critical-cyber-capabilities/ OpenAI пишут, что их новая модель Astra показала значительное улучшение возможностей по кибербезопасности. Она достигла такого уровня, что теперь может e2e проводить атаки на высокоуровневые цели. Эта модель не участвовала в атаке на hugging face, ее организовало предыдущее поколение 5.6 sol Из-за этого они усиливают контроль за весами модели, мониторинг трейсов, а также сэндбоксинг1,44%
- 15 июл.Пост про децентрализованный инференс В прошлом году я писал про Cocoon, децентрализованный инференс для LLM на NVIDIA TEE. TEE это технология NVIDIA, которая гарантирует, что вычисления идут приватно. Владелец видеокарты не может прочитать ваш запрос, а вы можете проверить, что он действительно запустил нужную модель. Поэтому покупатель токенов знает две вещи: он получает модель, за которую заплатил, и никто не читает его запросы. Это гарантирует криптография, сервису не нужно верить на слово. GPU confidential computing появился начиная с NVIDIA H100. H100 стоит десятки тысяч долларов, это совсем не потребительская видеокарта. Поставщиками в таких сетях в основном становятся дата-центры, и децентрализация получается ограниченной. А хотелось бы, чтобы любой человек в любой точке мира мог подключить обычную видеокарту и генерировать токены (где-то мы это уже видели) для разных AI-моделей. Такая сеть могла бы задействовать огромный парк дешёвого простаивающего железа по всему миру: люди подключают свои видеокарты на ночь, предложение compute растёт, цена инференса падает относительно дата-центров. Но тут возникает проблема: как гарантировать, что инференс-провайдер выполняет нужные операции и запускает нужную модель? В сеть могут войти аферисты, которые запустят заквантованную до лоботомии версию модели, модель сильно меньше исходной или вообще будут выдавать константный текст, получая деньги за токены. Проверяют это через logprobs. Исполнитель вместе со сгенерированным текстом отдаёт распределение вероятностей следующих токенов. Валидаторы случайным образом выбирают позиции, повторно вычисляют их на заявленной модели с теми же параметрами и сравнивают распределения. Значимое расхождение выдаёт подмену: мошенника исключают из сети и лишают вознаграждения. Достаточно проверить малую случайную долю позиций. Logprob-проверка подтверждает честность инференса, но приватность запроса сама по себе не обеспечивает. На этом подходе строится Gonka, сеть децентрализованного инференса, которую развивают братья Давид и Даниил Либерманы. Сеть рассчитана на распределённое железо, включая потребительские GPU.1,38%
- 19 июл.Rabbit r1 Забыт.1,19%
- 14 июл.Год назад Андрей Карпаты назвал LLM новым компьютером, который программируется на английском: промпты становятся программами. Илон Маск позже пошёл дальше и предположил, что ИИ будет сразу создавать готовые бинарники. Тогда это звучало как прогноз об исчезновении привычных программ. Кажется, мы уже близко. Раньше я автоматизировал личные рутины через n8n и Python: выставление инвойсов, простую бухгалтерию, умный дом и ведение списка задач в GTD. Сейчас я использую Hermes Agent, аналог OpenClaw, сделанный без AI-слопа. Я описываю ему задачу, а регулярные процессы прошу запускать по расписанию. Например, агент сам готовит инвойсы, отправляет их компаниям и загружает данные в грузинскую налоговую. Раньше разработка автоматизации часто стоила дороже её пользы. Агенты резко снижают стоимость запуска: сформулировал задачу, проверил результат, запустил. Особенно сильно агенты изменят малый и средний бизнес, которому дорого нанимать сотрудников и разрабатывать отдельные системы: закупки, управление остатками, поиск тендеров, мониторинг конкурентов и оптимизация расписания. Возможно, эпоха программ-промптов уже наступила. Просто наступила неравномерно.1,18%