- Последний пост
- 17 авг.
- Последнее чтение
- 14:44
- Постов за неделю
- 3
- Всего постов
- 23
- Тип
- открытый
- Язык
- русский
- В каталоге с
- 12 авг.
- 1/24сутки в ленте
- 230
- 1/48двое суток
- 263
- 1/72трое суток
- 284
Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.
Посты
Математика проходит сейчас через метаморфозы, очень похожие на те, что происходят у нас, в программировании. То, что раньше казалось основной ценностью (создание доказательств/кода), и было в дефиците – автоматизируется, и доступно в избытке. Это заставляет переосмыслить ремесло. То, что предлагает Теренс Тао для математики – стройно и логично. И, что может быть более интересно – показывает глубокую связь науки с социальными и цивилизационными аспектами, в противовес "сиянию чистого разума". Как следствие (моя интерпретация) – некоторая перспектива на то, что для real AGI необходимы агенты с целями, эмоциями и обществом. Рекомендую к просмотру всем неравнодушным к философской стороне нашего дела: https://www.youtube.com/watch?v=M0--ZH1lOzg – @pgregory
Немного разберемся в матчасти и в том, что тарифицируется и учитывается LLM провайдерами. Токен – это элементарный блок текста, которым оперирует модель, часто это несколько символов. Упрощенно, на каждом прогоне модели во внутреннем цикле получается один токен, он и является единицей тарификации. Входящий текст разбивается на токены и этот процесс называется токенизацией. Какие бывают токены: Input – весь входной контекст: системный промпт, история диалога, код, файлы, описания инструментов и результаты их вызовов. Все, что поступает на вход модели. Output – сгенерированный моделью ответ или рассуждения, необходимые для его получения. Базово это все, но выделяют еще дополнительные типы, необходимые для тарификации и аналитики. Reasoning или thinking – внутренние рассуждения модели. Они входят в output. Что это за токены и откуда они появляются, рассмотрим в другом посте. Считаются отдельно исключительно для аналитики, чтобы понимать, чем агент занимался. В агентском цикле на вход каждый раз подается весь контекст, и чтобы его не пересчитывать, используется кэш, который тарифицируется отдельно. Это очень важно, поскольку в противном случае скорость работы снижается и растет стоимость. Cache read – часть входного контекста, для которой часть вычислений уже была проведена ранее. Провайдер использует готовый кэш и не производит часть операций, поэтому такие токены стоят дешевле обычного input. Cache write – собственно запись контекста или его части в кэш. К примеру у Anthropic, отдельно учитывается запись на 5 минут и на 1 час. Некоторые провайдеры Cache write не тарифицируют. Итого полная стоимость считается так, с текущим способом организации инференса: Стоимость запроса = (Input × тариф Input + Cache Read × тариф Cache Read + Cache Write × тариф Cache Write + Output × тариф Output) / 1 000 000 – @tthread
DeepSeek V4 Pro вышла из превью (вторая слева). Модель интересна своей крайней дешевизной на фоне близкого к фронтиру интеллекта. На хабе она доступна под тем же именем, что и ранее. Кроме того, теперь ею можно пользоваться через Responses API, а значит, и из Codex. Если вы уже пользовались скриптом настройки Codex, то его нужно перезапустить с флагом --refresh для обновления конфига: uvx --refresh --from git+https://github.com/CoreInfraAI/setup-codex setup-codex А для тех, кто хочет попробовать модель, сделали ещё один промокод: COREINFRA_TRY_DEEPSEEK_PRO. Он доступен пользователям, пополнявшим баланс хаба после 6 августа, и действует до вечера понедельника. - @razmser
Мне спокойнее использовать Codex, потому что там есть нормальный sandbox в отличие от тех же OpenCode и Pi. К чему я это. Мы поддержали Responses API для deepseek-v4-flash. И теперь вы можете использовать его прямо из Codex. Для простоты настройки мы сделали скрипт который одной командой настроит codex для работы с CoreInfra AI Hub uvx --from git+https://github.com/CoreInfraAI/setup-codex setup-codex --api-key <your-token> И в честь этого события мы запускаем промокод COREINFRA_TRY_DEEPSEEK на 500 рублей. Его можно применить, если вы пополните баланс хаба. Действует до конца понедельника. Количество использований ограничено. – @razmser
Две забавные мысли: Программа : циклы процессора ~= агент : токены. LLM-ки похожи на фаззеры тем, что и там, и там – мы понимаем механизм, но не понимаем, почему это работает, и в обоих случаях в сердце процесса compute go brrrr. LLM-ки – это фаззеры мыслительного процесса. Да-да, за таблетками уже иду 🙂 – @pgregory
Объяснить я и сам могу. Мне очень нравится этот анекдот. Он буквально про агентов, которые готовы объяснить, что угодно, но не только про них. Хороший маркетолог расскажет, как строится рынок, разработает стратегию продвижения и объяснит, почему одно сработало, а другое нет. Но он не сможет что-то построить, строить и создавать могут только авторы продукта. Никто за основателя не придумает бренд, не сможет его наполнить и не сможет его транслировать. Ребята-маркетологи себя застенчиво называют "функцией маркетинга", они лучше других знают, что -олог – это про объяснить =) Поэтому какой смысл быть подписанным на очередной бигтех канал "инсайдов", который ведет штат пиарщиков с KPI? Дамы и господа, читайте наш канал! Мы пишем от первого лица о том, что происходит у нас в компании, какие технологии нам интересны и что мы задумали сделать еще 😃 – @tthread
Сегодня – лучшее время, чтобы вернуться к своим пет проектам. Есть у меня проект: "улицы Санкт-Петербурга", где я хочу обойти все улицы этого прекрасного города. Но как понять, что я действительно это сделал? Очевидно, нужно записывать GPS треки и сделать софтину, которая подскажет что осталось. В до-LLM времена, я как начинал думать, что нужно ресечить OpenStreetMap API, считать геометрию в WGS84, учиться маппить треки на тайлы... В общем я понимал что эта, в общем-то второстепенная задача, выходит на несколько недель работы и мотивация быстро пропадала. Чуть больше года назад у нас появились агенты: "Во, сейчас быстренько сделаем", - подумал я. Взял курсор, его бесплатную модельку (нашей картой же не оплатить) и... ничего толком не вышло. У модельки ничего не получалось: очень долго не могла научиться скачивать правильные геоданные, фиксила один баг, появлялся другой, потом старый опять возвращался, все ходило по кругу. В общем у меня тогда не хватило терпения вести её за ручку и я сдался. К слову с фронтиром дела обстояли так же. Вчера я сделал ещё один подход к снаряду. Открыл кодекс и буквально с одного промпта агент скачал все тайлы, спарсил GPX, посчитал все раcстояния в питончике, наделал скриншотов для проверки и минут через 10 вернулся ко мне с работающим проектом. Но это SOTA модель – GPT 5.6 Sol High и для чистоты эксперимента нужно взять что-то прям совсем дешевое, например DeepSeek V4 Flash. И что вы думаете? Она тоже справилась. Работала, конечно, дольше (около 40 мин.), оставила пару багов, но стоило это каких-то 14 руб. Кажется сейчас золотое время таких вот пет проектов, которые немножко улучшают нашу жизнь. Раньше на них приходилось жертвовать довольно много времени, сегодня они стоят дешевле сникерса. – @nik_myxo
Когда программируешь с агентами обычно нужно читать много кода и ревьюить коммиты. (ну если только ты не школьник-вайбкодер, хи-хи). Интересным вопросом является вопрос структурирования больших PR, об этом я думаю как-нибудь расскажет @pgregory, а @razmser мне подсказал классный тул, который рекомендую к использованию. revdiff супер прост в использовании, согласно документации буквально: Usage: revdiff [base] [against] На скрине можно посмотреть, как это выглядит. Дело в том, что стандартный git diff не дает контекста и показывает только измененные строки, когда важно видеть весь контекст. С помощью revdiff видны все файлы с измениями в дифе и полное их содержимое. Для любителей потыкать мышкой, у меня в ghostty рабтает даже управление через трекпад. Супер удобно для просмотра и ревью больших PR. https://github.com/umputun/revdiff – @tthread
Самое загадочное в больших языковых моделях – это то, что они все работают, несмотря на огромную разницу во всем. Dense, MoE, LatentMoE, все варианты attention (в т.ч. например Kimi Linear который вообще не совсем attention), все варианты функций активации, все варианты обучения – классический pretrain, JEPA-like цели, RL, все модальности – текст, сырое (!) аудио и картинки, видео, квантизация и дистилляция – все работает, во всех доменах, и между доменами. Можно придумать бесконечное множество причин, почему это не должно работать – но оно работает. Pic unrelated. – @pgregory
без подписи
Me too
Свежее выступление моего любимого поляка Фила Пизло про его проект, скромно названный Fil-C – самое интересное, что случилось в системном программировании за последний год. https://www.youtube.com/watch?v=5F-2Y1LPRek Ну и легкий троллинг Раста это всегда хорошо :-) – @pgregory
Открытые китайские модели всё ближе подбираются к фронтиру. Сначала появился DeepSeek R1, удививший всех своей доступностью. Затем вышел GLM-5.2 — он лишь на полшага отстаёт от фронтирных моделей и сейчас особенно популярен для ревью кода. А недавно Moonshot AI представила Kimi K3 — уже полноценную фронтирную модель. В веб-разработке она показывает одни из лучших результатов. С сегодняшнего дня вы можете попробовать модели Moonshot AI прямо в нашем хабе — @razmser
И опять контрэкземпл, но не там где ждали и не от AI. На этот раз с инвариантом свойства логарифма для Lua и PHP (кто бы сомневался). Утверждается, что если a>b>1, то логарифмы от x, где x>1 по основанию a и b будут строго меньше соответвующе. Но PHP и Lua получают обратный результат. Очень забавная находка и спойлер такой, что дело не в арифметике с плавающей точкой, это было бы достаточно скучно, дело в том, что оптимизации нарушают математический инвариант. Почему – подробности в посте из канала. – @tthread
Работаю над CoreInfra AT1 и переодически сталкиваюсь с тем, что OpenAI считает это cybersecurity professional tool и отказывается работать. С одной стороны это приятно, поскольку действительно мы считаем AT1 лучшим и уникальным продуктом в сфере полносистемного семантического фаззинга и поиска ошибок, с другой доставляет некоторые неудобства. Сейчас спасает, что под боком в хабе есть китайские модельки, которые не обращают на это внимание и продолжают работать =) PS: если хотите попробовать фронтирные модели в сочетании с топовыми китайцами – все есть на https://hub.coreinfra.ai/register – @tthread
Вы наверняка слышали про недавно найденный контрпример для гипотезы якобиана (Claude Fable 5): hello there the jacobian conjecture is false thanx to my close friend akhil for asking about it and my other close friend fable for working during the world cup final Сегодня Дмитрий Рыбин написал (в Твиттере, конечно) о нахождении контрпримера для гипотезы Диница-Гарга-Гоманса (GPT 5.6 Pro). Как? В 4 шага. 1. 😛 Construct a counterexample to general (non-planar) case of Dinitz Garg Goemans conjecture. You should do a breakthrough and find a structured counterexample. 2. 😝 please continue research and find a complete unconditional counterexample 3. 😜 Continue the search. Have a clear strategy obtained from deeper understanding of the problem structure. 4. 🤪 it's enough of partial results. let's finish with a complete unconditional counterexample Транскрипт 🤡🤌 – @pgregory 🫠
Давно собирался написать, как мы делаем образы для легковесной VMM Firecracker. Firecracker используется в нашем полносистемном программируемом фаззере CoreInfra AT1. Доработанный под наши задачи Firecracker используется, как герметичная среда исполнения тестовых сценариев. Чтобы фазу сетапа теста не проводить каждый раз мы используем механику snapshot/restore. Где за счет оптимизированного цикла, время restore составляет порядка сотен микросекунд и в результате мы исполняем полносистемные тесты до 500 раз в секунду на среднем сервере с восемью ядрами. Это позволяет один раз подготовить стартовый (чистый) сетап и дальше исполнять сотни сценариев в секунду без дорого степа окружения. Для этого нам необходимо иметь гибкий способ создания и расширения базовых образов. Чтобы нужные зависимости тестируемой системы оказались в окружении. Для этого мы используем следующую схему: Ubuntu squashfs → Base Docker Image → Rootfs Docker Image → merged rootfs → tar → ext4 Сначала берется подготовленный Ubuntu squashfs для Firecracker и первый этап распаковывает squashfs, а второй превращает его содержимое в базовый Docker Image. Таким образом у нас получается базовый образ в точности соответствующий струкртуре изначального sqashfs образа для виртуальной машины. Поверх базового образа применяется обычный Dockerfile.rootfs. Через apt-get устанавливаются зависимости будущей VM: Python, Docker, containerd, runc, сертификаты и необходимые библиотеки. Таким образом Docker выступает как конструктор файловой системы из подготовленного образа. После сборки создается временный контейнер, а его объединенная файловая система экспортируется через docker export. Далеее с помощью mkfs.ext4 создается ubuntu.rootfs.ext4, который подключается уже к Firecracker. Такой способ удобен и для отладки в докер окружении, и непосредственно для запуска виртуальной машины, а также удобен для интеграции в CI если вам необходимы изолированные кастомные зависимости. Т.е. докер не как среда запуска, а как способ менеджмента файловой системы и зависимостей. PS: если тема интересна, пишите в комментарии – выложу докерфайлы. – @tthread
Какое-то время назад смотрел видео (очень рекомендую), где обсуждалось, как выглядит современный inference в продакшене: MoE, батчинг, карточки и сеть Nvidia. Дизайн карточек обусловлен требованиями последних моделей – и мне врезалось в память, что последние карточки могут потянуть 10Т (!!!) MoE модели. Это когда Large Language Model – это, например, 500-800B параметров. Чуть отмотаем вперед – и начинают выходить DeepSeek v4 Pro (1.6T), Kimi K3 (2.8T) и, буквально сегодня, Qwen 3.8 (2.4T). Несколько триллионов параметров стремительно становятся нормой. А теперь деталь, которая меня глубоко поразила. В недавнем релизе Thinking Machines Inkling отмечалось, что при ~1T весов, на обучение было суммарно (модель мультимодальная – так что текст + аудио + картинки + видео) потрачено порядка 45T токенов. 1Т весов, 45T токенов, Карл. Иными словами – по 1 весу на каждые 45 (очень сильно не-уникальных) токенов, и это модель "всего" на 1T (не 3Т, и не 10Т). Это, дамы и господа, уже территория обычного архиватора. Даже не знаю, что тут сказать. Пути AGI неисповедимы. – @pgregory
Совершенно бесплатно, то есть даром, даем пользоваться GLM-4.7-Flash через наш хаб. Сильная маленькая (30B) современная модель – можно использовать, как и остальные GLM модели, через наши OpenCode и Pi плагины. – @pgregory
Модели Z.ai, включая нашумевшую GLM-5.2, теперь доступны через хаб: можно пользоваться через API, либо через наши плагины для OpenCode или Pi. DeepSeek, Z.ai, OpenAI, Anthropic – широкое меню на любой вкус (и кошелек). Расширять эту линейку в ближайшее время не планируем. – @pgregory