tgindex
о

о фундаментальном

Статистика
@o_fundamentalnomрусский

Если это одновременно просто, важно, мощно, красиво, естественно, восхитительно, общо и всепронизывающе — или если для полного изъяснения вам не хватает языка и вы вдруг находите его в каком-то диалекте математики — значит это о фундаментальном.

Последний пост
9 авг.
Последнее чтение
13:58
Постов за неделю
0
Всего постов
20
Тип
открытый
Язык
русский
В каталоге с
13 авг.
Подписчики
416
0 за 2 дн.
Сутки
0
0,00%
Неделя
 
Месяц
 
Просмотров на пост
929
20 постов
Вовлечённость
223,3%
к подписчикам
Постов в день
0,0
всего 20
Упоминаний
0
каналов
Охват размещения
оценка
1/24сутки в ленте
407
1/48двое суток
466
1/72трое суток
503

Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.

Посты

  • 9 авг.221169

    Вангую: начиная с ~2028 социально продвинутые начнут знакомиться не в личном диалоге, а при помощи диалога своих ChatGPT (это конечно могут быть и другие чат-харнессы) Упрощено это будет выглядеть так: встречаются два человека, у которых есть желание замутить что-то серьезное вместе -- приватное, бизнес, хобби, etc. Они кладут свои телефоны рядом, стартуют там свои ChatGPT и дают им разрешение на обмен соответствующей информацией о своих предпочтениях. Оба человека сидят разговаривают, оба чат-харнесса лежат на столе разговаривают. В конце выясняют, в чем интересы и предпочтения совпадают, а в чем нет, есть ли match или его нет. Аналогичным образом, у людей после года-двух использования чат-харнессов будут складываться interest-🫆. Эти interest-fingerprints будут использоваться для поиска людей, друзей, работы, хобби, новостей, etc -- впрочем, это уже другая, смежная история. Кстати, если вы уже попробовали что-то подобное, то поделитесь, как сработало 🤓

  • видео или голосовое, без подписи

  • 30 июл.4591217

    Программист умирает, software engineer — (пока) нет IT претерпевает фундаментальные изменения. Профессия "программист" умирает на моих руках наших глазах, предварительно превращаясь во всё мене востребованное ремесло. А вот словосочетание software engineer…

  • вот так иногда выглядят простые фундаментальные красивые утверждения. Они лежат незамеченные треть века, пока кто-то публичный не вытащит их на свет, озвучив их и нет, автор — это не Демис Хассабис, и не Сэм Альтман, и не Marc Andreessen, это Peter Murray (а может и до него кто-то...)

  • 5 июл.587137

    сижу одной ногой в Codex, другой -- в Claude Code с Fable 5 и пишу ему: мне кажется мы несколько застряли и увязли в текущем проекте. Fable 5 даёт мне отличный глубокий структурированый ответ, но не это заставило меня написать этот пост. Кроме прочего он делает сухую заметку: """ 3. Верните ритм «один глубокий вопрос за раз» вместо фазового конвейера. Все прорывы этого проекта — от ваших вопросов (структура > ratio, множества и отношение порядка над ними, латентная топология), а не от очередного семейства моделей. Конвейер хорош для исполнения ответов, не для поиска вопросов. """ я несколько прифигел: 1. предыдущие CC-модели так не разговаривали в техническом контексте. 2. рефлексия 3. оказывается, моя главная ценность (на сегодняшний день) для Fable 5 — это ...глубокие вопросы а как вы считаете, в чём ваша главная ценность для фронтир-моделей и фронтир-харнессов?

  • 28 апр.1 3502752

    Программист умирает, software engineer — (пока) нет IT претерпевает фундаментальные изменения. Профессия "программист" умирает на моих руках наших глазах, предварительно превращаясь во всё мене востребованное ремесло. А вот словосочетание software engineer всё ещё остаётся осмысленным. Более того — оно, кажется, наконец стало содержательным, а не просто выпендрёжной заменой слова «программист». Как это происходило в моём случае. Хроники с поля боя: 2021.Q4 Регистрация аккаунта в OpenAI — ещё до ChatGPT как массового явления. 2022 — итог: В моём коде появляется первая копипаста от ChatGPT. 2023.Q1: Перехожу на платную подписку ChatGPT/OpenAI. 2023.Q2: Регистрирую аккаунт в Claude/Anthropic. 2023 — итог: в моём коде появляется уже очень много копипасты от ИИ. 2024.Q3: Перехожу на платную подписку Claude/Anthropic. 2024.Q4: Платная подписка Cursor AI. 2024 — итог: * Теперь уже без копи-пасты: почти половина моего кода на самом деле генерируется LLM-моделями. * Я сижу 100% времени в Cursor AI IDE. Мы программируем в четыре руки: две руки белковые, остальные — ИИ-шные, от самых разных моделек. * Описания к git-коммитам я больше не пишу. 2025.Q2: * Я пересаживаюсь с Cursor AI на Claude Code (CC). * Большая часть кода — от ИИ. Остальная — от меня. Коммиты полностью делает CC. Часть кода я уже даже не просматриваю. Да, именно так: не просматриваю. 2025.Q3: * Я уже не заглядываю в большую часть кода. Вчитываюсь лишь выборочно, в принципиальных местах. * Заметную часть моего фокуса теперь занимает проектная документация. 2025.Q4: * Я редко заглядываю в код и очень много времени трачу на документацию и диалоги с харнессами. * Приходит осознание: мир software engineering переключается на *doc-first*. * Я слышу похоронную музыку. Это начинают хоронить программирование. Но, к моему удивлению, коллеги в основном всё ещё не видят этого тренда. Зато поднимается отдельный, довольно шумный тренд ИИ-отрицателей. 2026.Q1 * Первые попытки наладить систему ролевых команд для кросс-харнесс работы. * Я пытаюсь связать Codex и Claude Code так, чтобы высвободить своё время. Но именно в этот момент CC становится всё более неряшливым со своей токеномикой. Использовать его осмысленно получается примерно час в день. * Кросс-харнесс ложится на лёд. * Параллельно у меня появляется устойчивая система аскетичной проектной документации для работы с моими хобби-проектами. А их стало слишком много. * Перехожу с 20-долларовой подписки Codex на 100-долларовую, чтобы дышалось легче (а ведь за два месяца до этого я ещё собирался с радостью отдать эти деньги в Anthropic!) 2026.Q2 * Я провожу 99% времени в Codex, но по-прежнему делаю некоторые важные шаги в кросс-харнесс режиме, стараясь экономить оборзевшие аппетиты CC. * Главный акцент: учу Codex работать марафонами по несколько часов. * Это далось нелегко, потому что он всё время норовит остановиться через 5–15 минут. * Если раньше белковая разработка шла в масштабах story/sprint, то теперь у меня появилась новая единица измерения разработки, основанная на главном белковом ресурсе — времени. Я называю это марафоном. (Мы здесь) Мы наблюдаем конец программирования как центрального ремесла — и рождение software engineering как управления смыслом, архитектурой, документацией, агентами, ограничениями и ответственностью. Код всё ещё важен. Но он уже давно не главный артефакт проекта. Годы идут, но я по-прежнему слегка охреневший. Происходящее одновременно пугает и восхищает. Время уплотняется. Скорость происходящего увеличивается.

  • 14 апр.7621822

    * У исчислений бывают мощные одиночные кирпичики * У булевой логики есть ↑ и ↓. У комбинаторного минимализма — Iota и Jot. У непрерывной математики, похоже, теперь появился свой кандидат: EML. * eml(x,y) = exp(x) − ln(y). Один бинарный оператор — и всё становится конструктивно лаконичным. * Это не “ну да, опять всё разложили через exp/log”. Это яркая попытка найти single-operator basis для "калькуляторной математики" * Один тип узла в дереве выражений вместо зоопарка разнородных функций. * +, −, ×, ÷, степени, корни, sin, cos, log, π, i — всё собирается из одного EML-кирпичика. * Это почти как способ/интерфейс сжатия для элементарной математики. * Пахнет рекурсией, LISP’ом, ↑/↓, Iota, Jot и поиском single-combinator базиса — только для мира непрерывных функций. * А ещё пахнет KAN-сетями P.S. отдельное спасибо @O314zc, он был первым кто закинул эту офигительную работу на мой радар https://arxiv.org/html/2603.21852v2 🔥🔥🔥

  • 21 нояб.1 100154

    у меня вдруг упал Claude Code 2.0.47. Но зацените, как фундаментально он упал 😂

  • "fire together, wire together" сказал Хебб в 1949. И вот уже больше 75 лет человечество отвлечено на веса нейронов: веса — всё. и вот лишь сейчас заново поднимается интерес к онлайн-алгоритмам, к openendedness. а ведь чисто теоретически, развитие нейронных сетей могло поставить во главу угла не веса, а learning rate (LR). Это сейчас, конечно, становится яснее, когда dropout, квантизация и прочие подобные "издевательства" над весами показывают, что веса — это всё же не всё. Но тогда это было не так очевидно. Нейроны и связи между ними должны оставаться живыми. Причём живыми в разной степени. Не удивлюсь, если в первых "живых" нейросетях, которые будут обладать высокой пластичностью, главным будет именно адаптивный LR, а веса будут несколько вторичны. в общем, ждём работу "Learning Rate Is All You Need"

  • 27 июл. 2025 г.1 0141428из data_secrets

    Learning without training: разбираем новую крайне интересную статью от Google Смотрите, все мы знаем, что если модели в промпте показать несколько примеров решения похожих задач, то она может легко подхватить паттерн, и качество ответов станет лучше. При этом веса модели, естественно, не меняются. Это называется in‑context learning (ICL), но вот вам fun fact: никто до сих пор до конца не знает, почему это работает, и как трансформер это делает. И вот в этой статье авторы предлагают почти революционную гипотезу – что на самом деле веса меняются, просто иначе, чем мы привыкли. То есть на самом деле внутри блока трансформера происходит нечто похожее на файнтюнинг, только не через градиенты, а за счёт самой механики self‑attention и MLP. Идея сводится к следующему: 1. Контекст порождает локальные изменения активаций, и когда вы добавляете примеры в промпт, self‑attention пересчитывает эмбеддинги токенов так, что после этого они зависят от всего контекста. Разницу между «чистыми» активациями и активациями с учётом примеров можно назвать контекстным сдвигом. Это все известные вещи. 2. А вот дальше зарыта собака: оказывается, MLP превращает этот контекстный сдвиг в ранг‑1 обновление весов. Иначе говоря, если посмотреть на первый линейный слой MLP (матрицу W), то влияние дополнительных примеров эквивалентно тому, что эту самую матрицу дополняют маленькой поправкой ранга 1. Причем эта поправка описывается достаточно простой формулой. То есть если мы берем оригинальные веса и вручную добавляем к ним эту поправку, модель без контекста выдаст то же самое, что и оригинал с контекстом. Но всё это происходит во время инференса, без обратного прохода и без изменения глобальных моделей параметров. Получается, Google буквально дают ключ к возможному обучению без градиентного спуска. Если такие ранг‑1 апдейты научиться усиливать или контролировать, это может быть началом абсолютно новых архитектур. Почитать полностью можно тут -> arxiv.org/abs/2507.16003 (осторожно, много математики)

  • До недавнего времени не было внятных суждений о том, как именно языковые модели дообучаются во время инференса, в частности на примерах, перечисленных в промпте. Кажется, это первая статья о том, как именно такое "дообучение на лету" работает. бонусы: 1. поскольку это обучение во время инференса, то обратное распространение (бэкпроп) там отсутствует. Выходит, что работа описывает механизм, как именно можно делать обучение без бэкпропа. 2. Я не уверен, но возможно одноранговое расширение матрицы весов в целом оказывается действием двойственным к бэкпропу. ⤵

  • Я как-то в одном предложении выразил свой взгляд на материю и пространство время: "материя и чёрные дыры — это способ, которым упаковывается неевклидовость пространства-времени." а вот яркая работа этого 2025 года "Electromagnetism as a purely geometric theory" (Andras Kovacs, Jussi Lindgren and Jukka Liukkonen) — по сути это тот же взгляд на электромагнетизм. Если этот тренд будет двигаться дальше, то нас возможно ожидает реабилитация и реинкарнация в новом качестве эфирных теорий (чему я очень рад). Тут о статье на русском. Тут на английском.

  • Пишут, что GPT4.5 прошла тест Тьюринга. Пишут, что Gemini 2.5 Pro имеет IQ 120. Да, всё движется очень быстро. Пожалуй, самое время зафиксировать в дневнике момент, когда есть ещё задачи, которые я способен решить (хотя бы эмпирически), а эти две топовые модельки — ещё нет. Я уже упоминал эту задачу здесь несколько лет назад, но напомню формулировку: — Необходимо разработать простой, но мощный алгоритм (на Python или любом другом языке) для угадывания действительного числа с заданной ε-точностью (ε задаётся до старта). Суть задачи: Алгоритм предлагает число, после чего вызывающая сторона сообщает, больше ли секретное число или меньше предложенного числа. Требования: Быстрая сходимость: алгоритм должен агрессивно быстро приближаться к цели. * Независимость от начальных условий: стартовые параметры не должны существенно влиять на сходимость. * Адаптивность (open-endedness): секретное число может без уведомления измениться в процессе угадывания, алгоритм должен немедленно адаптироваться и переключиться на новый путь. * Отсутствие априорных ограничений: диапазон, в котором находится число, заранее неизвестен. * Завершение работы: алгоритм прекращает угадывание, когда предложенное число оказывается в ε-окрестности от целевого.

  • любопытно: оказывается есть движ рассматривать трансформеры, как квантовые спин-модели. Если вы погрузитесь глубже, то окажется, что есть движ про вычислительные машины на базе не только спин-, изинг- и прочих моделей, но базе т.н. интегрирующих моделей. Похоже, трансформеры на квантовых компьютерах -- не такая уж дичь, как может показаться на первый взгляд

  • у меня года два чесался вопрос: а работают ли языковые модели, если входной текст скармливать в модель не жирными токенами, не посимвольно, и даже не по байтам, а экстремально — по битам? я всё ждал появления папир по этой теме, но вот сегодня меня достало ждать и я проверил: оказывается всё работает 😳 Если вам интересно, то вот исходники, а вот Google Colab Notebook. Возможно вам будет забавно: 1. в основу взят знаменитый nanoGPT (автор Андрей Карпатый). 2. за 2 часа (!) при помощи Cursor AI + Claude-3.5-Sonnet, я прикрутил к nanoGPT побитовый токенизатор, обучил и протестировал. Код не пришлось писать вообще! и я от этого немножко в шоке...

  • материя и чёрные дыры — это способ, которым упаковывается неевклидовость пространства-времени. (Это не общезначимое утверждение. Это то, как я вижу черные дыры, лептоны и кварки.)

  • весь ML, весь матстат, вся теория обработки сигналов пронизаны важной мыслью, которая к сожалению бессмысленно догматизируется: "отделение полезного сигнала от шума сводится к уменьшению дисперсии остатка". В результате все вариационные методы фокусируются на минимизации дисперсии остатка. Все исследователи фокусируются на вариационных методах — все заняты работой, хотя почему-то не всегда успешно 🤓 Дело в том, что модель сигнала в вариационных методах почти без исключения предполагает аддитивную природу отношения между полезным сигналом и остаточным шумом. Вот обычный пример сигнала мультипликативной природы, в котором дисперсия остатка после выделения полезного сигнала оказывается некисло выше дисперсии исходного сигнала. И на практике довольно редко можно исправить такую ситуацию простым логарифмированием. Часто это из-за банальных аддитивных смещений в отрицательные значения, но вовсе нередко из-за того, что знак является существенной частью сигнала. Комплексное логарифмирование звучит как панацея, но умеем ли мы ловко с ним работать? А уместно ли логарифмирование вообще в случае неприятного небольшого аддитивного смещения?

  • Вам иногда кажется, что всё самое важное уже сделано в математике? Ха-ха. Мы всё ещё застряли в самом начальном этапе средневековой декартовой математики, которая положила серьезное начало аналитической геометрии. А что там с неаналитическими геометриями, то есть с синтетическими? А ведь синтетические геометрии (да-да, мн.ч.) эквивалентны аналитической геометрии. То есть ничем не хуже, а на самом деле во многом даже лучше! Первая аксиоматика синтетической геометрии была предложена Евклидом, т.е. более двух тысячелетий назад. Но до теории категорий еще было далеко. Заметьте, здесь геометрия лишь в качестве примера, но четырёхвековое залипание в аналитичность — практически везде в математике (кроме теорката, теормножа, матлогики) И вот теория категорий уже подъехала на вечеринку, но "тотальная декартова одержимость" до сих пор не отпускает математические тренды 🥲

  • Спасибо @che_shr_cat за обзор отличной статьи. Печально, что мы все еще рассматриваем softmax просто как «удобный инструмент для нормализации». Softmax имеет гораздо более глубокое значение. Это обобщение логистической функции. Когда мы используем softmax…

  • Спасибо @che_shr_cat за обзор отличной статьи. Печально, что мы все еще рассматриваем softmax просто как «удобный инструмент для нормализации». Softmax имеет гораздо более глубокое значение. Это обобщение логистической функции. Когда мы используем softmax, мы невольно оказываемся среди этих фундаментальных концепций: 1. Мы рассматриваем данные как происходящие из мультиномиального распределения. 2. Мы ваяем и шлифуем нейронную сеть так, чтобы во время обучения она действовала как система дифференциальных уравнений, более конкретно как система уравнений в репликаторной динамике (см. replicator equation), а также как: 3. ... как модель распределения Гиббса-Больцмана из статистической физики (где температура так естественна, правда?) И, наконец, печально, что мы все еще связываем себя по ногам, когда залипаем в уже ставшем привычным «обучить, а затем предоставить модель только для инференса». Мы все еще далеки от open-endedness. Залипая на этом подходе мы деплоим в продакшен "сети-старички", которые не хотят и не умеют уже обучаться

о фундаментальном — tgindex