tgindex
Частные заметки одного лица

Частные заметки одного лица

Статистика
@sl_notesрусский

Статейки, мысли, заметки @shiryaeff

Последний пост
14 авг.
Последнее чтение
07:52
Постов за неделю
2
Всего постов
28
Тип
открытый
Язык
русский
В каталоге с
12 авг.
Подписчики
250
0 за 4 дн.
Сутки
0
0,00%
Неделя
 
Месяц
 
Просмотров на пост
172
28 постов
Вовлечённость
68,8%
к подписчикам
Постов в день
0,3
всего 28
Упоминаний
0
каналов
Охват размещения
оценка
1/24сутки в ленте
72
1/48двое суток
82
1/72трое суток
88

Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.

Посты

  • 14 авг.71из vibecoding_tg

    На первое место в трендах GitHub вышел OpenSandbox — платформа песочниц для ИИ-агентов от Alibaba. Она позволяет поднимать изолированные окружения, в которых агенты могут запускать код, работать с вебом или управлять рабочим столом. OpenSandbox не привязан к Python, официальные SDK доступны для Python, Java/Kotlin, TypeScript, C# и Go. Также есть CLI и MCP-сервер для Claude Code и Cursor. Для изоляции поддерживаются gVisor, Kata Containers и Firecracker microVM, а запускать всё это можно как локально через Docker, так и в более масштабной инфраструктуре. 100% опенсорс 😋

  • 13 авг.934из lovedeathtransformers

    Все модели думают одно и тоже ( и учат одно и тоже) - взяли разные данные - разные модели Обучили через SGD и показали что учится одно и тоже с точностью до вращения. arxiv.org/abs/2507.01098

  • 3 авг.21021из gonzo_ML

    Хорошая, полезная работа. Лишний раз показывает, что оркестрация важна, и подводит под это математический фундамент. Agentic Systems as Boosting Weak Reasoning Models Varun Sunkaraneni, Pierfrancesco Beneventano, Riccardo Neumarker, Tomaso Poggio, Tomer Galanti Paper: https://arxiv.org/abs/2605.14163 Review: https://arxiviq.substack.com/p/agentic-systems-as-boosting-weak Code: N/A Model: N/A # TL;DR ЧТО сделали: Авторы представили теоретический фреймворк, который формализует агентный поиск комитетом (committee search) как бустинг во время инференса (test-time boosting). Разделив задачу на отдельные компоненты — покрытие генератора (proposal coverage), локальную идентифицируемость (local identifiability), глубину прогресса (progress depth) и разнообразие (diversity), — они показали, что легковесную модель (GPT-5.4 nano) под управлением структурированной обвязки из критиков и компараторов можно заставить работать на уровне лучших коммерческих SOTA-моделей на бенчмарках по разработке ПО. ПОЧЕМУ это важно: Эта работа смещает фокус масштабирования LLM с гигантского увеличения параметров моделей на программно-определяемые архитектуры инференса. Авторы математически доказывают, что способность генерировать решения не означает способность их валидировать. Таким образом, предел масштабирования во время инференса ограничен «слепыми зонами» базовой модели-генератора, а не неэффективностью выбора. Для практиков: Вместо того чтобы тратить миллионы на файнтюнинг огромных моделей, можно использовать ансамбли из дешёвых и быстрых моделей-генераторов, обёрнутых в строгие каскады критиков и попарных компараторов. Главное — убедиться, что у базовой модели в принципе есть ненулевая вероятность сгенерировать правильный ответ (хотя бы в одном из k сэмплов), и предоставить системе надёжные внешние сигналы валидации (тесты, линтеры). Ансамблировать и оркестрировать тут: https://t.me/gonzo_ML_podcasts/3739

  • 3 авг.1632из gonzo_ML

    Снова про эмерджентность (https://t.me/gonzo_ML/1031). В работе прослеживают её до обнаружения паттернов разреженной маршрутизации внимания для конкретных задач. Emergent Capabilities Arise Randomly from Learning Sparse Attention Patterns Vatsal Baherwani, Zixi Chen, Shikai Qiu, Andrew Gordon Wilson, Pavel Izmailov Статья: https://arxiv.org/abs/2606.25010 Ревью: https://arxiviq.substack.com/p/emergent-capabilities-arise-randomly Код: N/A Модель: N/A # TL;DR ЧТО сделали: Авторы провели детальное исследование внутренних механизмов моделей (mechanistic study), которое показало, что внезапное, стохастическое появление прикладных способностей (downstream capabilities) у трансформеров в процессе обучения вызвано резким обнаружением паттернов разреженной маршрутизации внимания (sparse attention routing patterns), специфичных для конкретной задачи. Анализируя предобученные LLM и конструируя контролируемые синтетические задачи, они выделили длину контекста и разреженность паттернов как главные узкие горлышка (bottlenecks), ограничивающие этот процесс обучения, а также продемонстрировали, что альтернативные архитектуры или стратегии предварительного предобучения могут значительно ускорить эмерджентность. ПОЧЕМУ это важно: Это исследование демистифицирует «эмерджентные способности», смещая парадигму от необъяснимого, зависящего от масштаба феномена или «иллюзии метрик» к конкретной проблеме оптимизационного поиска. Понимание того, что эмерджентность соответствует обнаружению разреженных цепей маршрутизации (routing circuits), открывает чёткий путь в обход дорогостоящего масштабирования «в лоб» (brute-force scaling). Вместо этого исследователи могут проектировать новые архитектуры, специализированные пайплайны синтетического предобучения или вводить оптимизационные баесы (optimization biases), которые сделают выучивание таких разреженных паттернов внимания крайне эффективным с точки зрения расхода данных. Для практиков: Вместо бесконечного скейлинга моделей для достижения эмерджентности стоит сфокусироваться на предварительном предобучении (pre-pretraining) на структурированных синтетических датасетах (например, на языках Дика / Dyck) и использовать гибридные архитектуры, эффективные при позиционной маршрутизации (такие как MLP-Mixer), чтобы снизить оптимизационную сложность для трансформеров. Искать эмерджентность тут: https://t.me/gonzo_ML_podcasts/4752

  • https://habr.com/ru/news/1065734/

  • https://www.youtube.com/watch?v=f-ihesENwvg

  • 2 авг.15282из leraizbutovo

    Всенародная любовь к Дурову* — это очень сильный показатель, какие реальные герои у российского общества. Я убеждена, что попытка системы бороться с Дуровым является выстрелом себе в ногу. В российской культуре всегда была сильна любовь к героям, которые действуют вопреки обстоятельствам. Дуров* идеально вписался в этот архетип. Он не карьерист, не подхалим, пробивающий локтями место у кормушки. Не функция, не приспособленец. Не сильная рука с дубиной и постным недовольным лицом. Он — это личность. Дуров* прав, когда пишет, что еще посмотрим, кто кого сможет заблокировать. Он и телега де факто символизируют триумф интеллекта и свободы над унылым административным ресурсом. И последний проиграет в конечном итоге. Многие во власти это чувствовали, поэтому не пытались в открытую наезжать на фигуру Дурова*, более того, поддержали "нашего мальчика" открыто в 2024 году (над чем сейчас иронизирует половина интернета). Потому что это социально одобряемо и популярно. Дуров* показал личным примером, что богатым и знаменитым можно без связей в Кремле, а благодаря своим мозгам. И кроме того, он показал, что будучи богатым и знаменитым, МОЖНО сохранять свои взгляды, иметь какие-то, возможно экзотические, зато свои собственные воззрения о жизни. Я думаю, многие люди во власти сами знатно офигели объявления его террористом, учитывая то, что это произошло спустя пару дней после заявления Пескова о переговорах с телеграмом. Система уже во всю показывает свою несогласованность, и это хорошо. Ну и отдельно следует понимать, что этим признанием они еще больше девальвируют понятие "террорист". Раньше было "полстраны сидит, полстраны охраняет". Сегодня: полстраны**, полстраны — читают полстраны** в запрещенной социальной сети через VPN. * внесен в перечень террористов ** иноагенты, террористы, аффилированные лица, запрещены на территории РФ

  • 2 авг.155101

    https://www.youtube.com/watch?v=gC68PawVbAc

  • 30 июл.1544из steamship

    а вы тоже слушаете техно ремиксы на классику чтобы вайбкодить официальные документы https://www.youtube.com/watch?v=PiYjWoAWLx4

  • 28 июл.18751из gonzo_ML

    Топовые опенсорсные модели достигли запредельного уровня, в куче бенчмарков сравнимы с коммерческими фронтир моделями. Сейчас узкое место для взрывного роста доступного интеллекта — это домашние девайсы для инференса таких моделей, чтобы у каждого был свой "бесплатный" аналог Claude Code и не было бы финансово страшно жечь кучу токенов на OpenClaw-подобные эксперименты. Kimi K3: Open Frontier Intelligence Kimi Team Статья: https://github.com/MoonshotAI/Kimi-K3/blob/main/k3_tech_report.pdf Блог: https://www.kimi.com/blog/kimi-k3 Ревью: https://arxiviq.substack.com/p/kimi-k3-open-frontier-intelligence Код: https://github.com/MoonshotAI/Kimi-K3 Модель: https://huggingface.co/moonshotai/Kimi-K3 # TL;DR ЧТО сделали: Команда Kimi представила Kimi K3 — открытую мультимодальную модель типа Mixture-of-Experts (MoE) на 2.8 триллиона общих параметров и 104 миллиарда активируемых параметров на токен, поддерживающую контекстное окно в 1 миллион токенов. Модель сочетает гибридное внимание Kimi Delta Attention и Gated Multi-Head Latent Attention в пропорции 3:1, межуровневые связи Block Attention Residuals по глубине, а также Stable LatentMoE с 896 роутируемыми экспертами. Кроме того, Kimi K3 содержит энкодер изображений, обученный с нуля через предсказание следующего токена, и использует мульти-уровневое обучение с подкреплением (RL), дистиллированное из общего, агентного и кодерского доменов. ПОЧЕМУ это важно: Пока опенсорс-сообщество активно развивало масштабирование рассуждений на инференсе, размер открытых базовых моделей застрял в районе 1 триллиона параметров, увеличивая отставание от закрытых SOTA-систем. Kimi K3 доказывает, что одновременное масштабирование параметров до 3T-класса и агентного RL на контексте в 1M токенов даёт прирост эффективности предобучения в 2.5 раза по сравнению с Kimi K2 (https://arxiv.org/abs/2507.20534), создавая полноценную открытую альтернативу закрытым флагманам вроде Claude Fable 5 и GPT-5.6 Sol. Для практиков: Kimi K3 совершает сильный рывок в возможностях открытых моделей за счёт параллельного масштабирования архитектуры и RL. Инженерам и техническим лидерам это даёт готовое к продакшену решение передового уровня с рекордной экономичностью на задачах разработки ПО, сложной работы с инструментами и мультимодальных пайплайнах. Выложив веса на 2.8T и сопутствующие библиотеки, авторы снабдили сообщество инфраструктурой для развёртки сверхбольших архитектур без вспомогательных функций потерь (auxiliary loss) и с микро-ВМ средами для оценки агентов. Подробности и картинки тут: https://t.me/gonzo_ML_podcasts/4643

  • 27 июл.16782из ai_product

    Kimi K3 таки выложили в опенсорc https://huggingface.co/moonshotai/Kimi-K3 И опубликовали отчет. В общем, ничего супер-нового, но несколько интересных вещей отметил: – 2.8T параметров всего, но на каждый токен работает 104B – 16 экспертов из 896. – Контекст 1M, а позиционного кодирования нет вообще. Поэтому огромный контекст для нее вообще детский лепет и памяти на него не надо вагонами завозить. – MXFP4-квантизацию вводят не после обучения, а прямо во время RL. Модель с самого начала учится жить сжатой, то есть серверную стойку можно взять и поменьше :) – Стараются экономно расходовать токены, в том числе в мультимодальности. На BrowseComp лучший результат в мире за $2.03 за задачу. GPT-5.6 Sol вдвое дороже, Клод на максимуме – на порядок Еще из прикольного: – За обучение создали 51 миллион виртуалок-песочниц. Пока модель думает, песочница на паузе и не ест ресурсы вообще – а думает она до 98% времени жизни задачи. Вот на этом простое и сэкономили кучу денег на обучение. – За один 48-часовой автономный прогон K3 спроектировала и проверила прототип чипа для ИИ, вообще с нуля. 4 мм², 8700 токенов/с в RTL-симуляции. Исходники выложили на гитхаб – Написала свой компилятор для ИИ, обгоняет torch.compile – Воспроизвела результат из астрофизики за два часа вместо двух недель: 20+ статей, 300 уравнений состояния, нашла ошибки в опубликованных формулах – Смонтировала видео-ролик про собственную архитектуру из 56 клипов Отдельно про кибербез. Мерились с GLM-5.2. Нашли 16 ранее неизвестных уязвимостей, две в ядре Linux. UK AISI и NIST проверяли независимо: GLM обходит, до фронтира не дотягивает – 0 из 41 на end-to-end эксплойтах. То есть по кибербезопасности модель лучшая из опенсорса. По бенчмаркам всё то же, что и неделю назад: первое место на WebDev Arena среди 99 моделей (впервые открытая модель возглавила лидерборд живых людей). Про дизайн читал до этого статью интересную, как топовые модели сейчас стараются в более лучший дизайн. И я не вижу вообще как тут можно говорить, что это просто "дистилляция fable". Ну и здорово, что поделились вообще всем, как что работает, как дообучали, как песочницы делали, какие библиотеки использовали. То есть повторить и улучшить сможет любая лаборатория. Вау! Но у себя дома стойку под 2.8T, правда, всё ещё надо иметь :) https://github.com/MoonshotAI/Kimi-K3/blob/main/k3_tech_report.pdf

  • 23 июл.21173из data_secrets

    Kimi K3 взломала Redis, и на это ей потребовалось всего полчаса и 32 агента 27 минут. Ровно столько времени прошло от запуска автономного агента до момента, пока тот нашел уязвимость и довел ее до рабочего эксплойта. Баг оказался уровня RCE и приводил к возможности выполнить код на сервере Redis через уже аутентифицированное подключение. ☕️

  • 23 июл.206119из data_secrets

    Такими новостями уже никого не удивишь, но GPT-5.6 опровергла еще одну известную гипотезу, которая была открыта 30 лет Гипотеза Диница - Гарга - Гоеманса – это теорема из теории графов и сетевых потоков, которая гласит, что из допустимого дробимого решения можно получить целочисленное по маршрутам решение без увеличения стоимости. Подобные утверждения часто становятся основой для практических оптимизационных алгоритмов, поэтому гипотеза важная. Открыта она была с 1999. Решение, к слову, обнаружил математик из Нижнего Тагила, выпускник ВШЭ. Вот чат с моделью. Промптинг на уровне «соверши прорыв», «опровергни общий случай», «продолжай исследовать» – то есть вообще никаких подсказок и даже серьезных инструкций. Сам автор называет чат «чистым мемом». В итоге за несколько итераций и несколько часов модель нашла нужный контрпример. Вот такая математика в 2026.

  • habr.com/ru/articles/1060874/

  • habr.com/ru/news/1060984/

  • 20 июл.20764из data_secrets

    Fable 5 опровергла известную гипотезу Якобиана Она формулируется так: если у полиномиального отображения постоянный ненулевой якобиан, то у него должен существовать полиномиальный обратный. Надо понимать, что это не очередная узкая проблема математки, а буквально центральный вопрос обратимости полиномиального отображения, который с 30-х годов прошлого века оброс кучей литературы и споров. До сегодняшнего дня были доказаны только некоторые частные случаи. Найденный Fable пример гипотезу окончательно опровергает. О решении объявили математики Levent Alpöge и Akhil Mathew, его уже проверили в автоматических верификаторах и подтвердили некоторые независимые математики. Math is solved?

  • 18 июл.1832из gonzo_ML

    В комнату входит состязательная психометрика. Забавно, что "персоны" моделей существенно разные — Клод кооперативен, а GPT склонна к обману. Measuring Intelligence Beyond Human Scale Jerry Han, Rafael Moschopoulos, Ella Colby, Vishrut Goyal, Andrew Tu, Kia Ghods, Mark Braverman, Elad Hazan / Princeton Superalignment Paper: https://arxiv.org/abs/2607.07040 Review: https://arxiviq.substack.com/p/measuring-intelligence-beyond-human Code: N/A Model: N/A # TL;DR ЧТО сделали: Авторы представили SepaRank — теоретико-игровой фреймворк для оценки моделей, основанный на «состязательной психометрике». Вместо статичных бенчмарков, созданных людьми, модели оцениваются в двойных ролях: как авторы задач (пропозеры) и как их решатели (солверы). Пропозеры получают награду за генерацию публичных бинарных вопросов, которые максимизируют дисперсию (несогласие) в ответах пула моделей-солверов, в то время как солверы оцениваются по точности ответов с помощью Brier loss. ПОЧЕМУ это важно: Когда возможности ИИ приближаются к уровню людей-экспертов и превосходят его, традиционные абсолютные бенчмарки быстро насыщаются. При этом людям-экспертам становится всё труднее придумывать или проверять сложные, дискриминирующие вопросы. Переходя от абсолютной оценки к относительной (по принципу «один ко многим»), SepaRank создаёт автоматический, самомасштабируемый лидерборд без участия судей. Он естественным образом нейтрализует популярные стратегии обхода правил, такие как запросы к скрытому состоянию или алгоритмические лазейки. Для практиков: Для технических лидеров и исследователей ИИ эта работа предлагает сдвиг парадигмы (всё как мы любим!) в оценке LLM. Она доказывает, что мы можем надёжно ранжировать сверхчеловеческие системы, позволяя им самим нащупывать и вскрывать границы возможностей друг друга. Такое динамическое взаимодействие не только решает проблему насыщения бенчмарков, но и генерирует поток сложных out-of-distribution данных для обучения, которые можно напрямую использовать в RLHF и циклах пост-тренинга. Состязательно измерять психов здесь: https://t.me/gonzo_ML_podcasts/4484

  • 18 июл.1744из gus_vasili

    https://t.me/sergeyvakulenko/228 То, о чём я писал недавно, но в развёрнутой форме, и от признанного отраслевого специалиста. Замечу только, что 3,7% от ВВП - это все расходы всех экономических агентов на все виды топлива. Если брать расходы только бизнеса только на бензин, доля будет почти в десять раз меньше. Ну и главное. Настоящую угрозу существенного всплеска инфляции представляет не рост цен на 30-40 рублей за литр, а обрывы логистики, связанные с очередями и рационированием (карточки). Молоко действительно может подорожать вдвое, если молоковозы не смогут вовремя заправляться, и молоко будет скисать.

  • https://habr.com/ru/articles/1060204/

  • 18 июл.181152из naukauniver

    #Прямая_речь Учитель истории московской гимназии № 1543, заслуженный учитель РФ Леонид Кацва по поводу отказов зачислить школьников в 10-й класс:   «Наши школьники привыкли к тому, что можно не учиться и переходить из класса в класс: «тройка» устроит, а «двойку» не поставят, и можно продолжать готовить три предмета. С моей точки зрения, в школах у нас достаточно детей, которые должны заканчивать образование в 9-м классе, если не раньше, и переходить в те учебные заведения, где главное внимание будет уделяться подготовке к  профессии. Я никакой трагедии в том, что в 10-й класс стали принимать довольно жестко, не вижу».

Частные заметки одного лица — tgindex