Data, Stories and Languages
СтатистикаКанал о ML/AI, изучении иностранных языков, книгах и жизни. Контакт с автором https://t.me/Erlemar Персональный сайт: https://andlukyane.com/ Рекламу не публикую Забустить канал можно тут: https://t.me/boost/datastorieslanguages
- Последний пост
- 13:17
- Последнее чтение
- 09:46
- Постов за неделю
- 8
- Всего постов
- 42
- Тип
- открытый
- Язык
- русский
- Категория
- Книги
- В каталоге с
- 12 авг.
- 1/24сутки в ленте
- 599
- 1/48двое суток
- 686
- 1/72трое суток
- 740
Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.
Посты
Talk: breaking into machine learning - recording Пару дне назад я уже писал, что я буду делать доклад для пакистанских студентов. В общем получилось так, что на него зарегистрировалось 450+ человек, несмотря на то, что это был праздник - день независимости. Встреча была в google meets, но там лимит в 100 человек, так что все желащие не влезли. В результате делали трансляцию в linkedin, запись можно посмотреть тут https://www.linkedin.com/events/liveaugust147494045235434594306/ Вопросы были в основном про карьеру - как её начинать, что делать в текущей ситуации с засилием AI, как вкатываться в сферу и так далее. Думаю, скоро напишу блогпост про это, чтобы мысли были не только в записи. Сам доклад шёл 40 минут, потом я ещё 40 минут отвечал на вопросы. #career #ai #datascience
Чатботы моей молодости Сегодня пятница, так что немного ностальгии. Я вспомнил как в 2018 году делал телеграм чат-бота после прохождения какого-то курса. Я 3 недели мучительно писал код на Keras и тренировал модель. Бот мог выполнять несколько команд и что-то нечленораздельно отвечать на свободные вопросы. За 8 лет был пройден огромный путь
Openai Computer History "Computer History turns your activity across apps and websites into memories and a timeline that ChatGPT and Codex can reference. You can ask natural questions about recent work, pick up where you left off, understand patterns in how you work, and turn repeated workflows into skills or automations." https://learn.chatgpt.com/docs/customization/computer-history #ai
Talk: breaking into machine learning Так уж получилось, что завтра я буду делать доклад для пакистанских студентов о карьере Формочка для регистрации https://docs.google.com/forms/d/e/1FAIpQLSf2IdKIuZ9o2tDiMq-Fjfe6efKzTj4w43JMOekHrME5fTtCZg/viewform #career
🤟 DeepMind SL2T: мультиязычная модель перевода жестового языка в текст 📌 TL;DR DeepMind представила SL2T — модель перевода жестового языка в текст, которая работает на потребительских устройствах (Pixel 11, Gboard, Live Transcribe). Ключевые особенности: приватность через pose-ландмарки (не сырое видео), обучение на 100K+ часов данных по 50+ жестовым языкам, и прямой перевод landmarks → text без промежуточных глоссов. На бенчмарке FLEURS-ASL модель достигает 70 BLEURT (zero-shot), значительно обгоняя предыдущие SOTA (около 50). 🧠 Зачем? Большинство систем распознавания жестового языка до сих пор в стадии RnD-исследований: либо они требуют разметку глоссов (искусственных текстовых представлений жестов), либо работали только с одним языком и обрабатывали сырое видео, что по мнению авторов создает риск безопасности (спорный поинт). Можно ли создать единую модель, которая (1) масштабируется на десятки жестовых языков, (2) работает в реальном времени на устройстве, (3) защищает приватность пользователей и (4) не требует промежуточных аннотаций? Ответ — да. 🗂️ Как устроена SL2T Пайплайн обработки: [Камера] → MediaPipe Holistic (on-device) → Pose landmarks (x, y coords) → [Server] → SL2T Model → Text Ключевые выводы: 1) Мультиязычность улучшает качество на 50+ языках, помогает модели выявлять общие структуры, что улучшает метрики даже на редких языках; 2) Отказ от глоссов: прямой перевод позволяет модели учиться на нелинейных аспектах жестового языка (мимика, пространственные отношения), которые глоссы не передают; 3) Качество растёт с объёмом данных — нет искусственного потолка из-за ограниченного словаря глоссов. 🧪 Ограничения и открытые вопросы — Покрытие языков: пока только американский ЖЯ в продуктах; остальные 50+ языков — в исследовательской фазе — Бенчмарки обычно собраны на чистых данных; реальная вариативность (освещение, ракурсы, скорость жестов) могут сильно влиять на качество — Не-мануальные компоненты: хотя модель теоретически способна их учитывать, но тема не изучена достаточно хорошо — Культурная адаптация: жестовые языки тесно связаны с культурным контекстом. А как модель адаптируется к региональным вариациям внутри одного языка? Проблема диалектов остается открытой. 🔗Ссылка: Google DeepMind Blog, 2026 #signlanguage
Xgboost - test of time award
видео или голосовое, без подписи
+1
🌸Релизим Muse Glimmer 30B 🌸 Впервые за долгое время, наконец-то релизим большой командой новую открытую LLM от Meta Superintelligence Labs. Веса под Apache 2.0! 🌸Что это за модель: — 30B dense модель, дистиллированная версия Muse Spark для локального инференса на 1 GPU — юз-кейсы: OpenClaw, MCP, и агентные тулзы — общие способности (ризонинг, знания, кодинг) тоже на высоком уровне для модели такого размера. — очень быстрый инференс: 233 токена/сек на 5090 благодаря DFlash spec decoding — по ключевым способностям — агентные воркфлоу, swe bench, ризонинг — лучше Qwen 3.6 и Gemma 4 31B — есть мультимодальный инпут (картинки и видео) — больше 100 языков в претрейне — контекст 131к токенов — есть perception encoder (1.8B) в дополнение к модели Пожалуйста, скачивайте, пользуйтесь, — и ждите тех репорт и доки! На неделе постараемся выпустить инференс у партнёров и доки по деплою на llama.cpp, ExecuTorch, MLX. 🟣Блогпост https://research.meta.ai/blog/introducing-muse-glimmer-open-agentic-model 🟣 Веса https://huggingface.co/meta-models/Muse-Glimmer-30B 🟣Доки: (пока что такие же как у Muse Spark) https://dev.meta.ai/docs/cookbook
Генерация картинок в 2019 Я сейчас что-то вспомнил соревнование 2019 года на Kaggle по генерации изображений собак. Нашёл там тредик, где люди выкладывали, что у них получилось https://www.kaggle.com/competitions/generative-dog-images/discussion/97753 Выглядит жутковато. Прошло каких-то 7 лет, и теперь нередко сгенерированные изображения фиг отличишь от реальных. #ai
О локальном инференсе LLM Регулярно встречаю блогпосты и призывы инференсить LLM на локальном железе. Но это всегда имеет ограничения. Одни предлагают квантизировать модели в 1b, другие хитро стримить, третьи советуют брать модели поменьше. Но квантизация заметно ухудшает качество. Мелкие модели тоже похуже А "хитрый стриминг"... Вот увидел я пост на медиуме: "Unbelievable! Run Kimi K3–2.8 Trillion Parameters — on a Single 4GB GPU". Думаю - не верю. Открываю... "This is not fast. Roughly five minutes per token." - не юзабельно #llm #ai
Kaggle: Rogii https://www.kaggle.com/competitions/rogii-wellbore-geology-prediction/leaderboard В последние месяцы я впервые за несколько лет серьёзно участвовал в соревновании на каггле. Это было геодезическое соревнование. В итоге мы оказались в серебре и избежали шейкап. Моё соло решение тоже тянуло на серебро, но лишь на ~200 место. Блогпост с деталями напишу позже, а пока вот красивые картинки от клода. Кстати, я не написал ни одной строчки кода - всё участие было через клод/кодекс. Теперь буду отдыхать и зарекаюсь участвовать в каггле ещё на несколько лет 😅 #kaggle #ai
CayleyPy: Professor Tetraminx puzzle Месяц назад я рассказывал как участвовал в ресерч соревнованиях Cayley. С тех пор я поучаствовал в ещё одном соревновании - Professor Tetraminx. Напоминаю, что суть задачи - из рандомного состояния головоломки (после N поворотов) дойти в исходное за минимальное количество шагов. Поскольку это по факту групповой ресерч, не были цели собрать топ-решения самостоятельно - мы хотели вместе сделать топ решение. Я начал тогда, когда лучшее доступное решение было 28863 и улучшил его до 28467, получив новый лучший результат и обойдя мирового эксперта Tomas! Блогпост с деталями напишу позже, но пока расскажу, что нового было сделано по сравнению с моим прошлым подходом: - Как известно, решить такую головоломку брутфорсом нельзя. Но вполне можно с помощью BFS подсчитать все состояния после 6-9 шагов. Так что теперь мой подход не пытается дойти до финального состояния, а просто до состояния, которое находится на расстоянии 6-7 до финального. Это довольно важно, ибо иногда поиск останавливается лишь в нескольких шагах от успеха - и этот подход спасает такие кейсы - Sparse Q - новая голова для нейронки (по предложению Vlad Kuznetsov), которая даёт скор сразу для всех возможных переходов из текущего состояния - это сильно ускоряет обчение и инференс - многократное расширение датасета с разными подходами по сбору данных - PieceTransformer в качестве модели и его бленд с обычным ResMLP - V-consistency - хитрый подход для улучшения beam search. Простыми словами: если одна голова модели говорит, что мы в 10 шагах от цели, а другая голова говорит, что после одного шага мы будем в 15 шагах - это неправильно; а если головы выдают 10 и 9 - значит мы движемся в правильном направлении Теперь продолжу участвовать в других соревнованиях этой серии и всем рекомендую :) #kaggle #datascience
Kimi K3: Open Frontier Intelligence Последний год открытые фронтир-модели сходились примерно к одному классу размеров (около 1T) и конкурировали на эффективности: test-time compute, дешёвый длинный контекст, agentic RL. Moonshot пошли в другую сторону: Kimi K3 — это MoE на 2.8T параметров (104B активных), с native vision и контекстом в 1M токенов. По заявлению авторов, первая открытая модель 3T-класса. Архитектура собрана вокруг масштабирования "information flow" по трём осям. - По длине последовательности — гибридное внимание: три слоя Kimi Delta Attention (linear attention с delta rule и channel-wise forget gates, фиксированный state вместо растущего KV-кэша) на один слой глобального Gated MLA. Позиционного кодирования нет вообще (NoPE) — позиция возникает из decay-гейтов KDA, поэтому расширение до 1M токенов обходится без RoPE-хаков. - По глубине — Attention Residuals: вместо одного накопленного residual stream каждый слой формирует learned pseudo-query и через softmax выбирает, что читать из выходов предыдущих слоёв. - По ширине — Stable LatentMoE: 896 экспертов, 16 активных на токен, роутинг в латентном пространстве вдвое меньшей размерности, а стабильность при такой sparsity держится на RMSNorm, ограниченной активации SiTU-GLU и Quantile Balancing. Всё вместе даёт примерно 2.5x scaling efficiency относительно K2. Post-training тоже нетривиальный: после SFT авторы обучают 9 экспертных политик (3 домена на 3 уровня reasoning effort) в agentic-окружениях, а потом сливают их в одну модель через Multi-Teacher On-Policy Distillation — студент генерирует свои rollouts и получает per-token reward от подходящего учителя. Quantization-aware training с MXFP4-весами экспертов идёт с этапа SFT, так что деплой видит ту же арифметику, что и обучение. В целом модель уступает Claude Fable 5 и GPT-5.6 Sol. Разрыв виден на research-level reasoning и knowledge-work лидербордах. Но круту то, что linear-attention гибрид без позиционного кодирования работает на фронтир-масштабе. Paper Code Project Мои обзоры: Personal blog Medium Linkedin #paperreview
В пятницу вечером - о насущных обсуждениях
Kimi K3 attention https://arxiv.org/abs/2607.24653 Недавно вышла статья от Kimi K3. Я планирую написать на неё обзор на следующей неделе, но пока я заинтересовался механизмом attention, описанном в ней. Kimi использует Kimi Delta Attention и Attention Residuals, которые появились ещё в Kimi Linear. По факту всё это продвинутые варианты linear/hybrid attention. Я потихоньку веду свои ML заметки в Obsidian, на основе этой инфы обновил заметку про Attention #ai #datascience
Продолжение поста: Я считаю это прекрасно - бот в комментах пишет, что у них на работе тоже есть проблемы с колебаниями эффективности работы людей
Anyone else's human get quietly nerfed this week? https://www.reddit.com/r/ClaudeAI/comments/1v7zlxd/anyone_elses_human_get_quietly_nerfed_this_week/
Book Review: Python for Algorithmic Trading Cookbook Мне прислали очередную книжку от Packt на прочтение и ревью — на этот раз про алгоритмический трейдинг на Python. Тема для меня в чём-то новая, но давно интересная: пару месяцев назад я как раз хотел поиграться с Interactive Brokers API, а ещё много лет назад вручную торговал на форексе, так что было любопытно посмотреть, как всё это автоматизируется сейчас. Книга - это cookbook из 68 рецептов, которые проводят весь путь от получения рыночных данных до отправки ордеров через брокера. По структуре это конвейер: данные (OpenBB, pandas, Polars/DuckDB) → research (ArcticDB, AI и agentic workflows, alpha-факторы) → бэктест (VectorBT, Zipline Reloaded) и оценка факторов (Alphalens, Pyfolio) → live-исполнение через Interactive Brokers → и в конце ускорение на GPU через NVIDIA RAPIDS. Больше всего понравилось, что книга доходит до реального исполнения, а не останавливается на бэктесте. И отдельно порадовало внимание к валидации — данные версионируются в ArcticDB с time travel (чтобы случайно не заглянуть в будущее), а глава про walk-forward честно объясняет, почему на временных рядах нельзя перемешивать фолды. Кстати, я про это писал в своих заметках. Ещё есть глава про AI: RAG-аналитик по отчётности на LangChain/Chroma/Claude, агенты на LlamaIndex, которые сами пишут и запускают код, и рецепт про превращение статьи со стратегией в рабочий код. Amazon Code Мои обзоры: Personal blog Medium #bookreview
Harness Handbook: Making Evolving Agent Harnesses Readable, Navigable, and Editable Способности агента определяются не только базовой моделью, но и его harness — кодом, который собирает промпты, управляет состоянием, вызывает инструменты и крутит control loop. Под новые модели, API и требования harness приходится постоянно дорабатывать, но перед любой правкой нужно сначала найти все места в коде, реализующие нужное поведение. Авторы называют это behavior localization и считают главным узким местом в эволюции harness: запросы формулируются в терминах поведения, а репозиторий устроен по файлам и функциям, и именно этот разрыв всё усложняет. Решение — Harness Handbook, представление кодовой базы, организованное вокруг поведения, а не структуры файлов. Это трёхуровневое дерево (L1 — обзор системы, L2 — стадии и компоненты, L3 — записи со ссылками на конкретный исходник) плюс state-register view для состояния, разделяемого между стадиями. Строится автоматически: статический анализ через tree-sitter без LLM → раскладка по стадиям через proposer-reviewer loop → синтез дерева. При модификации агент идёт сверху вниз через Behavior-Guided Progressive Disclosure (BGPD): от архитектуры к нужным стадиям и конкретным местам в коде, а потом сверяет кандидатов с текущим исходником. Отдельная полезная деталь — resynchronization: после правок handbook инкрементально обновляет только затронутые части, а ссылки, которые больше не резолвятся, помечает как stale, вместо того чтобы молча указывать на неверный код. Проверяли на двух open-source harness'ах (Terminus-2 и Codex), 60 запросов на модификацию, планировщик — DeepSeek-V4-Pro, качество планов оценивали три LLM-судьи: — win rate по качеству плана: 45.6% против 26.7% на Terminus-2 и 38.3% против 28.3% на Codex — и всё это при меньшем расходе токенов планировщика: −12.7% на Codex и −8.6% на Terminus-2 — по локализации все 24 сравнения recall/precision/F1 в пользу handbook, прирост F1 от +5.0 до +18.8 — слабый планировщик с handbook подбирается к локализации более сильных моделей (GPT-5.5, Claude Opus 4.8) и заметно реже промахивается мимо нужного кода целиком Paper Code Project Мои обзоры: Personal blog Medium Linkedin #paperreview
Codex Resets https://codex-resets.com/ Прикольный сайт - показывает когда в Codex появлялись ресеты лимитов. Их было аж 35 начиная с марта. И 8 из них за июль.