Частные заметки одного лица
описание
Статейки, мысли, заметки @shiryaeff
251
подписчиков
Охват к подписчикам
68,9%
ERR
Реакции к просмотрам
2,21%
160 на 28 постов
Пересылки к просмотрам
0,98%
71
Постов в день
0,3
всего 28
Где отзываются чаще
доля реакций к просмотрам- 18 июл.#Прямая_речь Учитель истории московской гимназии № 1543, заслуженный учитель РФ Леонид Кацва по поводу отказов зачислить школьников в 10-й класс: «Наши школьники привыкли к тому, что можно не учиться и переходить из класса в класс: «тройка» устроит, а «двойку» не поставят, и можно продолжать готовить три предмета. С моей точки зрения, в школах у нас достаточно детей, которые должны заканчивать образование в 9-м классе, если не раньше, и переходить в те учебные заведения, где главное внимание будет уделяться подготовке к профессии. Я никакой трагедии в том, что в 10-й класс стали принимать довольно жестко, не вижу».8,29%
- 2 авг.https://www.youtube.com/watch?v=gC68PawVbAc6,45%
- 2 авг.Всенародная любовь к Дурову* — это очень сильный показатель, какие реальные герои у российского общества. Я убеждена, что попытка системы бороться с Дуровым является выстрелом себе в ногу. В российской культуре всегда была сильна любовь к героям, которые действуют вопреки обстоятельствам. Дуров* идеально вписался в этот архетип. Он не карьерист, не подхалим, пробивающий локтями место у кормушки. Не функция, не приспособленец. Не сильная рука с дубиной и постным недовольным лицом. Он — это личность. Дуров* прав, когда пишет, что еще посмотрим, кто кого сможет заблокировать. Он и телега де факто символизируют триумф интеллекта и свободы над унылым административным ресурсом. И последний проиграет в конечном итоге. Многие во власти это чувствовали, поэтому не пытались в открытую наезжать на фигуру Дурова*, более того, поддержали "нашего мальчика" открыто в 2024 году (над чем сейчас иронизирует половина интернета). Потому что это социально одобряемо и популярно. Дуров* показал личным примером, что богатым и знаменитым можно без связей в Кремле, а благодаря своим мозгам. И кроме того, он показал, что будучи богатым и знаменитым, МОЖНО сохранять свои взгляды, иметь какие-то, возможно экзотические, зато свои собственные воззрения о жизни. Я думаю, многие люди во власти сами знатно офигели объявления его террористом, учитывая то, что это произошло спустя пару дней после заявления Пескова о переговорах с телеграмом. Система уже во всю показывает свою несогласованность, и это хорошо. Ну и отдельно следует понимать, что этим признанием они еще больше девальвируют понятие "террорист". Раньше было "полстраны сидит, полстраны охраняет". Сегодня: полстраны**, полстраны — читают полстраны** в запрещенной социальной сети через VPN. * внесен в перечень террористов ** иноагенты, террористы, аффилированные лица, запрещены на территории РФ5,26%
- 23 июл.Такими новостями уже никого не удивишь, но GPT-5.6 опровергла еще одну известную гипотезу, которая была открыта 30 лет Гипотеза Диница - Гарга - Гоеманса – это теорема из теории графов и сетевых потоков, которая гласит, что из допустимого дробимого решения можно получить целочисленное по маршрутам решение без увеличения стоимости. Подобные утверждения часто становятся основой для практических оптимизационных алгоритмов, поэтому гипотеза важная. Открыта она была с 1999. Решение, к слову, обнаружил математик из Нижнего Тагила, выпускник ВШЭ. Вот чат с моделью. Промптинг на уровне «соверши прорыв», «опровергни общий случай», «продолжай исследовать» – то есть вообще никаких подсказок и даже серьезных инструкций. Сам автор называет чат «чистым мемом». В итоге за несколько итераций и несколько часов модель нашла нужный контрпример. Вот такая математика в 2026.5,26%
- 27 июл.Kimi K3 таки выложили в опенсорc https://huggingface.co/moonshotai/Kimi-K3 И опубликовали отчет. В общем, ничего супер-нового, но несколько интересных вещей отметил: – 2.8T параметров всего, но на каждый токен работает 104B – 16 экспертов из 896. – Контекст 1M, а позиционного кодирования нет вообще. Поэтому огромный контекст для нее вообще детский лепет и памяти на него не надо вагонами завозить. – MXFP4-квантизацию вводят не после обучения, а прямо во время RL. Модель с самого начала учится жить сжатой, то есть серверную стойку можно взять и поменьше :) – Стараются экономно расходовать токены, в том числе в мультимодальности. На BrowseComp лучший результат в мире за $2.03 за задачу. GPT-5.6 Sol вдвое дороже, Клод на максимуме – на порядок Еще из прикольного: – За обучение создали 51 миллион виртуалок-песочниц. Пока модель думает, песочница на паузе и не ест ресурсы вообще – а думает она до 98% времени жизни задачи. Вот на этом простое и сэкономили кучу денег на обучение. – За один 48-часовой автономный прогон K3 спроектировала и проверила прототип чипа для ИИ, вообще с нуля. 4 мм², 8700 токенов/с в RTL-симуляции. Исходники выложили на гитхаб – Написала свой компилятор для ИИ, обгоняет torch.compile – Воспроизвела результат из астрофизики за два часа вместо двух недель: 20+ статей, 300 уравнений состояния, нашла ошибки в опубликованных формулах – Смонтировала видео-ролик про собственную архитектуру из 56 клипов Отдельно про кибербез. Мерились с GLM-5.2. Нашли 16 ранее неизвестных уязвимостей, две в ядре Linux. UK AISI и NIST проверяли независимо: GLM обходит, до фронтира не дотягивает – 0 из 41 на end-to-end эксплойтах. То есть по кибербезопасности модель лучшая из опенсорса. По бенчмаркам всё то же, что и неделю назад: первое место на WebDev Arena среди 99 моделей (впервые открытая модель возглавила лидерборд живых людей). Про дизайн читал до этого статью интересную, как топовые модели сейчас стараются в более лучший дизайн. И я не вижу вообще как тут можно говорить, что это просто "дистилляция fable". Ну и здорово, что поделились вообще всем, как что работает, как дообучали, как песочницы делали, какие библиотеки использовали. То есть повторить и улучшить сможет любая лаборатория. Вау! Но у себя дома стойку под 2.8T, правда, всё ещё надо иметь :) https://github.com/MoonshotAI/Kimi-K3/blob/main/k3_tech_report.pdf4,79%
- 2 авг.https://habr.com/ru/news/1065734/4,49%
- 19 окт. 2025 г.#обозревая_происходящее Что мы имеем сказать про уже завирусившееся видео якобы с посвяги РЭУ им. Плеханова (кто ещё не видел, см. тут, но предупреждаем - 18+)? Да почти ничего. Студенты на то и студенты, чтобы вести себя безбашенно, главное, чтоб без последствий. Самый тот возраст. В наше время (старпер моуд он) бывало и хлеще, чем "телодвижения с агрессивным сексуальным подтекстом" (с) танцы, кстати, вышли убогие. Без обид, зумеры, но это самое нужно не танцевать, а делать (если не получается, идти к доктору, он поможет). Тех, кто возмущается по поводу недостатка скрепности и хочет поиграть роль полиции нравов (о чем окружающие их не просили), отправляем читать пост Марии Сергеевой, которая филигранно сформулировала мысль о всех этих wannabe - моральных камертонах. А ещё наблюдаем с попкорном за реакцией пресс-службы РЭУ, которая выдала в комментах что-то типа "это не наши, мы своих студентов воспитываем в духе любви к Родине, и поэтому на девочек у них стоять не может). Лучше бы молчали, коли ума нет, реально ведь "дискредитация традиционных ценностей" как есть. Интересно, что ещё фееричного брякнут3,61%
- 15 июл.Насколько же сильно меняется работа, когда есть ИИ агенты. Мой коллега, биоинформатик, увидел статью, в которой хитрым образом находят специфичные гены в картошке. Понял, что это может быть полезно для нашего отдела по селекции клубники. Потому что и то, и другое распространяется вегетативно - то есть не через семена, а усы и клубни - они не родня, конечно, но в генетическом плане есть о чем поговорить, так сказать. Он дал эту статью агенту, который вооружен до зубов скиллами нашего собственного приготовления, и поставил задачу воспроизвести методы из статьи на наших данных клубники. Агент прочел работу, скачал с гита код, подтянул наши данные из бд, адаптировал что-то по мелочи, собрал контейнер, создал джобу на кластере и вот оно там бодро считается на нескольких Н100. По сути это задача интерна/джуна - “вот тебе статья, вот данные, через неделю покажешь, не надо плакать, все будет хорошо, соберись уже” Прогресс, как это часто бывает, выглядит немного несправедливо. И это, заметьте, не задачи кодинга, это по сути своей - applied research. Ведь агент не просто пишет код (если вообше пишет), а таскает за собой весь исследовательский контекст, внутреннюю кухню по данным и инфре. До сих пор не верится, что это все настолько хорошо работает. Ощущение, что оно где-то да вот вот зафейлится - но оно раз за разом хорошо отрабатывает. Магия 🤷♂️3,49%
- 23 июл.Kimi K3 взломала Redis, и на это ей потребовалось всего полчаса и 32 агента 27 минут. Ровно столько времени прошло от запуска автономного агента до момента, пока тот нашел уязвимость и довел ее до рабочего эксплойта. Баг оказался уровня RCE и приводил к возможности выполнить код на сервере Redis через уже аутентифицированное подключение. ☕️3,32%
- 14 июл.У меня очень долго были плохие отношения с отпусками: брал редко, между поездками мог пройти год, а отдых был не vacation, а workation сводившийся к смене локации с ответами в рабочие чаты. Сейчас стало лучше: чаще хожу, на работу не отвлекаюсь. Решил разобраться, что об этом говорит наука. Для многих это банальные вещи, но мне мозги прочистило хорошо. Вот основное: 1. Восстановление — это пирамида восстановления, а не редкие события в жизни. Отпуск не чинит плохой режим и work/life balance. Вечера без работы → нормальные выходные → отпуск. Эффект отпуска выветривается за ~3 недели, а будни с нами остаются весь год. 2. Несколько коротких поездок лучше одной длинной. Память не вознаграждает за длительность, а длинный отпуск даёт больший пик, но падает быстрее. При этом годовой объём резать нельзя 1 2. Японцы, к примеру, при 12 днях отпуска реже всех чувствуют нехватку отдыха (опрос Expedia) — предположительно за счёт частых коротких поездок. 3. Планировать отпуск лучше заранее. Предвкушение работает, как отдельный источник счастья. Работает именно конкретика (даты, билеты, жильё), а «летом куда-нибудь». В идеале даже закончить один отпуск и иметь сразу следующий забуканый. 4. Полное отключение от работы — самый важный фактор, второй — физическая активность. «Только гляну почту» не даёт частичный отдых, а подтачивает механизм целиком — работа из отпуска ухудшает самочувствие после него. А вот популярное «смена деятельности = отдых» не работает: освоение новых навыков в отпуске значимого эффекта на восстановление не даёт. Трудоголикам тяжелее отключиться — им нужен отпуск длиннее и связь с работой, недоступная физически. 5. Отпуск не нужно превращать в проект с жестким расписанием досуга. Это делает его похожим на работу. Работает скелет: жильё, переезды, 1–2 якоря на день (локация, рестики, музеи и тд). Остальное оставлять пустотой, которую не надо оптимизировать. 6. Память о поездке определяется отсутствием провалов, а не яркими пиками. Часто людям кажется, что, воспоминание держится на ярком финале, но на многодневных событиях правило не работает: оценку определяет среднее по всем дням, а провалы весят больше пиков. К концу поездки настроение естественно снижается — тем важнее не ставить в конец какой-нибудь логистический ад, ибо испортит воспоминание сильнее, чем компенсирует любой вау эффект. 7. Нужен буфер с обеих концов отпуска. Перед вылетом — день свободы между работой и поездкой. Предотпускная неделя — пик стресса, иначе первые дни уйдут на разгрузку того, что привез с собой в поездку. При смене часовых поясов первые 1–2 дня — не для требовательных планов. После отпуска же требуется протекция первой недели, ибо эффект сгорает не от того, как прошёл отдых, а от того, во что человек возвращается. Оптимально: прилёт за день до выхода, первые 2–3 дня без встреч (ставить блокеры в календарь еще до отъезда), без дедлайнов на первую неделю. 8. Поездку стоит переработать в память. Возвращение к позитивному опыту — работающая интервенция. У меня, к примеру, это обработка фотографий с отпуска в лайтруме, к которой я периодически возращаюсь после поездки.2,97%
- 20 июл.Fable 5 опровергла известную гипотезу Якобиана Она формулируется так: если у полиномиального отображения постоянный ненулевой якобиан, то у него должен существовать полиномиальный обратный. Надо понимать, что это не очередная узкая проблема математки, а буквально центральный вопрос обратимости полиномиального отображения, который с 30-х годов прошлого века оброс кучей литературы и споров. До сегодняшнего дня были доказаны только некоторые частные случаи. Найденный Fable пример гипотезу окончательно опровергает. О решении объявили математики Levent Alpöge и Akhil Mathew, его уже проверили в автоматических верификаторах и подтвердили некоторые независимые математики. Math is solved?2,90%
- 28 июл.Топовые опенсорсные модели достигли запредельного уровня, в куче бенчмарков сравнимы с коммерческими фронтир моделями. Сейчас узкое место для взрывного роста доступного интеллекта — это домашние девайсы для инференса таких моделей, чтобы у каждого был свой "бесплатный" аналог Claude Code и не было бы финансово страшно жечь кучу токенов на OpenClaw-подобные эксперименты. Kimi K3: Open Frontier Intelligence Kimi Team Статья: https://github.com/MoonshotAI/Kimi-K3/blob/main/k3_tech_report.pdf Блог: https://www.kimi.com/blog/kimi-k3 Ревью: https://arxiviq.substack.com/p/kimi-k3-open-frontier-intelligence Код: https://github.com/MoonshotAI/Kimi-K3 Модель: https://huggingface.co/moonshotai/Kimi-K3 # TL;DR ЧТО сделали: Команда Kimi представила Kimi K3 — открытую мультимодальную модель типа Mixture-of-Experts (MoE) на 2.8 триллиона общих параметров и 104 миллиарда активируемых параметров на токен, поддерживающую контекстное окно в 1 миллион токенов. Модель сочетает гибридное внимание Kimi Delta Attention и Gated Multi-Head Latent Attention в пропорции 3:1, межуровневые связи Block Attention Residuals по глубине, а также Stable LatentMoE с 896 роутируемыми экспертами. Кроме того, Kimi K3 содержит энкодер изображений, обученный с нуля через предсказание следующего токена, и использует мульти-уровневое обучение с подкреплением (RL), дистиллированное из общего, агентного и кодерского доменов. ПОЧЕМУ это важно: Пока опенсорс-сообщество активно развивало масштабирование рассуждений на инференсе, размер открытых базовых моделей застрял в районе 1 триллиона параметров, увеличивая отставание от закрытых SOTA-систем. Kimi K3 доказывает, что одновременное масштабирование параметров до 3T-класса и агентного RL на контексте в 1M токенов даёт прирост эффективности предобучения в 2.5 раза по сравнению с Kimi K2 (https://arxiv.org/abs/2507.20534), создавая полноценную открытую альтернативу закрытым флагманам вроде Claude Fable 5 и GPT-5.6 Sol. Для практиков: Kimi K3 совершает сильный рывок в возможностях открытых моделей за счёт параллельного масштабирования архитектуры и RL. Инженерам и техническим лидерам это даёт готовое к продакшену решение передового уровня с рекордной экономичностью на задачах разработки ПО, сложной работы с инструментами и мультимодальных пайплайнах. Выложив веса на 2.8T и сопутствующие библиотеки, авторы снабдили сообщество инфраструктурой для развёртки сверхбольших архитектур без вспомогательных функций потерь (auxiliary loss) и с микро-ВМ средами для оценки агентов. Подробности и картинки тут: https://t.me/gonzo_ML_podcasts/46432,67%