tgindex
EdTech, AI и HighLoad | Блог AK из Школково

EdTech, AI и HighLoad | Блог AK из Школково

Статистика

CEO ZeroAgency, руководитель разработки онлайн-платформы Школково. Пишу про IT, AI и HighLoad разработку. Личный блог: @daily_ak YT: youtube.com/@segfault_11 Контакт для связи: @bethrezen

Последний пост
14 авг.
Последнее чтение
08:07
Постов за неделю
6
Всего постов
28
Тип
открытый
Язык
русский
Категория
Блоги
В каталоге с
14 авг.
Подписчики
825
−2 за 2 дн.
Сутки
−4
−0,48%
Неделя
 
Месяц
 
Просмотров на пост
940
28 постов
Вовлечённость
113,9%
к подписчикам
Постов в день
0,9
всего 28
Упоминаний
2
каналов
Охват размещения
оценка
1/24сутки в ленте
273
1/48двое суток
312
1/72трое суток
337

Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.

Посты

  • Кстати, Qwen3.8-27B не просто хороший релиз, но и показатель, куда движется опенсорс. Это не только хороший качественный RL и post-training. Лично для меня самое знаковое, это что в 3.8 появился официальный reasoning_effort={low, medium, xhigh}, причём с xhigh default. Также по сравнению с Qwen3.6-27B, где output рекомендовали выставлять в 32768 tok для обычных задач и 81920 для сложных - в 3.8 уже прямо говорят про 262144 ток. Т.е. фокус на агентов не просто с контролем "а сколько думать", но и действительно чтобы они выдавали как можно больше полезного контента. Конечно же, старые добрые chat_template_kwargs с enable_thinking и preserve_thinking из чат-шаблона не выкинули, так что не забывайте про эти параметры тоже. Ну и сразу вангую, что одним из следующих небольших направлений развития будет не просто привычное сжатие контекста, а сжатие того самого ризонинга на предыдущих шагах - либо просто как обычный compact, либо более хитрые схемы с эмбеддингами/memory/прочими трюками. Кмк, это логичное развитие в сторону решения cost/gpu проблем.

  • видео или голосовое, без подписи

  • видео или голосовое, без подписи

  • видео или голосовое, без подписи

  • видео или голосовое, без подписи

  • Qwen выпустили Qwen3.8-27B — и это неожиданно большой скачок относительно Qwen3.6-27B 🚀 Это всё ещё dense-модель на 27B параметров, но прирост особенно заметен не на классических knowledge-бенчмарках, а на реальных coding-, agentic- и multimodal-задачах. Несколько примеров Qwen3.8-27B → против Qwen3.6-27B: • Terminal Bench 2.1: 63.4 → 73.0 • SWE-bench Pro: 53.5 → 61.7 • DeepSWE 1.1: 13.3 → 42.2 — более чем ×3 • QwenSWEBench: 49.3 → 79.0 • Agents' Last Exam Pass@1: 10.6 → 20.4 • HLE: 24.0 → 30.8 • LiveCodeBench v6: 83.9 → 90.3 Но самый интересный скачок, кажется, произошёл в мультимодальных агентах: • OSWorld: 63.9 → 84.3 • WebArena: 48.8 → 64.8 • RecreationBench: 29.8 → 47.1 • SWE-MM: 25.7 → 38.6 • Vision2Web: 45.0 → 62.9 • BabyVision: 28.9 → 65.7 Причём на некоторых тестах локальная open-weight 27B уже оказывается на уровне или выше гораздо более крупных закрытых моделей из сравнительной таблицы самого Qwen. По архитектуре всё как и у qwen3.6-27b - это 64 слоя, d_model=5120, гибрид Gated DeltaNet + Gated Attention, FFN 17,408, multi-step MTP и нативный контекст 262K с возможностью расширения до 1M. Что особенно интересно: на GPQA прирост всего 87.8 → 89.2, зато на длинных агентских задачах местами +50–200%. Похоже, основной прогресс поколения 3.8 — уже не просто «модель стала немного умнее», а существенно лучше научилась долго планировать, пользоваться окружением, писать и исправлять код и доводить сложные задачи до конца. На картинках ниже собрал все опубликованные Qwen метрики, сравнил с Qwen3.6-27B и, где возможно, с Qwen3.6-35B-A3B, плюс добавил Qwen3.7-Plus, Muse Glimmer-30B и Opus4.6 Max. Очень мощный релиз для 27B. Вот мы и определились, на базе чего будем тюнить мультимодалки ^_^ Для скорости пока что всё ещё юзаем Qwen3.6-35B-A3B, а для качественных задач новый фаворит! 🤗 Веса на HF: bf16 | fp8 | gguf На openrouter пока что нет, но уже появилось в API на NeuralDeep.ru

  • Почему мне так смешно... 😂

  • 🤖 AI-бот сделал ревью кода. GitLab прислал письмо об этом. Gemini в gmail сделал AI Overview. ... What's next? PS: ревью кажется тупорылым, потому что это тестовое ревью на тестовом репозитории, так что всё норм на самом деле - это просто PoC

  • Навайбкодил тут давно статус-лайн с контекстом, затратами, лимитами и прочим. Работает на Claude Code и Codex. Кому надо - берите, форкайте/юзайте https://github.com/bethrezen/status-line

  • 8 июл.1 1175215

    Я научил собаку вайбкодить. А чего добился ты?

  • 16 июн.1 198311

    🔥 Бомбическое преимущество Vision LLM для простых рутинных задач Предыстория В прошлом году я уже занимался оцифровкой разбалловки результатов учеников для разработки модели предсказания баллов и рекомендательной системы. Тогда я тоже запилил простой интерфейс и ручками вбивал все эти данные, потому что по-нормальному и быстро автоматизировать это тогда не удалось, а датасет для трейна нужен был срочно. Из данных я тогда выкинул те, где дети не указали свой тестовый балл в отдельном поле. Ну и понятное дело, очень много результатов, где 10 шакалов из 10, оцифровать не удалось. Наши дни Наколеночное решение из поста выше помогло добавить примерно ещё треть к датасету. Это результаты, где не проставлен был балл или разбалловка трудно читалась из-за качества картинки(см. скрин, да-да, в таком качестве прислали результаты...). +34% к объёму трейн данных - это на самом деле очень ощутимо и круто! Да, есть риск, что нейронка криво распознала цифры на изображении. Но этот риск снимается прогоном предыдущей модели предсказания баллов по этому юзеру. Если распознавание Vision совпадает с предсказанием модели - значит всё распознано верно и историю этого пользователя можно спокойно добавлять в датасет обучения новой модельки. Такие дела ^_^

  • Простое и очевидное решение на коленке, которое сберегло мои нервы. Дано: тысячи результатов экзаменов учащихся в виде картинок Задача: оцифровать разбалловку и провалидировать данные Основная проблема в том, что дети присылают скриншоты результатов максимально странным образом. Плюс есть ещё куча разных сайтов, где эти результаты в разных форматах отображаются. Это в этом году мы додумались просить детей забивать эти данные самим в форме. А в прошлые года вот что-то не догадались... Ну ничего, сейчас бы с ллмкой быстро всё оцифруем как надо. Решение: прогоняем через LLM с Vision. В результате большая часть данных нуждается только в быстрой проверке и нажатии на Enter.

  • 2 июн.1 7144824

    🖤 Zero Fest, он же "Ноль фест" в Тамбове 1 августа. Раньше был "Рок над Студенцом", но по определенным причинам он не смог продолжиться в прежнем формате. Поэтому я решил вписаться в этот движ со своей компанией и помочь ребятам. Ну и теперь это "Ноль фест". В этом году будут не только местные артисты, но и гости из Санкт-Петербурга. DenDerty, которые выступали у нас на корпоративе в прошлом году, Молодость Внутри и Вася Васин из группы "Кирпичи". Для нашего города это уникальное мероприятие, которое всем советую обязательно посетить! Билеты по ссылке: vk.cc/cYe5vi

  • 28 мая3 9182775

    🎮 Самый неоднозначный девайс NVIDIA Брал я тут в марте 7шт. DGX Spark. Очень хотелось попробовать этот девайс давно - ещё со старта хотел его купить. Но появляться по вменяемым ценам они начали только сейчас. NVIDIA обещала крутую производительность в FP4. Но что мы имеем по факту? 1. Очень медленную unified memory LPDDR5x. 2. Коробки очень горячие и уходят в троттлинг. Temperature cap стоит где-то на 70C. 3. DGX Spark инференсит Qwen3.6-35B-A3B в NVFP4 со спекулятивным декодингом DFlash со скоростью 100-200 tok/s. на оптимизированном VLLM с кастомными ядрами под GB10. Соответственно ШЕСТЬ DGX Spark в реальности у меня дают 700-1500 tok/s. Для сравнения - ОДИН GPU RTX Pro 6000 Blackwell Workstation даёт 1000-1200 tok/s. Нагрузка 1-в-1 одинаковая. Простая математика RTX Pro 6000 Blackwell стоит примерно 1-1.1M руб. DGX Spark стоит ~500к руб. 6x DGX Spark = 3M руб. и это в лучшем случае 1500 tok/s, но 768GB памяти на скорости 273 GB/s. Рабочая станция с 2x RTX Pro 6000 Blackwell - те же 3M руб.(дада, можно и дешевле) и 2200 tok/s, а это всего лишь 192GB VRAM на скорости 1792 GB/s. И это я ещё не говорю про то, как в реальности работают все эти кольца из 200Gbit/s линков между тремя спарками. Спойлер: плохо. Выводы DGX Spark проигрывают примерно везде и по всем фронтам. Обещания NVIDIA - пустой маркетинг. Коробки вообще никому не рекомендую даже для экспериментов, даже с QLoRa. Для трейна не годится. Для инференса - тоже. Лучше за те же деньги собрать ПК с игровой видеокартой. Единственное годное применение - тихий локальный AI-ассистент для дома. Вот только вопрос - сколько он прослужит с такими рабочими температурами.

  • 20 мая1 039403

    На самом деле никакой нейронки нет 😂

  • 20 мая1 02213

    видео или голосовое, без подписи

  • 20 мая1 10613

    видео или голосовое, без подписи

  • 20 мая1 0103813

    Вот мы и выкатили бесплатную ИИ-проверку сочинений ЕГЭ по русскому языку для участников Щелчка. Некоторые функции мы специально пока что скрыли, чтобы не перегружать детей перед экзаменами. Но вообще моделька очень интересно рассуждает - этими ризонингами можно зачитываться до бесконечности. Если есть какие-нибудь вопросы - задавайте в комментариях. На что-то отвечу сразу, что-то приберегу для стрима и отвечу там. Ура! Работаем дальше 💪 На очереди ИИ-бот для выпускников 📱

  • видео или голосовое, без подписи

  • 20 мая849193из TatiashkaEGE

    БУДУЩЕЕ НАСТАЛО! ИИ ПРОВЕРИТ ТЕБЕ БЕСПЛАТНО СОЧИНЕНИЯ ПЕРЕД ЕГЭ! Твои работы будет оценивать искусственный интеллект, обученный на проверках реальных экспертов с реального ЕГЭ. Уровень строгости будет соответствовать экзамену: без перегибов и без чрезмерной лояльности. При проверке ты получишь итоговый балл и разбалловку по всем критериям, тоже как на экзамене. Также в работе будут отмечены те места, на которые ИИ обратил внимание при проверке. Но это не значит, что он обязательно снял балл в этом месте 📒 🚩 Как и в реальной проверке, возможны небольшие расхождения и неточности — эксперты на экзамене тоже не могут оценивать работы одинаково. В этом смысле ИИ также ведёт себя очень похоже на живого проверяющего Эта проверка поможет тебе увидеть свой текущий уровень и понять, на что стоит обратить внимание 💫 Это бонус Щелчка. Но не забывайте: если у тебя есть платный курс, то ты можешь сдавать сочинения на экспертную проверку экспертам-людям на платформе (сейчас есть 3 пробника) 🔥 ГДЕ НАЙТИ БЕСПЛАТНУЮ ПРОВЕРКУ ОТ ИИ? Открываем меню БОБРа и выбираем «Проверка сочинений» ❕❕ Обратите внимание: пока тебе доступно 4 проверки перед ЕГЭ. Этого достаточно, чтобы проверить себя перед экзаменом. Можно сдавать в печатном виде по 1 сочинению в день.

EdTech, AI и HighLoad | Блог AK из Школково — tgindex