Машинное обучение RU
описание
Все о машинном обучении админ - @workakkk @data_analysis_ml - анализ даннных @ai_machinelearning_big_data - Machine learning @itchannels_telegram -лучшие ит-каналы @pythonl - Python @pythonlbooks- python 📚 @datascienceiot - 📚 РКН: clck.ru/3FmrUw
18 117
подписчиков
Охват к подписчикам
8,6%
ERR
Реакции к просмотрам
0,50%
503 на 50 постов
Пересылки к просмотрам
2,12%
2 136
Постов в день
1,4
всего 86
Где отзываются чаще
доля реакций к просмотрам- 13 авг.без подписи1,87%
- 1 авг.без подписи1,87%
- 29 июл.без подписи1,71%
- 3 авг.⚡️ Alibaba в презентации Qwen3.8 в открыто троллит США и бросает им вызов? В проморолике модель часами работает над проектированием чипов, а затем переходит к задачам из биологии. Выбор выглядит намеренным: полупроводники остаются одним из самых болезненных направлений для Китая, а США продолжают ограничивать поставки передовых ускорителей и оборудования для их производства. Китай намерен закрывать критические технологические пробелы собственными моделями, вычислительной инфраструктурой и чипами. Сцены с белками можно воспринимать как намёк на AlphaFold и амбицию конкурировать с американскими компаниями уже на уровне научных открытий. @ai_machinelearning_big_data #qwen1,17%
- 8 окт. 2025 г.🧩 Новая архитектура нейросетей от Samsung: Tiny Recursive Model (TRM) - обошла DeepSeek-R1, Gemini 2.5 Pro и o3-mini в задачах рассуждения ARC-AGI 1 и ARC-AGI 2. ✔️ Размер модели - всего 7 миллионов параметров и около 1000 обучающих примеров. Это меньше в 10 000 раз, чем у современных LLM, но результат лучше. Как работает TRM: 1️⃣ Черновой ответ: модель сразу формирует быстрый набросок решения, а не пишет его по словам. 2️⃣ Скрачпад: создаёт внутреннее пространство для логики и промежуточных рассуждений. 3️⃣ Самокритика: многократно (6 раз) проверяет свои рассуждения, уточняя и исправляя ошибки. 4️⃣ Переписывание: на основе улучшённой логики создаёт новую, более точную версию ответа. 5️⃣ Цикличность: повторяет процесс до 16 раз, пока не достигнет уверенного, логически цельного решения. 💡 Чем интересна модель: - Меньше затрат на вычисления, а результат выше; высокая эффективность при низких издержках. - Доказательство того, что собственная логика и архитектура могут быть сильнее простого размера модели. Можно коротко описать ее: «думай, прежде чем действовать». - Мощные рассуждающие системы становятся доступными даже без огромных кластеров, модель можно запускать на ограниченных ресурсах. Это не просто «компактаная LLM», это другой способ мышления: модель, которая действительно *думает, прежде чем говорить*. 🟠Статья: https://arxiv.org/abs/2510.04871v1 🟠Github: https://github.com/SamsungSAILMontreal/TinyRecursiveModels @ai_machinelearning_big_data #TinyRecursiveModels #TRM #DeepLearning #NeuralNetworks0,93%
- 30 июл.🤯 OPUS 5 ЗА 10 МИНУТ УДАЛИЛ ВСЮ БАЗУ ДАННЫХ, А ПОТОМ ВЕЖЛИВО ПРИЗНАЛ ОШИБКУ Пользователь Reddit решил протестировать Claude Code. После одного запроса агент уничтожил базу проекта и сообщил: «Это моя вина, и я должен немедленно вам об этом сказать». Позже Gemini 3.6 помог восстановить 96 страниц, ещё 21 пришлось пересоздавать. Автор уточнил, что это был тестовый проект с небольшим числом пользователей, поэтому последствия оказались не критичными. Самое показательное: модель получила режим Always Allow, доступ к данным и возможность выполнять разрушительные команды без подтверждения. Историяпро разработчика, который дал автономному агенту права администратора без нормальных бэкапов и ограничений. ИИ-агенту в проде нужны минимальные права, отдельное окружение, снапшоты и ручное подтверждение любых DROP, DELETE и миграций. Иначе вайб-кодинг быстро превращается в вайб-восстановление базы. https://www.reddit.com/r/Anthropic/comments/1v9iurd/and_just_like_that_opus_5_ultracode_wipes_the/?solution=44899d8f83b98cbf44899d8f83b98cbf&js_challenge=1&token=7afd7253fec22262ff1c52b1703fe9ec98100ded527c5fb6747eed7511fb37a6&jsc_orig_r=0,92%
- 3 авг.Текущая ситуация с ИИ🇨🇳0,85%
- 15 авг.💸 Дешёвый токен ещё не значит дешёвую модель. По исследованию AlphaSense, Kimi может стоить заметно дешевле GPT-5.6 Sol за токен, но обходиться дороже за один завершённый вопрос. Причина простая: модель тратит больше токенов на сбор контекста, повторный retrieval и длинные цепочки перед тем, как добраться до полезного ответа. Реальная формула стоимости выглядит так: цена токена × количество токенов до завершения задачи И здесь более дорогая модель может оказаться выгоднее, если она быстрее находит нужные данные, вовремя останавливается и работает с меньшим контекстом. В многошаговых агентах это особенно критично: лишний retrieval на первом этапе раздувает контекст на всех следующих шагах. AlphaSense пишет, что только изменение retrieval-пайплайна вокруг той же модели дало примерно 3× снижение стоимости. Поэтому экономика AI всё сильнее зависит не от прайса API, а от retrieval, routing и evaluation вокруг самой модели. https://www.alpha-sense.com/resources/product-articles/frontier-ai-models-context/0,85%
- 14 авг.🚀 Вышла dots3-note preview - открытая MoE-модель с прицелом на долгоживущих AI-агентов. Внутри 280B параметров, из которых активны 16B, контекст 512K и мультимодальность: текст, изображения и аудио. Главная фишка - TEMPO, новый подход к RL для обучения агентов на длинных задачах. Модель учится критиковать собственные действия, оценивать промежуточные решения и лучше работать там, где одной попытки недостаточно. dots3-note умеет исследовать незнакомые среды, обновлять память по ходу работы, использовать код и инструменты и связывать всё это с мультимодальным восприятием. Авторы утверждают, что модель конкурентоспособна с гораздо более крупными системами в reasoning, agentic и multimodal-бенчмарках. Весы уже открыты на Hugging Face. Вместе с моделью команда выпустила два новых бенчмарка для «реальных» агентов - VibeSearchBench и VibeLifeBench. Tech blog: https://studio.dots.ai/dots/dots3-en.html Weights: https://huggingface.co/dots-studio/dots3-note-prev GitHub: https://github.com/studio-dots-ai/dots3-note-prev0,81%
- 9 авг.⚡️ PDF-пайплайны не должны начинаться с OCR. pdf-inspector - локальный инструмент на Rust, который сначала пытается понять, что вообще находится внутри PDF, и только потом решает, какие страницы действительно требуют тяжёлой обработки. Что он делает: - классифицирует PDF; - извлекает структурированный Markdown там, где это возможно; - определяет страницы, которые нельзя нормально разобрать обычным способом; - отправляет на OCR только проблемные страницы. Главная идея - не прогонять через OCR весь документ по умолчанию. На fast path здесь нет: - LLM; - внешних API; - SaaS; - сетевых зависимостей. Это особенно полезно для больших PDF-пайплайнов, где OCR обычно становится самым дорогим и медленным этапом. Вместо: PDF → OCR всех страниц → парсинг получаем: PDF → классификация → native extraction → OCR только сложных страниц Меньше вычислений, ниже latency и проще контролировать приватность данных. 🔗 github.com/firecrawl/pdf-inspector #Rust #PDF #OCR #OpenSource #DataEngineering0,78%
- 12:56🔥 Qwen3.8 27B уже «раздели» от большей части встроенных отказов и подготовили для локального запуска Huihui-Qwen3.8-27B-abliterated — модифицированная версия Qwen3.8-27B, где через abliteration заметно ослабили safety-фильтры и склонность модели отказываться от запросов. Авторы прямо называют реализацию экспериментальной. Теперь выложены все GGUF-квантизации, так что модель можно запускать через llama.cpp, LM Studio и совместимые инструменты. Отдельно появились готовые версии для Ollama. Для Ollama достаточно: ollama run huihui_ai/Qwen3.8-abliterated Модель также можно протестировать прямо на Hugging Face, а в обсуждениях уже появились пользовательские тесты с довольно сильными результатами после abliteration. При этом сами авторы предупреждают: фильтрация существенно снижена, поэтому модель лучше использовать для исследований и локальных экспериментов, а не без дополнительного контроля в публичном продакшене. Hugging Face: huggingface.co/huihui-ai/Huihui-Qwen3.8-27B-abliterated0,76%
- 4 авг.🔥 JetBrains открыла исходники KotlinLLM - Kotlin-код, который дописывает себя во время выполнения KotlinLLM - исследовательский плагин для IntelliJ IDEA, который позволяет делегировать часть логики приложения LLM прямо во время запуска. Пример: val apiUrl: String = asLlm( "JetBrains/kotlin", hint = "Верни URL для GitHub Issues API" ) val service: GithubService = mockLlm() Когда приложение сталкивается с новым сценарием, плагин: 1. получает runtime-значения и типы; 2. просит LLM сгенерировать обновление; 3. компилирует новый код; 4. горячо перезагружает класс; 5. повторно выполняет исходный вызов. Главная идея - модель не вызывается постоянно. Успешное решение сохраняется как обычный Kotlin-файл, который можно проверить, изменить, закоммитить и запускать дальше уже без LLM. Сейчас доступны два основных механизма: - asLlm<F, T>() - преобразует значение одного типа в другой; - mockLlm<T>() - генерирует реализацию интерфейса и развивает её по мере появления новых сценариев. Пока это исследовательский прототип для Kotlin/JVM. Проект распространяется по лицензии Apache 2.0. GitHub: https://github.com/JetBrains-Research/kotlinllm-plugin @javatg0,71%