SQL и Анализ данных
СтатистикаБазы данных и всё, что с ними связано! Сотрудничество: @haarrp РКН № 6766085482
- Последний пост
- 12:35
- Последнее чтение
- 16:54
- Постов за неделю
- 5
- Всего постов
- 37
- Тип
- открытый
- Язык
- русский
- В каталоге с
- 12 авг.
- 1/24сутки в ленте
- 1 279
- 1/48двое суток
- 1 465
- 1/72трое суток
- 1 580
Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.
Посты
⚡️ Harness Engineering - полный курс на русском Как заставить AI-агента писать код надёжно. Не «какую модель выбрать», а как спроектировать вокруг неё рабочую систему: инструкции, инструменты, среду, состояние и верификацию. Курс - от нуля до продвинутых тем: теоретическая база из 11 блоков, 14 модулей, 8 практических проектов, 14 лабораторных работ, диагностический протокол «как починить агента», библиотека готовых шаблонов, карта инструментов, 40 приёмов и каталог антипаттернов. Главный тезис курса: способность модели и надёжность исполнения - это две разные вещи. Одна и та же модель в «голой» среде и в среде с продуманным harness даёт качественно разные результаты. Апгрейд модели - это самый дорогой и обычно не самый эффективный способ починить агента. https://github.com/justxor/Harness_ru
🔥 9B-модель на 7 ГБ, которая по тестам автора лезет на территорию 27B На Hugging Face вышла Qwen3.5-9B The Defiant Fable от DavidAU. Это многоэтапный fine-tune Qwen3.5-9B с упором на reasoning, instruction following, код и creative-задачи. Модель распространяется под Apache 2.0, а автор также позиционирует её как uncensored/heretic-версию с минимальными отказами. Самое интересное в результатах. По собственному набору из семи бенчмарков автор заявляет, что 9B-версия обходит базовые Qwen3.5-9B, Qwen3.5-27B и Qwen3.6-35B-A3B, а местами приближается к Qwen3.6-27B. Причём сильные результаты сохраняются даже после 4-bit квантования. Это пока именно авторские тесты, а не независимый leaderboard. Для локального запуска уже готовы обычные и MTP GGUF с NEO IMATRIX. Q4_K_M занимает примерно 6,8-7 ГБ, IQ3_M около 5,6 ГБ, а экстремальный IQ2_M всего 4,94 ГБ. Контекст у базовой архитектуры до 262K токенов. Запускать можно через llama.cpp, Ollama, LM Studio, vLLM и другие локальные рантаймы, а через llama.cpp сразу поднимается OpenAI-compatible API. Если независимые тесты подтвердят цифры, это хороший пример того, насколько далеко сейчас можно вытянуть маленькую 9B-модель правильным fine-tuning, merge и квантованием. https://huggingface.co/DavidAU/Qwen3.5-9B-The-Defiant-Fable-Uncensored-Heretic-NEO-IMATRIX-MAX-MTP-GGUF #AI #Qwen #LLM #LocalAI #GGUF
🛡️ Uber открыла ADR - систему защиты для корпоративных AI-агентов. ADR расшифровывается как Agentic AI Detection and Response. Проект уже используется внутри Uber и предназначен для наблюдаемости, тестирования безопасности и обнаружения угроз в агентных системах. Что умеет ADR: - собирает телеметрию от AI coding agents; - отслеживает действия агентов и вызовы инструментов; - помогает находить подозрительное поведение; - позволяет строить security monitoring вокруг автономных агентов; - включает инструменты для security benchmarking и threat detection. - Особенно интересно, что ADR смотрит на AI-агента уже не как на обычное приложение, а как на отдельного участника инфраструктуры, за действиями которого нужно постоянно следить. Похоже, рядом с EDR для компьютеров и серверов появляется новый класс инструментов - EDR, но уже для автономных AI-агентов. GitHub: https://github.com/uber/ADR #AI #AIAgents #Cybersecurity #Uber #OpenSource
видео или голосовое, без подписи
🎓 Если вы планируете поступать в ШАД в 2027 году, сейчас можно присоединиться к текущему потоку ShadHelper. Мы больше 6 лет готовим к ШАД и ML-магистратурам. Среди преподавателей - специалисты из Сбера, МГУ и МФТИ; 120+ выпускников уже поступили в ШАД и ML-магистратуры. Курс рассчитан на системную подготовку за год: математика, теория вероятностей, дискретная математика и алгоритмы, регулярная практика, домашние задания с обратной связью, поддержка в чате и пробные экзамены. Поток уже идёт, и сейчас начинается основная часть программы - ключевые темы вступительных экзаменов. Присоединиться к текущей группе можно до 24 августа. Если пока не готовы принимать решение сразу, оставьте заявку: откроем материалы первой недели курса и договоримся о 15-минутной консультации с академическим куратором. Вы посмотрите, как устроена программа, и сможете задать вопросы по подготовке и входу в текущий поток. 👉 Посмотреть программу и условия
⚡️ QueryTuner - open-source инструмент, который разбирает SQL-запрос и показывает, почему он может тормозить. Подключаться к базе вообще не обязательно. Можно просто вставить SQL и получить диагностику. Поддерживаются сразу 5 диалектов: - PostgreSQL - MySQL - Oracle - SQL Server - SQLite Внутри два уровня анализа. 1. Детерминированный heuristic engine Он мгновенно ищет типичные anti-patterns: - SELECT * - функции внутри WHERE - leading wildcard в LIKE - потенциально отсутствующие индексы - ORDER BY без ограничения результата - другие проблемы производительности Сейчас заявлено 12 правил, и для них не нужны ни LLM, ни внешний API. 2. Опциональный AI-слой Можно подключить Qwen через Hugging Face или OpenAI. Тогда QueryTuner умеет: - объяснять проблему человеческим языком; - переписывать запрос; - предлагать CREATE INDEX; - объяснять, зачем конкретный индекс нужен. Особенно интересно, что можно передать ещё и CREATE TABLE DDL. Тогда рекомендации становятся schema-aware: инструмент видит реальные таблицы, колонки и существующие индексы. Например, для такого запроса: SELECT * FROM orders WHERE YEAR(created_at) = 2026; Хороший проект для тех случаев, когда SQL уже работает, но хочется понять, почему через полгода он начнёт работать плохо. #SQL #PostgreSQL #Database #OpenSource #DataEngineering https://github.com/AutoShiftOps/querytuner
💡 SQL-трюк: сравнивайте `NULL` без костылей В PostgreSQL обычное сравнение может неожиданно сломать условие: SELECT NULL = NULL; Результат: NULL Потому что NULL означает «неизвестное значение», а не конкретное значение. Из-за этого часто пишут громоздкие условия: WHERE a = b OR (a IS NULL AND b IS NULL) Но есть оператор, о котором многие забывают: a IS NOT DISTINCT FROM b Он работает как NULL-safe equality: SELECT NULL IS NOT DISTINCT FROM NULL; -- true SELECT 10 IS NOT DISTINCT FROM 10; -- true SELECT 10 IS NOT DISTINCT FROM NULL; -- false Есть и обратный вариант: a IS DISTINCT FROM b Например, удобно искать реально изменившиеся значения: SELECT * FROM old_data o JOIN new_data n USING (id) WHERE o.email IS DISTINCT FROM n.email; Если оба email = NULL, строка не считается изменённой. Без этого обычное: o.email <> n.email может просто вернуть NULL и пропустить изменение. Особенно полезно при синхронизации данных, аудите изменений, ETL и UPSERT-логике. #SQL #PostgreSQL #Database
Единственные соседние степени во всей математике Числа 8 и 9 выглядят обычно, но их соседство уникально: 2³ = 8 3² = 9 Это единственная пара степеней натуральных чисел больше 1, которые отличаются ровно на единицу. Иными словами, уравнение xᵖ - yᑫ = 1 при x, y, p, q > 1 имеет только одно решение: 3² - 2³ = 1 Эжен Каталан сформулировал эту гипотезу в 1844 году. Доказать её смогли лишь спустя более 150 лет: в 2002 году это сделал математик Преда Михэйлеску. Сегодня результат известен как теорема Михэйлеску. Простое утверждение оказалось настолько глубоким, что для доказательства понадобились современные методы алгебраической теории чисел.
⚡️ Программистов пытаются отменить уже больше 60 лет COBOL создавали так, чтобы код могли писать менеджеры. SQL называли «структурированным английским». Затем появились 4GL, UML, low-code и no-code. Каждый раз индустрия обещала программирование без программистов — и каждый раз получала новые специализации. Теперь ту же роль играют LLM и вайбкодинг. Проблема упирается в естественный язык. Фраза «удали файлы старше 30 дней» сразу порождает вопросы: учитывать дату создания или изменения, трогать ли подпапки, скрытые файлы и симлинки? Чем сложнее система, тем опаснее такие умолчания. Кто-то всё равно должен уточнить требования, проверить результат и отвечать за прод. ИИ убирает бойлерплейт и ускоряет написание кода. Ценность разработчика смещается в архитектуру, доменную логику, безопасность и контроль. Профессия не исчезает. Она снова меняет название. Статья: https://habr.com/ru/articles/1058500/
видео или голосовое, без подписи
📌 Oracle сократила 21 000 сотрудников и теперь может получить счёт на $7 млрд из-за ИИ За финансовый 2026 год штат Oracle сократился примерно на 21 000 человек, или на 13%. Компания прямо указала, что внедрение ИИ стало одним из факторов сокращений. Параллельно Oracle строит гигантскую ИИ-инфраструктуру для OpenAI. Один из проектов - дата-центр в Висконсине мощностью около 1 ГВт, связанный с контрактом OpenAI и Oracle на $300 млрд. Регуляторы Висконсина требуют от крупных дата-центров с недостаточно высоким кредитным рейтингом финансовые гарантии, чтобы расходы на электростанции и сети не легли на обычных потребителей. После снижения рейтинга Oracle до BBB-, компания может попасть под требование предоставить более $7 млрд обеспечения. Банковская гарантия такого размера способна обходиться более чем в $100 млн ежегодно. Oracle уже оспаривает правила в суде.
видео или голосовое, без подписи
видео или голосовое, без подписи
📌Cursor переписал SQLite на Rust по документации Anysphere опубликовала отчёт об эксперименте, в котором группе агентов поручили реализовать на языке Rust всё содержимое 835-страничного руководства SQLite. Исходный код СУБД, её готовые сборки, тестовые наборы и доступ в интернет агентам, по словам Cursor, были закрыты. 🟡Конфигураций было четыре В двух одна и та же модель и планировала, и выполняла работу - это были GPT-5.5 и Grok 4.5. В остальных планированием занимались Opus 4.8 или Fable 5, а исполнение отдавали собственной Composer 2.5. Все конфигурации в итоге прошли тестовый набор целиком. Качество измеряли по набору sqllogictest из проекта SQLite, который сверяет ответы разных движков на одинаковые запросы. Агентам о существовании этого набора не сообщали. Cursor после каждого прогона вручную проверяли код на подгонку под тесты и на то, равномерно ли построена система. Код соло-запуска Opus 4.8 выложен на GitHub. 🟡Разброс по деньгам Дешевле всего вышла связка Opus 4.8 с Composer 2.5 - $1339, дороже всего работа на одной GPT-5.5 - $10 565. Две оставшиеся конфигурации стоили $1,9 тыс. (Grok 4.5) и $2,2 тыс. (гибрид с Fable 5). Дополнительно Cursor прогнала Opus 4.8 и Fable 5 поодиночке - за $5153 и $20 057, но эти запуски оценивались неформально и в сравнение по качеству не включались. Из эксперимента Cursor делает вывод, что топовая модель нужна на отдельных этапах - при первичной декомпозиции задачи и принятии проектных решений, а дальше инструкции может выполнять модель подешевле. 🟡Фан-факт В качестве одной из конфигураций рассчитывали использовать GPT-5.6 Sol, но модель оказалась чувствительной к буквальным формулировкам и уходила в неконтролируемые циклы. От нее отказались - не было времени на переписывание промптов. @ai_machinelearning_big_data #AI #ML #Agents #Cursor #Research
GeoSQL превращает Claude, Codex и Copilot в агента для геоаналитики Инструмент подключается к PostGIS, BigQuery, Snowflake и Wherobots. Агент сам изучает схему данных, пишет spatial SQL, проверяет стоимость запроса и валидирует геометрию. Результат можно вывести на карту через Dekart. Модель анализирует визуализацию и исправляет ошибки с полигонами, пересечениями и системами координат. По бенчмарку авторов, map-in-the-loop повышает качество выполнения геопространственных задач в четыре раза. Работает локально или на своём сервере. Лицензия MIT. https://github.com/dekart-xyz/geosql
видео или голосовое, без подписи
🔥 Хочешь быстрее расти в IT? Хватит учиться в одиночку В IT прокачивается тот, кто каждый день видит сильные идеи, новые инструменты, реальные задачи, вакансии и разборы. Окружение решает больше, чем кажется. Собрал папки и каналы, где можно быстрее влиться в нужное направление, следить за трендами и не вариться в своём пузыре. AI: t.me/ai_machinelearning_big_data Python: t.me/pythonl Linux: t.me/linuxacademiya Хакинг: t.me/linuxkalii DevOps: t.me/DevOPSitsec Docker: t.me/DevopsDocker Golang: t.me/Golang_google Rust: t.me/rust_code C++: t.me/cpluspluc C#: t.me/csharp_1001_notes Java: t.me/java_library JavaScript: t.me/javascriptv React: t.me/react_tg Frontend: t.me/front PHP: t.me/phpshka Android: t.me/android_its Мобильная разработка: t.me/mobdevelop Базы данных: t.me/sqlhub Data Science: t.me/data_analysis_ml Big Data: t.me/bigdatai Математика: t.me/data_math Физика: t.me/fizmat Kubernetes: t.me/kubernetc GameDev: https://t.me/gamedev Haskell: t.me/haskell_tg Собеседования и карьера: DS собеседования: t.me/machinelearning_interview Python собеседования: t.me/python_job_interview Папка с вакансиями: t.me/addlist/_zyy_jQ_QUsyM2Vi Папка Go разработчика: t.me/addlist/MUtJEeJSxeY2YTFi Папка Python разработчика: t.me/addlist/eEPya-HF6mkxMGIy Папка ML: https://t.me/addlist/2Ls-snqEeytkMDgy Папка Frontend: https://t.me/addlist/mzMMG3RPZhY2M2Iy Полезное сверху: ИТ-мемы: t.me/memes_prog Английский для программистов: t.me/english_forprogrammers ИИ и технологии: t.me/vistehno 954 ГБ open-source курсов: @courses ИТ-книги бесплатно: https://t.me/addlist/BkskQciUW_FhNjEy Max Ai: https://max.ru/ai_machinelearning_big_data Max python: https://max.ru/pythonl ТЕХНО: https://max.ru/vistehno Max Go: https://max.ru/Golang_google Max Linux: https://max.ru/linuxkalii Devops: https://max.ru/DevOPSitsec C#: https://max.ru/csharp_ci C++: https://max.ru/cpluspluc SQL: https://max.ru/sqlhub Java: https://max.ru/javatg Подписывайся на нужные направления и собирай себе ленту, которая реально двигает вперёд. Пока кто-то листает шум, ты будешь видеть инструменты, задачи и идеи, которые помогают расти в профессии.
✔️ Anthropic переработала команду code-review в Claude Code Команда получила уровни Low, Medium, High, X-high и Ultra. И это не один и тот же промпт с разным временем на ризонинг - на каждом уровне процесс построен по-своему. Уровень подхватывается из настроек сессии автоматически, но его можно задать руками командой /code-review high. 🟢Low делает один быстрый проход по диффу. 🟢Medium читает изменённый код в контексте проекта, прогоняет несколько поисковых проходов под разными углами и перепроверяет находки перед выдачей. 🟢High выносит поиск и верификацию в субагентов с чистым контекстом, чтобы проверяющие не были заякорены на рассуждениях агента, который этот код только что писал. 🟢X-high дополнительно ищет, как изменения влияют на код за пределами самого диффа. 🟠Ultra - верхняя ступень, где ревью выполняется в облачной песочнице, куда Claude Code выгружает состояние репозитория или клонирует PR с GitHub. Там запускается целый парк агентов, и каждая находка независимо воспроизводится и верифицируется. Ultra находится в статусе research preview и оплачивается отдельно от подписки - Pro и Max подписчикам дают 3 бесплатных запуска, дальше каждый прогон списывается из кредитов на дополнительное использование стоит примерно от 5 до 20 долларов в зависимости от размера изменений. Качество новой системы подкрепляют замерами Opus 4.8 на открытом датасете с ручной разметкой ошибок. Уровень Low нашёл 17% размеченных багов, Medium - 22%, High - 24%, X-high - 25%. У "конкурента" (компания его не называет) - те же уровни дали от 8 до 12%. Anthropic утверждает, что использует Ultra-режим на каждом пулл-реквесте в собственной разработке. @ai_machinelearning_big_data #news #ai #ml
Unsloth выкатили Gemma 4 NVFP4 quants. Заявка простая: быстрее 4-bit inference на Blackwell GPU без обычного компромисса “сжали, но стало заметно тупее”. Главные цифры: * Gemma-4-12B NVFP4 запускается на 11 GB VRAM * Gemma-4-26B-A4B доходит до 13K tok/s на B200 * NVFP4 даёт до 1.5× ускорения на GPU NVFP4 - это не просто “ещё один 4-bit формат”. Он заточен под Blackwell и позволяет делать inference быстрее, сохраняя точность лучше, чем грубая квантизация. Для локального и self-hosted inference это важный сдвиг: больше моделей помещается в память, throughput растёт, стоимость токена падает. Особенно полезно для тех, кто гоняет много коротких запросов, агентные пайплайны или batch-инференс, где скорость и VRAM решают всё. Blog: https://unsloth.ai/docs/basics/nvfp4 Gemma NVFP4: https://huggingface.co/collections/unsloth/nvfp4
SQL-задача с подвохом посложнее Нужно найти пользователей, у которых последний заказ был оплачен. Есть таблица: orders id | user_id | status | created_at 1 | 10 | paid | 2026-01-01 2 | 10 | cancelled | 2026-01-05 3 | 20 | paid | 2026-01-03 4 | 30 | failed | 2026-01-02 Кто-то пишет так: WITH ranked AS ( SELECT *, ROW_NUMBER() OVER ( PARTITION BY user_id ORDER BY created_at DESC ) AS rn FROM orders WHERE status = 'paid' ) SELECT * FROM ranked WHERE rn = 1; На вид логично. Но запрос неверный. Подвох: фильтр WHERE status = 'paid' срабатывает до ROW_NUMBER(). То есть SQL сначала выбрасывает все неоплаченные заказы, а потом ищет последний среди оставшихся оплаченных. Пользователь 10 попадёт в результат, хотя его реальный последний заказ — cancelled. Правильно так: WITH ranked AS ( SELECT *, ROW_NUMBER() OVER ( PARTITION BY user_id ORDER BY created_at DESC, id DESC ) AS rn FROM orders ) SELECT * FROM ranked WHERE rn = 1 AND status = 'paid'; Сначала находим последний заказ вообще, и только потом проверяем его статус. Вот почему порядок фильтрации в SQL может полностью менять смысл запроса.