👨🏼💻Перекладываю 📊 в 🌲🇫🇮
СтатистикаBackend SE @ №1 🇫🇮 Fintech, DA + DE = AE? @ little🇫🇮startup, Ex Product Data Analyst @ SkyEng, Ex Data Engineer @ Starship (delivery robots), Ex Data Analyst @ EPAM, Я НЕ РАЗМЕЩАЮ РЕКЛАМУ
- Последний пост
- 3 авг.
- Последнее чтение
- 15:53
- Постов за неделю
- 0
- Всего постов
- 21
- Тип
- открытый
- Язык
- русский
- Категория
- Бизнес
- В каталоге с
- 13 авг.
- 1/24сутки в ленте
- 412
- 1/48двое суток
- 472
- 1/72трое суток
- 509
Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.
Посты
Немного о Финляндии. Статья про квантовые компьютеры, но заголовок королевский
видео или голосовое, без подписи
Уииии, антиспам-бот работает. Под капотом байес и регрессия, и никаких ллм и зависимости от оплаты подписки и токенов. Ещё и крутится локально, с возможностью продолжить с того места где аптайм упадёт. Пара часов вечером ушла на команды Клоду, Клод сделал ТЗ для Курсора, Курсор написал, Клод отревьюил, я добыл для обучения датасеты, скормил, подключил к каналам. Пошла жарямба. Не коммерческий проект, писал для себя и друзей, бо задрали спамеры в чатах наших.
Какие времена — такие и преложения в Линкедине
Ну и раз такая пьянка, делюсь тем, чем можно, без подробностей и деталей, но подмигивая одним глазом (потому что он дёргается уже) https://blog.allegro.tech/2026/06/spec-driven-development-best-practices.html
Ну всё, с 6го июля, официально ♦️рубист♦️ Ох, ёклмн. Встречай меня бекенд-бра́тушка. P.S. И на 10% ☕️джавист… P.P.S. Надо думать, в кого расти дальше. DA+DE (+DP ака инфра), + теперь софтвардевство бекендерское. И куда с этим всем через года два… А через пять? Мде.
Посоветуйте, пожалуйста, годные кейсы сборки пайплайна по построению Базы Знаний на нейронках-агентах. Дано: есть куча аудио, в этих аудио кроется кладезь знаний по нужной мне теме. Аудио транскрибированы (ну или будут транскрибированы) через Whisper облачный от Open AI (транскрибировал бы локально, но через облако процесс в разы быстрее). Транскрибации в двух форматах — с таймкодами по фразам, и просто скомпанованные по абзацам. Задача: Подобрать модель, или набор моделей, или готового агента или я хз что, что превратит транскрибации в «учебники» в формате ПДФ с форматированием. И! Затем ВЕСЬ МАССИВ транскрибаций (или ПДФок) превратит в базу знаний, например, в формате MD файлов, или в Ноушене, чтобы можно было быстро найти ответ, когда возникает какой-то вопрос по теме. Либо по содержанию, либо по тегам, либо поиском по БЗ. Почему ищу какое-то решение, а не просто «скормить Клоду» — я скормил Клоду ОДНУ запись на 5 часов (одну маленькую тему раскрытую), и эти пять часов в виде транскрибации выжрали весь дневной лимит токенов у Клода, и я едва уложился, чтобы получить законченный результат, а не ждать до обновления для продолжения и проверки результата. Ну и руками всё делать влом, хочется автоматизировать.
Старею. Распробовал Mayhem, и Bathory. Вторых (точнее второго) четвертый день подряд по кругу слушаю, альбомы с 1988 по последний… Но особенно два, 1991 и 2001. Что дальше? Ранний Darkthrone?) Ужас-ужас.
Пилю пет-проект. Для себя в первую очередь, т.к. не уверен в коммерческом потенциале идеи, хотя, безусловно, свою аудиторию продукт найдёт, и даже пригодится. А изучать рынок и пристреляться к стоимости реги нет времени, и желания. Очень непривычно делать…
Пилю пет-проект. Для себя в первую очередь, т.к. не уверен в коммерческом потенциале идеи, хотя, безусловно, свою аудиторию продукт найдёт, и даже пригодится. А изучать рынок и пристреляться к стоимости реги нет времени, и желания. Очень непривычно делать это вайб-простихоспаде-кодингом. Сделла внятное продуманное «ТЗ по созданию ТЗ» для ЧатаГПТ. ЧатГПТ по этому ТЗ сделал внятное ТЗ для Клода в виде MD файла. Клод из этого ТЗ сделал внятную архитектуру проекта, и ТЗ для Курсора. Курсор собрал. Клод отревьюил, дал замечания. Курсор исправил. Клод отревьюил. Курсор исправил. Клод одобрил. Запустил проект в v1.0 Работает. На 99% результат корректный, на 1% не корректный. Сижу. Думаю. Версия 1.1 должна либо стать проще, лишившись части функионала, но на 100% верной. Либо стать сложнее. Обрасти дополнительным фунционалом, без прироста точности (а точностью заняться после ещё пары итераций). По сути, если упростить весь процесс, это питоновый скрипт, который получат на вход определённую информацию, парсит её, делит на сектора, и дописывает туда дополнительные значения. Ну и обёрнуто это в простую хтмл-вебморду, с радиобаттонами и чекбоксами, для выбора настроек. И вот сижу, и думаю, пойти в бок, и попробовать сделать v1.0.b , и собрать не через петухон, а через использование дешёвой LLM модели. Или пойти по хардкору, и взять LLM модель, которую надо локально разворачивать, докручивать, мб дообучать, но это оверкил какой-то, и скорее усложнение ради собственного веселья профессионального, и практики, чем для сборки продукта. ___ Хотел использовать Кодекс, но на моём личном компе (макбук 2021г) чип от Интел, и Кодекс не заводится на нём… Жаль, ибо оперативы на этом ноуте больше чем на рабочем значительно.
Кажется, я знаю, какой я хочу курс пройти в Университете Хельсинки… #о_финляндии
Это прекрасно https://x.com/brahma_4u/status/2026927250176881090
Не понимаю, как люди в блогах рассказывают про перлы и события на работе, так, чтоб их не выперли с работы за такое… Это, конечно, не разглашение NDA, но всё ж. Столько всего есть рассказать, но каждый раз пишу и удаляю текст. Ибо нахер оно не надо, чтоб в паблике такое было, доброжелателей везде хватает, перешлют ещё кому не надо…
Уровень хопиума зашкаливает. Ждём ночи. [Update]: Мде…
Ну… приехали…
SUNO украли нашу песню. Это не кликбейт. Есть у меня личный интерес записать нормально песни нашей группы (мы лабали в 2007-2010 душевный метал). Но для этого мне нужен вокал, т.к. я хочу ориентироваться на него при проработке аранжировки. У меня есть только записи живых выступлений нашей группы, и древняя демка записанная за 50-100 евро в текущих деньгах на репбазе, через колено. Если я просто выдерну вокал из треков, то будет хреновое качество, где-то мимо нот, мимо ритма и т.п. Короч не поможет мне это для аранжировки. Поэтому я решил скормить SUNO стемы вокала, чтобы в режиме Cover получить сгенерированную версию песни, с чистым, прям чётко в ноты и ритм спетым вокалом, и выдернуть этот вокал, и под него сделать аранжировки, и уже потом отдать вокалистке на запись (если захочет). А Suno, когда делало свою версию аранжировки — использовало партию клавиш, ту самую, которую когда-то написал наш клавишник. Я сначала подумал, «ммм, ностальгия», как круто, прям как у нас… ПРЯМ КАК У НАС???? ЧТОООО??? Я аж переслушал несколько раз. Да, и правда, это партия клавишника. Вероятность того, что в нескольких аранжировках SUNO впихнёт партию котрая существует НУ ОЧЕНЬ МАЛА, а вероятность того, что партия будет ИМЕННО ИЗ ЭТОЙ ПЕСНИ… ну такое. Но вот нюанс… Мы нигде не публиковали эти демки. Есть только выложенные в хреновом качестве пожатые неистово mp3-шки, в аудиозаписях в ВК. Откуда Suno знает партию которую играл клавишник, что аж вставило её в песню? Училось на библиотеке ВК? Тогда не удивительно, почему партию клавишных вставило «покоцано», потому что в ВК на нашей записи партию клавишных слышно поганенько, и часть нот выпадает… прям как у SUNO… Вот такие дела. Хз чего делать с этим. Есть юристы готовые взяться за пост-оплату в случае победы?) 70% от отсуженной у SUNO суммы отдам.
Других экспертов по найму, у нас для вас нет…
Обсуждаем с чатомжпт локальный подход к нагромождению кучи всяких ремонтов на 1-2 года, сразу наваливая миллионные долги на УК домовую, а не растягивание их на десяток лет, чтоб не было разовых больших долгов, а просто постепенно и без надрыва жопы их оплачивать… Ответа чатажпт разорвал просто. Ей богу, я с ним никогда таких слов не употреблял, я хз откуда он это срисовал, и взял этот эпитет… Признавайтесь, кто его таким гадостям научил?)
Увидел интересное репо, в котором автор собрал локальный опенсорсный стек: Data Forge includes a complete modern data stack with industry-standard tools: 🗄️ Storage & Catalog - MinIO → S3-compatible object storage for data lakes - Hive Metastore → Centralized…
Увидел интересное репо, в котором автор собрал локальный опенсорсный стек: Data Forge includes a complete modern data stack with industry-standard tools: 🗄️ Storage & Catalog - MinIO → S3-compatible object storage for data lakes - Hive Metastore → Centralized metadata catalog for tables and schemas ⚡ Compute Engines - Trino → Interactive SQL query engine for federated analytics - Apache Spark → Distributed processing for batch and streaming workloads 🌊 Streaming & CDC - Apache Kafka → Event streaming platform - Schema Registry → Schema evolution and compatibility - Debezium → Change data capture from databases 🗃️ Databases - PostgreSQL → Primary OLTP database (source system) - ClickHouse → Columnar analytics database (sink) 🔄 Orchestration - Apache Airflow 3 → Workflow orchestration 📊 Visualization & Exploration - Apache Superset → Modern BI and data visualization - JupyterLab → Interactive data science environment Идеальный стек для отечественного (СНГ) дата инженера. PS автору если интересно, может и вебинарчик провести для нас.