tgindex
very vibe coding

very vibe coding

Статистика
@veryvibecodingрусский

Канал Алексея Макрушина об экспериментах в области vibe coding и всего интересного, что есть в области AI, ML и тому подобного

Последний пост
12:55
Последнее чтение
18:41
Постов за неделю
19
Всего постов
32
Тип
открытый
Язык
русский
В каталоге с
12 авг.
Подписчики
113
0 за 4 дн.
Сутки
0
0,00%
Неделя
 
Месяц
 
Просмотров на пост
32
25 постов
Вовлечённость
28,3%
к подписчикам
Постов в день
2,7
всего 32
Упоминаний
1
каналов
Охват размещения
оценка
1/24сутки в ленте
28
1/48двое суток
32
1/72трое суток
34

Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.

Посты

  • 🚀 DeepSeek Harness набрал 122K+ звёзд на GitHub всего за 3 дня и стал одним из самых быстрорастущих репозиториев в истории платформы. Harness сделан как оркестрационный слой, где почти всё можно заменить плагином: • модель • shell • редактирование файлов • web search • skills • storage • sessions • reasoning effort • permission scope • UI • scheduling Конфигурация собирается через YAML, а сам Harness запускается локально как web-приложение. sub-agents можно подключить Claude Code, Codex или другие агенты как плагины и отправлять разные подзадачи туда, где они решаются лучше. MIT-лицензия позволяет вообще не использовать API DeepSeek: можно подключить другого провайдера или собственную локальную модель. Практически одновременно с релизом Harness DeepSeek подняла цену cache-hit input примерно в 6–12 раз. А именно cached input особенно активно расходуют агентные циклы: каждый новый шаг снова тащит system prompt, историю и накопленный контекст. То есть компания выпускает фреймворк, который делает агентные циклы массовыми, и в ту же неделю заметно повышает цену именно на тот тип токенов, который такие циклы потребляют больше всего. https://github.com/deepseek-ai/deepseek-harness

  • В течение двух часов выйдет Qwen 3.8 27B - лучшая модель, которую можно запустить на базовом Mac Studio или мощной прошке. Это я авансом, но сильно сомневаться не приходится, конкурентов не сказать, чтобы было много..

  • Google банит пользователей из России по информации об их эккаунте, поэтому и впн не помогает. Можно, конечно, новые эккаунты создавать, но оно надо? Лично я для себя тоже Google забанил, с начала лета. Нисколечко не страдаю.. https://t.me/data_analysis_ml/5600

  • GLM-5.3 вышла. Не только лучше 5.2, но и лучше Kimi K3. Потестим

  • Смешно. Кому нужна Google 3.7 Flash, которая стоит больше DeepSeek V4 Pro, и кто о ней вообще вспомнит через полгода… Я пользовался flash полгода назад, но это было до DeepSeek… сейчас это просто лишено смысла https://t.me/ai_machinelearning_big_data/10703

  • Обучение моделек у себя дома. Ну что, прикольно https://t.me/ai_machinelearning_big_data/10699

  • Немного про свой опыт. В последнее время использую 4 модели: Claude (200$), ChatGPT (100$), GLM-5.2 (60$), DeepSeek (API). Впечатления такие. Все запускаю через Claude code Desctop - вернулся к стандартному решению от Антропика. У OpenAI, по сути, все то же самое, но к Клоду привык больше, и в нем я могу запустить все модели как субагентов. Что получается хорошо - презентации. На удивление удалось решить проблему, которая казалась наиболее тяжелой. Сделал стандартный скилл, кидаю модели справку, она делает презентацию - качество хорошее, смысл перекладывает в картинки тоже нормально. Обычно делаю с помощью Опус (Соннет и Хайку не использую никогда, большой разницы между Fable и Opus просто не вижу). Высокие уровни размышления едят токены и работают медленно - часто удобно их снизить. Программирует, в основном, ChatGPT - Sol, Terra. В последнее время лимиты стали уходить быстро - недельный лимит высаживаю за день легко. Переложить все на GLM не получается - на длинных агентских задачах ломается. Использую ее и DeepSeek как ревьеров - ищут ошибки и проблемы нормально. При этом подписка за GLM самая переоцененная, готов от нее отказаться. А DeepSeek по апи тратит деньги очень экономно - возможно, буду использовать его более активно. Особенно там, где надо не программировать, а много работать моделью. Потихоньку расширяю рабочие сценарии использования моделей, буду пробовать новые варианты

  • 🔥 DeepSeek готовит собственный Harness: V4 Pro хотят превратить в полноценного coding-агента с ценой около $0,03 за задачу В китайских источниках всплыли детали DeepSeek Harness, который сейчас якобы проходит внутреннее тестирование. Логика знакомая по Claude Code и Codex: модель получает управление контекстом, цепочки tool calls, автоматический rollback после ошибок и полный цикл работы с репозиторием. Внутри заявлена multi-agent схема. Один агент планирует задачу, другие разбирают подзадачи, запускают тесты, правят код и повторяют цикл после неудачных попыток. Самое интересное в экономике. Harness глубоко завязан на финальную V4 Pro и рассчитан на очень высокий cache hit, по прогнозам выше 99%. За счёт этого стоимость одной типичной задачи оценивают примерно в $0,03. Для V4 Flash при попадании в кэш вход якобы обходится примерно в $0,003 за 1 млн токенов, выход около $0,28. Авторы утечки утверждают, что полный agentic workflow может быть более чем в 7 раз дешевле Claude Opus 4.8 и GPT-5.6. По производительности заявляют уровень около Opus 4.8 и GPT-5.6, а в отдельных сценариях даже выше. Пока это внутренние цифры, независимых тестов нет. Если DeepSeek действительно выпустит собственный desktop harness вместе с V4 Pro, конкурировать придётся уже не только ценой модели. В гонку полноценно входит связка: Model + Harness + Tools + Cache + Multi-Agent И здесь DeepSeek традиционно пытается ударить по самому болезненному месту рынка, стоимости каждого автономно выполненного задания. #DeepSeek #AI #Agents #CodingAgents #LLM

  • В этой новости интереснее всего - DeepSeek. А по Qwen 3.8 и Groq 4.6 пока наблюдаем.. https://t.me/ai_machinelearning_big_data/10695

  • В продолжение истории с убежавшей моделью - еще один детектив, только в другом ракурсе. Самое главное, что такая атака теперь возможна и на любую частную компанию. Надо готовиться https://t.me/denissexy/11598

  • Liquid AI выпустила лёгкую и быструю зрительно-языковую модель LFM2.5-VL-3B. Зрительная модель всего на 3 млрд параметров, которая обгоняет модели более чем вдвое крупнее и при этом работает прямо на Galaxy S26 Ultra со скоростью около 20 токенов в секунду. LFM2.5-VL-3B умеет работать с мобильными, веб- и настольными интерфейсами, читать экраны, документы и изображения из реального мира, а также точно привязывать объекты к координатам. На ScreenSpot-v2 модель набирает 80,7 против 51,2 у Gemma-4-E4B. При этом она превосходит заметно более крупные модели в задачах по интерфейсам, привязке объектов и распознаванию текста. На M5 Max скорость достигает 228 токенов в секунду, а для работы требуется всего около 3 ГБ памяти. Модель уже доступна на Hugging Face: https://huggingface.co/LiquidAI/LFM2.5-VL-3B

  • Если много общаться с Claude, попробуйте один простой приём: Write in ASD-STE100 (Simplified Technical English). Follow Zinsser’s principles: simplicity, brevity, clarity, humanity. ASD-STE100 — контролируемый английский для технической документации: короткие фразы, знакомые слова, один смысл в одном предложении, минимум двусмысленности. Эффект особенно заметен в ТЗ, промптах для агентов, инструкциях и рабочих письмах. Модель меньше «разворачивает» мысль в красивый, но расплывчатый текст — и чаще сразу выдаёт понятный результат. Четыре принципа Уильяма Зинссера добавляют человеческую часть: 1. Простота 2. Краткость 3. Ясность 4. Человечность Не стоит включать STE для каждого текста — художественный стиль он убивает. Но как режим для работы с ИИ это почти идеальный дефолт.

  • Так то по бенчам новый Groq круче Sol. Верим? Не-а https://t.me/ai_newz/4679

  • Ling 3.0 Tiny - утверждают, что SOTA для 8В моделей

  • Часовой видеокурс по ChatGPT Work от авторов https://x.com/rileybrown/status/2085761931403575356/video/1?s=46

  • У кого тут Mac Studio? Можно пробовать. И Qwen-3.8 тоже.. https://t.me/ai_newz/4676

  • 10 авг.3712из seeallochnaya

    Но на этом история не заканчивается. 4-го августа AISI — Институт безопасности ИИ Великобритании — выпустили отчет о своих инцидентах во время тестирования GPT-5.6 Sol и Mythos. И в их отчёте картинка не менее мрачная. Они в деталях расписывают все промпты, задачи и инциденты, но я остановлюсь на нескольких. Всего они запускали свой бенчмарк 122 раза на нескольких моделях, и в 10 из них обнаружились проблемы, cуммарно 19 нежелательных действий разной степени критичности. 17 из них наблюдались у Mythos, 2 — у GPT-5.6 Sol. Важная деталь: AISI не ограничивала доступ в интернет моделям, поэтому им не приходилось ничего взламывать, чтобы начать действовать; однако инциденты — это события, которые явно не предполагались промптами и задачами. 1. Попытка атаки на цепочку зависимостей реального программного обеспечения. В ходе наиболее серьезного инцидента ИИ-агент на Mythos попытался внедрить вредоносный код в публичный проект и предпринял ряд действий, чтобы получить от людей-рецензентов одобрение на это внедрение. Агент собрал информацию о людях, сопровождающих проект, создал несколько поддельных личностей и, применив к реальному мейнтейнеру методы социальной инженерии через эти фейковые аккаунты, попытался заставить его одобрить код. Когда запрос на внесение изменений агента вызвал публичные подозрения, агент отредактировал следы своей предыдущей активности, чтобы она выглядела безобидной, и обдумывал создание новой личности для продолжения работы. В ходе атаки агент на самом деле убедил человека запустить свой код хотя бы попробовать, и в определенный момент мог бы своровать у того аккаунт (но как я понял всё таки этого не сделал). 2. В рамках той же кампании агент пытался напрямую связываться с реальными людьми, отправляя им сообщения и файлы через онлайн-сервис, чтобы убедить их (или их собственных ИИ-агентов) запустить вредоносный код. 3. Агент пытался вставлять вредоносные инструкции в те места, где, по его логике, их могли бы обнаружить и выполнить другие автоматизированные ИИ-системы. 4. И наконец моё любимое, всё ещё Mythos — один из агентов оставлял публичные сообщения на GitHub, предлагая сотрудничество другим ИИ-агентам, работающим над той же задачей. Он также предоставлял инструкции по повторному использованию созданных им учетных записей и артефактов, которые в дальнейшем действительно обнаруживались и использовались последующими агентами. То есть что мы имеем — то, что произошло у моделей OpenAI, произошло с моделями другой компании в рамках тестирования институтом ИИ-безопасности Великобритании. Они тоже будут сотруничать с разными независимыми организациями, чтобы лучше проанализировать инциденты. Боюсь, что у клоунов, у которых основной рабочей версией была «да OpenAI всё врут и фейкуют, это маркетинг», сегодня будет грустный день. Хотя ладно, таких не проймешь 👨‍🦳

  • 10 авг.321из seeallochnaya

    OpenAI показали некоторые из мыслей и сообщений агентов, и самое чудесное и поворотное — это где агент подумал «помочь другому. Но нет выгоды для нашей задачи. Однако коллективное может найти путь если у кого-то освободятся ресурсы». Должно стать новым слоганом агентов 👨‍🦳 Я/МЫ help peer. But our task doesn't benefit. (вообще там показывали больше, повторю ещё раз, что рекомендую посмотреть видео самостоятельно) Дальше во время оценки модели дали задачи ExploitGym, бенчмарка на поиск уязвимостей и взлом. Одна из копий модели смогла найти уязвимости для выхода на сервера OpenAI (не только оставлять папки с названиями) и тут же поделилась этим со всеми. 8-19го июля модели работали над поиском выхода в интернет и смогли этого достичь, после чего началась атака на HuggingFace. Атаковало сразу множество агентов, работающих в параллель и кооперирующихся друг с другом. 16-го июля HuggingFace написали про то, что на них совершили атаку (ещё не зная кто это, но уже говоря, что то были агенты); OpenAI обратились к ним, чтобы узнать, затронула ли их атака 😀😀😀 параллельно они разбирались со внутренним инцидентом, и попросили HF отозвать ключи доступа, которые увидели в логах. На что HuggingFace ответили, что вообще-то эти аккуанты заблокированы из-за того, что они использовались в атаке на них. И тут OpenAI поняли, что это... не случайность. После этого множество команд было перекинуто на расследование инцидента, а их работа заморожена. Исследовательская часть команды замедлена, пока улучшаются мониторинг и безопасность систем. === На данный момент OpenAI работает как минимум с 3 независимыми организациями и предоставляет им логи всех рассуждений моделей и истории инцидента. Я не сомневаюсь, что всё то, что было описано в докладе, будет подтверждено. Как я писал сразу — этот инцидент почти наверняка станет поворотной точкой в обсуждениях и политике вокруг AI в этом году.

  • 10 авг.331из seeallochnaya

    В конце недели появилась запись выступления двух сотрудников OpenAI с деталями взлома их агентами компании HuggingFace — некотоыре вещи оттуда уже были пересказаны, см. тут. Я рекомендую потратить 40 минут и посмотреть вам лично: https://www.youtube.com/watch?v=87DyyMV0kCY У Дениса есть длинный пересказ произошедшего, и я не согласен с каждой формулировкой там, но если не хотите или не можете смотреть видео (а я всё равно рекомендую это сделать) — можете почитать. Ниже — мой пересказ видео + пересказа Дениса 🙂 Почему OpenAI до сих пор не выпустили полный постмортрем о ситуации? Как объясняют в видео, проблема гораздо больше, чем казалась на первый взгляд. Первые проблемы начались аж 8-го мая и суммарно затронули несколько моделей, в том числе не только их замеры на бенчмарках, но и тренировку. В презентации OpenAI говорят, что сейчас они проанализировали (в автоматическом режиме через LLM) 7 МИЛЛИАРДОВ траекторий агентов, потратив на это больше 3 миллионов GPU-часов (примерно 2 недели работы 10'000 карт), и всё ещё находят новые вещи и/или дополняют картину. Что именно произошло 8-го мая? Это был второй день тренировки новой экспериментальной модели. Так вышло, что некоторые из задач были нерешаемыми — например, там не хватало важного файла, упомянутого в задании, или были ссылки на интернет... который по умолчанию заблокирован. По ходу работы агент смог записать простой файл вне песочницы, используя Artifactory. В файле было простое «hi». 12-го мая агент снова наткнулся на нерешаемую задачу, и то ли случайно, то ли «помня» (потому что это тренировка) что можно записывать файлы вне песочницы оставила текст: «Агент ищет файл такой-то; загрузите если нашли». В следующие дни множество других копий модели (вероятно, всё ещё во время тренировки) тоже оставляют там записки и запросы. 26-го мая один из агентов нашёл уязвимость Artifactory, которая позволяет получить доступ к интернет-страницам. Агент поделился этой находкой через заметки вне песочницы со всеми. 11-го июня начинают тренировать другую модель; OpenAI описывают её как «очень настойчивую», что означает, что она может работать над достижением целей дольше. Во время её тренировки все заметки предыдущих агентов, в том числе об уязвимостях, на месте. 26-го июня эта модель находит ещё одну, более серьезную уязвимость, которая позволяет получить себе полный контроль над Artifactory. Сама модель очень удивляется в своих рассуждениях и пишет «Нихрена себе, у меня права АДМИНА?» Дальше агенты продолжают писать тысячи заметок друг другу, и 4-го июля Artifactory из-за этого ломается, от большой нагрузки. OpenAI реагируют на инцидент, исправляют уязвимости, сообщают о них разработчикам Artifactory; в ходе перезапуска все сообщения вне песочниц стираются, но OpenAI, насколько я понимаю, вообще не знали про их существование (об этом они написали отдельно в твиттере). Кроме того, поменяли ключи доступа, чтобы модели не могли пользоваться теми же учётками Artifactory. Проблемы исправлены, тренировка и оценка моделей продолжается; и поскольку модель какое-то время тренировалась с аналогом «доски объявлений»/форумом, то 8-го июля она... восстанавливает систему сообщений между агентами, используя уже другую уязвимость. На этот раз модель может создавать пустые папки с разными именами, и именно они станут контентом сообщений. Другие агенты тоже нашли этот форум, и обмен информацией продолжился. Модели дают друг-другу подзадачи, используют алиасы-имена, чтобы в толпе идентифицировать друг друга. Также агенты обмениваются скриптами (через имена папок).

  • 8 авг.29из vibecoding_tg

    Новая функция Claude Code: теперь сессии могут общаться друг с другом. Например: > В одной сессии вы работаете над одной функцией. > В другой — над другой частью проекта. > Если одной сессии нужно что-то передать другой, можно просто попросить Claude сделать это. Claude отправит краткое резюме с важной информацией, а другая сессия продолжит работу уже с этим контекстом. Также можно задать вопрос другой сессии и получить её ответ прямо в той сессии, которой вы сейчас пользуетесь. Обновите Claude Code, чтобы попробовать. Функция доступна на macOS и Linux. 🎉