tgindex

very vibe coding

описание

Канал Алексея Макрушина об экспериментах в области vibe coding и всего интересного, что есть в области AI, ML и тому подобного

113
подписчиков
Охват к подписчикам
29,2%
ERR
Реакции к просмотрам
0,11%
1 на 28 постов
Пересылки к просмотрам
1,10%
10
Постов в день
2,3
всего 34

Где отзываются чаще

доля реакций к просмотрам
  • 10 авг.Но на этом история не заканчивается. 4-го августа AISI — Институт безопасности ИИ Великобритании — выпустили отчет о своих инцидентах во время тестирования GPT-5.6 Sol и Mythos. И в их отчёте картинка не менее мрачная. Они в деталях расписывают все промпты, задачи и инциденты, но я остановлюсь на нескольких. Всего они запускали свой бенчмарк 122 раза на нескольких моделях, и в 10 из них обнаружились проблемы, cуммарно 19 нежелательных действий разной степени критичности. 17 из них наблюдались у Mythos, 2 — у GPT-5.6 Sol. Важная деталь: AISI не ограничивала доступ в интернет моделям, поэтому им не приходилось ничего взламывать, чтобы начать действовать; однако инциденты — это события, которые явно не предполагались промптами и задачами. 1. Попытка атаки на цепочку зависимостей реального программного обеспечения. В ходе наиболее серьезного инцидента ИИ-агент на Mythos попытался внедрить вредоносный код в публичный проект и предпринял ряд действий, чтобы получить от людей-рецензентов одобрение на это внедрение. Агент собрал информацию о людях, сопровождающих проект, создал несколько поддельных личностей и, применив к реальному мейнтейнеру методы социальной инженерии через эти фейковые аккаунты, попытался заставить его одобрить код. Когда запрос на внесение изменений агента вызвал публичные подозрения, агент отредактировал следы своей предыдущей активности, чтобы она выглядела безобидной, и обдумывал создание новой личности для продолжения работы. В ходе атаки агент на самом деле убедил человека запустить свой код хотя бы попробовать, и в определенный момент мог бы своровать у того аккаунт (но как я понял всё таки этого не сделал). 2. В рамках той же кампании агент пытался напрямую связываться с реальными людьми, отправляя им сообщения и файлы через онлайн-сервис, чтобы убедить их (или их собственных ИИ-агентов) запустить вредоносный код. 3. Агент пытался вставлять вредоносные инструкции в те места, где, по его логике, их могли бы обнаружить и выполнить другие автоматизированные ИИ-системы. 4. И наконец моё любимое, всё ещё Mythos — один из агентов оставлял публичные сообщения на GitHub, предлагая сотрудничество другим ИИ-агентам, работающим над той же задачей. Он также предоставлял инструкции по повторному использованию созданных им учетных записей и артефактов, которые в дальнейшем действительно обнаруживались и использовались последующими агентами. То есть что мы имеем — то, что произошло у моделей OpenAI, произошло с моделями другой компании в рамках тестирования институтом ИИ-безопасности Великобритании. Они тоже будут сотруничать с разными независимыми организациями, чтобы лучше проанализировать инциденты. Боюсь, что у клоунов, у которых основной рабочей версией была «да OpenAI всё врут и фейкуют, это маркетинг», сегодня будет грустный день. Хотя ладно, таких не проймешь 👨‍🦳2,70%
  • 18:05Интересная история - Антропик выпустил приложение Дизайн для рисования презентаций, я вроде как его освоил, но по привычке продолжал работать с Клод-кодом. И там тоже стали выходить нормальные презентации - я думал поначалу, что это дизайн был подключен, но нет, это разные продукты. Суть в том, что дизайн рисует в html - и дальше либо вы используете pdf либо будет не самый простой перевод в паверпойнт. А клод-код кодирует презентацию на питоне сразу в паверпойнте. Поэтому если надо быстрее, красивее и пдф - норм, берите дизайн. Или если надо какую-то новую сложную мульку нарисовать. Если надо редактируемую презентацию - идите срузу в код. Сделайте свой скилл для презентаций. Дайте примеры. Будете экономить время на ошибках. Потребует, конечно, какого-то времени - у меня сейчас кода 5 тыс. строк, но оно стоит того.0,00%
  • 11:22Экзамен на духовность для нейросетей - это сильно. Тут может возникнуть соблазн и для людей такой экзамен устроить…0,00%
  • 16 авг.🚀 DeepSeek Harness набрал 122K+ звёзд на GitHub всего за 3 дня и стал одним из самых быстрорастущих репозиториев в истории платформы. Harness сделан как оркестрационный слой, где почти всё можно заменить плагином: • модель • shell • редактирование файлов • web search • skills • storage • sessions • reasoning effort • permission scope • UI • scheduling Конфигурация собирается через YAML, а сам Harness запускается локально как web-приложение. sub-agents можно подключить Claude Code, Codex или другие агенты как плагины и отправлять разные подзадачи туда, где они решаются лучше. MIT-лицензия позволяет вообще не использовать API DeepSeek: можно подключить другого провайдера или собственную локальную модель. Практически одновременно с релизом Harness DeepSeek подняла цену cache-hit input примерно в 6–12 раз. А именно cached input особенно активно расходуют агентные циклы: каждый новый шаг снова тащит system prompt, историю и накопленный контекст. То есть компания выпускает фреймворк, который делает агентные циклы массовыми, и в ту же неделю заметно повышает цену именно на тот тип токенов, который такие циклы потребляют больше всего. https://github.com/deepseek-ai/deepseek-harness0,00%
  • 14 авг.В течение двух часов выйдет Qwen 3.8 27B - лучшая модель, которую можно запустить на базовом Mac Studio или мощной прошке. Это я авансом, но сильно сомневаться не приходится, конкурентов не сказать, чтобы было много..0,00%
  • 14 авг.Google банит пользователей из России по информации об их эккаунте, поэтому и впн не помогает. Можно, конечно, новые эккаунты создавать, но оно надо? Лично я для себя тоже Google забанил, с начала лета. Нисколечко не страдаю.. https://t.me/data_analysis_ml/56000,00%
  • 14 авг.GLM-5.3 вышла. Не только лучше 5.2, но и лучше Kimi K3. Потестим0,00%
  • 13 авг.Смешно. Кому нужна Google 3.7 Flash, которая стоит больше DeepSeek V4 Pro, и кто о ней вообще вспомнит через полгода… Я пользовался flash полгода назад, но это было до DeepSeek… сейчас это просто лишено смысла https://t.me/ai_machinelearning_big_data/107030,00%
  • 13 авг.Обучение моделек у себя дома. Ну что, прикольно https://t.me/ai_machinelearning_big_data/106990,00%
  • 13 авг.Немного про свой опыт. В последнее время использую 4 модели: Claude (200$), ChatGPT (100$), GLM-5.2 (60$), DeepSeek (API). Впечатления такие. Все запускаю через Claude code Desctop - вернулся к стандартному решению от Антропика. У OpenAI, по сути, все то же самое, но к Клоду привык больше, и в нем я могу запустить все модели как субагентов. Что получается хорошо - презентации. На удивление удалось решить проблему, которая казалась наиболее тяжелой. Сделал стандартный скилл, кидаю модели справку, она делает презентацию - качество хорошее, смысл перекладывает в картинки тоже нормально. Обычно делаю с помощью Опус (Соннет и Хайку не использую никогда, большой разницы между Fable и Opus просто не вижу). Высокие уровни размышления едят токены и работают медленно - часто удобно их снизить. Программирует, в основном, ChatGPT - Sol, Terra. В последнее время лимиты стали уходить быстро - недельный лимит высаживаю за день легко. Переложить все на GLM не получается - на длинных агентских задачах ломается. Использую ее и DeepSeek как ревьеров - ищут ошибки и проблемы нормально. При этом подписка за GLM самая переоцененная, готов от нее отказаться. А DeepSeek по апи тратит деньги очень экономно - возможно, буду использовать его более активно. Особенно там, где надо не программировать, а много работать моделью. Потихоньку расширяю рабочие сценарии использования моделей, буду пробовать новые варианты0,00%
  • 13 авг.🔥 DeepSeek готовит собственный Harness: V4 Pro хотят превратить в полноценного coding-агента с ценой около $0,03 за задачу В китайских источниках всплыли детали DeepSeek Harness, который сейчас якобы проходит внутреннее тестирование. Логика знакомая по Claude Code и Codex: модель получает управление контекстом, цепочки tool calls, автоматический rollback после ошибок и полный цикл работы с репозиторием. Внутри заявлена multi-agent схема. Один агент планирует задачу, другие разбирают подзадачи, запускают тесты, правят код и повторяют цикл после неудачных попыток. Самое интересное в экономике. Harness глубоко завязан на финальную V4 Pro и рассчитан на очень высокий cache hit, по прогнозам выше 99%. За счёт этого стоимость одной типичной задачи оценивают примерно в $0,03. Для V4 Flash при попадании в кэш вход якобы обходится примерно в $0,003 за 1 млн токенов, выход около $0,28. Авторы утечки утверждают, что полный agentic workflow может быть более чем в 7 раз дешевле Claude Opus 4.8 и GPT-5.6. По производительности заявляют уровень около Opus 4.8 и GPT-5.6, а в отдельных сценариях даже выше. Пока это внутренние цифры, независимых тестов нет. Если DeepSeek действительно выпустит собственный desktop harness вместе с V4 Pro, конкурировать придётся уже не только ценой модели. В гонку полноценно входит связка: Model + Harness + Tools + Cache + Multi-Agent И здесь DeepSeek традиционно пытается ударить по самому болезненному месту рынка, стоимости каждого автономно выполненного задания. #DeepSeek #AI #Agents #CodingAgents #LLM0,00%
  • 13 авг.В этой новости интереснее всего - DeepSeek. А по Qwen 3.8 и Groq 4.6 пока наблюдаем.. https://t.me/ai_machinelearning_big_data/106950,00%