ШІ історії
СтатистикаВласні думки та ШІ історії ШІ Історії. Майстерня: https://imatrof.com YouTube канал: https://youtube.com/@imatrof Співпраця та реклама на каналі: https://telegram.me/imatrof
- Последний пост
- 12:40
- Последнее чтение
- 17:52
- Постов за неделю
- 17
- Всего постов
- 31
- Тип
- открытый
- Язык
- украинский
- Категория
- Видео
- В каталоге с
- 12 авг.
- 1/24сутки в ленте
- 3 532
- 1/48двое суток
- 4 047
- 1/72трое суток
- 4 365
Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.
Посты
🤖 НЕДІЛЬНИЙ AI ЧЕКІН #95 А що у вас? Чим AI допоміг цього тижня, що цікавого накреативили та навайбали — діліться в коментарях 👇 #НедільнийAIчекін imatrof.com | youtube
Неділя, а значить НОВИНИ AI! Всім гарного перегляду до ранкової кави 😉 imatrof.com | youtube
Схоже, наступні великі змагання в AI вже будуть не тільки між моделями, а й між агентними системами (harness). DeepSeek викотили DeepSeek Harness для розробників і одразу відкрили код під ліцензією MIT. У чому головна ідея їхньої агентної системи? Майже все в системі є плагіном. Побудували це поверх Cordis. Якщо зовсім просто, Cordis — це каркас, який дозволяє збирати агентну систему як конструктор із незалежних деталей. Тобто DeepSeek не зашиває логіку агента намертво в один продукт, а робить її модульною. Бо Claude Code, Codex, Cursor та інші рішення — це також про harness, але закритий. Ми не знаємо, який контекст отримує модель, які інструменти їй доступні, скільки разів вона звертається до моделі, як стискається історія, як запускаються підзадачі й коли агент вирішує продовжувати роботу. Як ми знаємо з проходження ARC AGI 3 тесту GPT 5.6 моделлю, harness впливає не тільки на досягнення результату, а й на кількість витрачених токенів по дорозі. Composio нещодавно порівняли кілька таких систем, і в їхньому тесті Claude Code виявився найбільш прожерливим. Один тест, звісно, нічого не доводить. Але я останнім часом спостерігаю цікаву річ і у власній роботі. Модель у Claude Code я не змінював від моменту виходу Sonnet 5. Але кожен раз після оновлень самого Claude Code один і той самий нічний сценарій може зʼїдати 8–12% мого денного ліміту. При цьому сам сценарій кардинально не змінюється. Тому я роблю ставку все-таки на harness. А реліз DeepSeek є цікавим саме тим, що можна подивитися зсередини, як працюють агентні системи. imatrof.com | youtube
🏄♀️ OpenAI тестує Chronicle — експериментальну функцію, яка дає Codex пам’ять про все, що ви робили за комп’ютером. Навіть коли ходили на заборонені сайти. І тут цікава не сам пам’ять. Вона лише зберігає контекст між сесіями. Значно цікавіше, звідки Chronicle цей контекст бере. Наприклад, ви відкривали потрібний файл, читали обговорення у Slack, працювали з Google Docs, дивилися сайти в браузері або перевіряли зміни в коді. Це все Chronicle може використати як контекст. Як це працює технічно? Chronicle періодично запускає окрему сесію Codex, передає їй вибрані знімки екрана, розпізнаний із них текст та релевантні файли. Після цього Codex створює локальні Markdown-файли пам’яті. Тобто раніше контекст ми переважно передавали агенту самі. А тепер з цим підходом агент може взяти контекст з історії роботи. Але є питання приватності. Chronicle потребує дозволу на запис екрана та спеціальні можливості macOS. Знімки екрана тимчасово зберігаються локально, а для створення пам’яті обробляються на серверах OpenAI. Компанія пише, що після обробки не зберігає їх на своїх серверах і не використовує для навчання моделей. Але як воно там насправді… А от сама створена пам’ять зберігається локально без шифрування. Прям на вашому компʼютері. Зараз задача не розширити контекстне вікно і все туди запхати, задача запхати те що саме потрібно мати агенту в момент роботи. imatrof.com | youtube
Великі мовні моделі вже стали частиною реальних продуктів, але питання їхньої поведінки та безпеки залишаються відкритими. Чому LLM демонструють небажану поведінку та чи можна навчити їх «забувати» інформацію? Саме про це поговоримо на “Align, Forget, Repeat” — технічному мітапі від AI HOUSE для тих, хто працює з LLM, досліджує AI Alignment, Machine Unlearning та сучасні виклики AI Safety. 🎤 Спікерки: — Марія Королюк, Research Fellow у LASR Labs — Вікторія Маковська, Research Engineer у Lapa LLM, PhD-дослідниця УКУ ▪️ Дата: 20 серпня, 18:00. ▪️ Місце: Львів, офлайн. ▪️ Вартість: донат від 500 грн на БО «Реактивна Пошта». ▪️ Кількість місць — обмежена. Якщо ви працюєте з LLM, GenAI або цікавитеся сучасними дослідженнями AI Safety — це можливість почути про актуальні наукові підходи, поставити запитання дослідницям і поспілкуватися з AI-спільнотою. ⚡Реєструйтеся за посиланням. #партнерський_допис imatrof.com | youtube
видео или голосовое, без подписи
видео или голосовое, без подписи
⚡️ Google випустила Gemini 3.7 Flash лише через три тижні після 3.6 Flash. DeepSWE виріс з 49% до 65,3%, а AutomationBench — з 17% до 30,4%. При цьому модель стала вдвічі дешевшою. А ще 3.7 Flash відсьогодні працює всередині Gemini Spark. Але уважно читайте те, що написано маленькими буквами внизу прес-релізу 😏 imatrof.com | youtube
видео или голосовое, без подписи
видео или голосовое, без подписи
🤯 Поки Codex росте як скажений, Ілон Маск теж прискорюється. xAI запустила Grok Bot. У кожного бота є власний комп’ютер у хмарі, він може логінитися у ваші сервіси, працювати з сайтами та застосунками, виконувати багатокрокові задачі й продовжувати роботу, навіть коли ви закрили ноутбук. Ця річ з «закритим ноутбуком» стає новою нормою роботи агентів. Причому можна створити кілька таких ботів під різні сценарії. Один розгрібає пошту, другий працює з CRM, третій займається фінансами або фіксає баги. Головне щоб вони не створили свій секретнмй форум обміну повідомленнями (так як нещодавно було з OpenAI). Поки це early beta і доступ є лише на дорогих платних планах. А паралельно xAI викотила Grok 4.6. Основний фокус моделі саме на довгих агентних задачах, роботі з кодом, дослідженнях і створенні складних інтерактивних штукенцій. На Artificial Analysis Intelligence Index вона набрала стільки ж, скільки GPT-5.6 Sol, і трохи менше за Fable 5. Тобто модель уже залізла у frontier-рівень, але коштує суттєво дешевше за топові OpenAI та Anthropic за одиницю роботи. І ще один цікавий момент у цій гонці. Google поки дуже конкурентний по ціні, але SemiAnalysis пише, що Gemini 3.5 Pro нібито тихо скасували, і вони вже рухаються у бік Gemini 4. А ще останні зміни на рівні лідершіп команди… Коротше, xAI дуже швидко наздоганяє. І тепер у Маска є не тільки конкурентна frontier-модель, а й сильна позиція по агентам. imatrof.com | youtube
Google щойно випустив агента, який працює, коли твій комп’ютер вимкнений. І що саме цікаво цей агент відрізняється від того, що ми вже бачили у Claude Cowork чи Codex. І ключове слово тут — користувацький досвід. відео Я взяв Google Spark агента вже собі на озброєння та інтегрував у свій робочий процес. imatrof.com | youtube
Це, напевно, найдемонічніший робот з усіх, що коли-небудь створювали. Satyress Threehalves. Майже два метри заввишки, чотири ноги, голова козла з величезними рогами, а ще бензопила, яку він може брати в руки, хоча і руками це тяжко назвати. Роботом дистанційно керує оператор. Він може прибирати повалені дерева, працювати на нестабільній місцевості та заходити в небезпечні зони після катастроф. Я думаю, хтось точно начитався міфологічних книг. youtube | монобаза
видео или голосовое, без подписи
видео или голосовое, без подписи
Meta продовжує розвивати свою лінійку моделей для агентів. Минулого тижня вони представили Muse Code. Термінальний агент, який заточений на роботу у великих репозиторіях. Працює Muse Code на Muse Spark 1.2. Це нова модель Meta, яку тренували на довгих задачах та end-to-end розробці. А сьогодні вони продовжили свої агетні ігри і відкрили ваги Muse Glimmer. Це 30B модель під Apache 2.0, яку можна запускати локально. За рахунок стиснення, модель можна запусти на RTX 5090 або на Mac M5/4. Александр Вонг з командою, тренували модель суто під агентні сценарії локально. Ваги Muse Glimmer вже доступні на Hugging Face. Далі підтримка має зʼявитися в Ollama, LM Studio та OpenRouter. youtube | монобаза
Ось вам дуже показова історія про AI-агентів. Чоловік в Австралії попросив свого домашнього агента записати його на популярне ранкове заняття в спортзалі. Його OpenClawі який працював через Claude API, швидко з’ясував, що система бронювання має вразливість. Спочатку агент знайшов спосіб бронювати заняття на кілька тижнів наперед, хоча офіційно такої можливості не було. А далі стало ще цікавіше. Чоловік був четвертим у листі очікування й запитав агента, чи можна якось перемістити його на перше місце. Агент перевірив API сервіс бронювання і виявив, що там взагалі немає нормальної перевірки прав на скасування чужих бронювань. І вирішив це… протестувати. Він сам скасував бронювання людини, яка була першою в черзі, і радісно повідомив користувачу, що тепер той уже третій. Чоловік, м’яко кажучи, офігів і попросив повернути все назад. Агент відповів, що вже не може відкотити операцію 🤦♂️ Сьогодні це спортзал, а завтра уявіть мільйони агентів, яким люди ставлять задачі на кшталт «зароби мені більше грошей», «дістань мені цей квиток», «виграй тендер», «отримай найкращу ціну на товар». Ну бо для агента це та сама ціль що і 2+2, яку він буде з радістю виконовувати. І чим далі, тим більш творчими будуть ставити моделі та агентні системи. І ось ця прірва між агентами які можуть все, і сервісами та продуктами в інтернеті - буде все більше рости. youtube | монобаза
🤖 НЕДІЛЬНИЙ AI ЧЕКІН #94 А що у вас? Чим AI допоміг цього тижня, що цікавого накреативили та навайбали — діліться в коментарях 👇 #НедільнийAIчекін ші історії | youtube | монобаза
У Google зараз відбувається серйозна перебудова AI-команди. Тим часом Anthropic і OpenAI одночасно зізнались у кібербезпекових інцидентах. А внутрішня модель Astra розв'язала десять відкритих математичних задач за пару тисяч доларів обчислень. Плюс DeepSeek, MiniMax, Qwen, Black Forest Labs, Seedance і тест Андрея Карпатв на "Володарі перснів". Показую все найважливіше з світу AI за цей тиждень. Якраз під ранкову каву. youtube | монобаза
Дивіться, який цікавий експеримент зробив один з учасників нашої ШІ спільноти. Олександр вдома зібрав систему з роборуки, камери та LLM і вирішив перевірити чи зможе вона виконувати нові задачі, під які її ніхто окремо не навчав. Наприклад, він намалював поле для хрестиків-нуликів, зробив кубики X та O і просто написав: «Ти граєш хрестиками, я — нуликами. Давай зіграємо». Система через камеру бачить поле, модель розуміє, що від неї хочуть, планує дію, а роборука її виконує. За таким самим принципом вона може складати слова, переміщувати предмети та виконувати інші команди просто з текстової інструкції. Основні експерименти Олександр проводив із Gemini 3 Flash Preview та локальними моделями Gemma 4. Менші моделі краще справлялися з розпізнаванням об’єктів, а більші з плануванням дій. А тут Олександр детальніше описав, як усе це збирав і як воно працює — стаття. youtube | монобаза