FUTURE × SIMPLE ⛩
Статистика👨💻 Авторське медіа про штучний інтелект: новини, тренди, український контекст, факапи, дрібка мемів та офтопчик. 👾 Для зв'язку: @thats_not_ai_samurai 📝 Підтримка: base.monobank.ua/3Ai2pY7W6vWm6G
- Последний пост
- 11:21
- Последнее чтение
- 03:27
- Постов за неделю
- 4
- Всего постов
- 24
- Тип
- открытый
- Язык
- украинский
- Категория
- Технологии (по похожим)
- В каталоге с
- 12 авг.
- 1/24сутки в ленте
- 441
- 1/48двое суток
- 505
- 1/72трое суток
- 545
Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.
Посты
🤖 У Fwdays Academy наприкінці серпня стартують два crash-курси — тримайте дати й промокод Без довгих підводок, бо тут по суті інформація, а не допис: два курси, обидва короткі, і обидва по конкретному стеку. 🔹 Crash Course: AI-native observability — Йожеф Гісем 📅 31 серпня – 9 вересня → Про те, як шукати причину поломки на проді, а не діяти за старим протоколом «давайте перезапустимо і помолимось». Logs, metrics, tracing — і де саме в цьому всьому AI прискорює root cause analysis. 🔹 Crash Course: Побудова RAG-системи — Наталя Манакова 📅 25–29 серпня → Шлях від «у нас 500 документів і ніхто не знає, де що лежить» до асистента, який шукає відповіді у ваших файлах. Є й повністю локальний варіант — якщо віддавати внутрішні документи в чужий API вам не дуже хочеться. 👏 Промокод для підписників — FutureSimple, 15% на обидва курси. Програми та деталі — за посиланнями, далі вже на ваш розсуд)))
😞 єВідмова та спідран у державне управління Якщо ви РАПТОМ хотіли податись на Chief AI Officer в Мінцифри — засмучу вас, вже пізно. І ні, не тому, що взяли мене))) 😁 Особисті речі в цьому блозі майже не зʼявляються, але сьогодні буде виняток — вважайте це разовою акцією. Пояснюю чому: стрічечка у нас у всіх складається з чужих перемог — офери, запуски, раунди, «радий повідомити». → А невдачі тихенько зникають, ніби їх і не існувало — такий собі survivorship bias, і всі ми цим грішимо. Тож нехай тут буде хоч одна історія про те, що зазвичай до допису не доходить. 🤵♂ Отже, побачив я вакансію — очолити AI-трансформацію держави, Дія.AI, agentic state, оце от все — і зловив себе на цікавому відчутті. Я зазвичай такі вакансії читаю як чужі оголошення, а тут раптом — опа, а воно ж про мене. 🤵 Про мій досвід, мої останні роки і, головне — після всього, чим я займався це виглядало як наступний логічний рівень. Таке відчуття буває нечасто, і я зрештою пройшовши етап сумніву/торгу/заперечення, дав себе переконати, що ігнорувати його — тупо. → Подався, відповідно, на повному серйозі — замість суто класичної PDF-ки зібрав окреме інтерактивне резюме-сайтік з анімаціями та свістопєрдєлками конкретно під цю роль. Ну бо якщо вже претендуєш будувати продукти для/від держави — сама подача теж має бути продуктом. 🤨 При цьому, для контексту, я зараз не те, щоб в активному пошуку фул-тайм роботи — ні, з зайнятістю у мене все більш ніж ок. Але є категорія можливостей, повз які проходиш рівно один раз. Лист-відповідь прийшов вже наступного дня. 👏 Людина, яка його писала, постаралась — секунди зо три навіть не було зрозуміло, чи мені відмовили. Ну коротше — рахуйте, що наївно повівся на цю ЕйчАрівську місцеву анестезію. 🤯 Але, по суті, відповідь звелась до того, що пошук на позицію призупинено. Чи знайшли когось, чи просто призупили пошуки — не відомо. → Формально виходить, що я не отримав відмову, я отримав відтермінування з невизначеною тривалістю — якщо дивитись на це таким чином, то звучить значно солідніше))) Загалом, нейрокозацтво, у мене зараз є ресурс і бажання залетіти в якийсь цікавий проєкт — і подавався я, нагадаю, не на «тихенько посидіти повайбкодити». 😎 Саме зараз маю ресурс долучитись в комунікації, програм/проджект-менеджмент та все, що стосується AI — від впровадження в процеси до вашого власного продукту. Ящо що — чекаю в приватних повідомленнях) ❤️ Ну а Мінцифрі — щирої удачі з AI-трансформацією. → Я, звісно, НЕ ЗНАЮ як ви впораєтесь без мене, вірю в диво. Але якщо серйозно — щиро вболіваю та сподіваюсь, що все піде так, як має піти. 😀 Нагадую, мій контактик у вас є))
AI пише код швидко. Але сьогодні вийшло добре, а завтра агент не дочитав контекст, пропустив тест і зробив не ту поведінку. Проблема не в моделі. Проблема в тому, що навколо неї немає процесу. 20 серпня Кирило Сулімовський наживо проводить Безкоштовний воркшоп де покаже, як цей рандом замінити на послідовний workflow. За 3 години, на одному реальному продукті, від сирої ідеї до деплою. Що розбираємо: 🟢 Карта рішень: чому агент додумує вимоги і як це зупинити до написання коду 🟢 Критерії приймання і пошук неоднозначностей: місця, де два розробники прочитають однаково, а зроблять по-різному 🟢 TDD з coding-агентом: маленький цикл, у якому агента видно на кожному кроці 🟢 Кілька агентних гілок без конфліктів: власники файлів, порти, міграції, порядок злиття 🟢 Чому «агент сказав, що готово» не означає готово: скріншот на кожен критерій, E2E, незалежне рев'ю, смоук-тест Після воркшопу буде видно, де саме в твоєму процесі дірка: у постановці задачі, у тестах, у правилах для гілок чи у фінальній перевірці. 📅 20 серпня, четвер, 19:00 за Києвом ⏱️ 180 хвилин, online, українською 🎁 Безкоштовно + відкритий репозиторій зі скілами, агентами й ранбуком Формат демо: Кирило будує, ти дивишся і розбираєш логіку кроків. І в кінці буде QA-сесія - де розберуть ваші питання та кейси. Деталі, наповнення і реєстрація 🔗
😱 Можливо хтось пропустив статтю — це пуш для вас, котики → Єсть огляд на 15 хвилин. Єсть промокод на два безкоштовні місяці. Єсть $10 на баланс. Картіночки єсть. Я не знаю, що ще нужно підписникам, шоб вони ідєально жили. Думаю тонкий натяк зрозуміли. 🫳ЧИТАТИ🫳 🌝 #реклама
😁 Огляд Amplify: АІ-агенти, синдром відмінника та іспит на автономність Нейрокозацтво, обіцяв — виконую. → Понад два тижні я працював із персональним AI-агентом від Amplify: віддав йому свою рутину, пошту, і задачі, які зазвичай роблю самостійно. Одразу скажу, що каталогу фіч в огляді не буде — це все видно з лендінгу за п'ять хвилин. 😎 Натомість там відповідь на питання, яке мене цікавило з самого початку: де закінчується «зроби це за мене» і починається «сідаю і роблю сам». Десь агент вразив, десь налажав, а десь зробив і те, і інше в межах однієї задачі. Зі спойлерів лишу тільки три, щоб у вас була мотивація ПРОЧИТАТИ огляд: ⚫️ Автономність, оркестрація та собівартість — що агент справді робить сам та скільки це коштує ⚫️ Prompt injection — наскільки ризики критичні та чи рятують від них ручні запобіжники ⚫️ Межа делегування — де вона реально проходить і що я лишив собі після двох тижнів тестів 👉 Нагадую умови: матеріал партнерський і позначений як реклама, але редакційно він мій. 😚 До речі, в огляд винесено два не дуже зручні питання, на які вендор перед публікацією дав свої коментарі. 🔺ЧИТАТИ🔻 А ще там знову прикольні картіночки, зацініть бумласка. ❤️❤️ Реакції, коментарі та будь-яка інша активність на Друкарні — прекрасний спосіб набрати плюсиків в карму та отримати промінчики безумовної любові від адміна :) → Ну і в кінці, мої улюблені підписники, вас ЗВІСНО Ж, чекає промокод на 2 безкоштовних місяці сервісу + $10 на баланс. Цього більш ніж вистачить, щоб потицяти все власними руками та перевірити мої висновки на практиці. 👹 #реклама
З вами магазин DataBuy. У магазині вже 1000+ користувачів. Що зараз є в наявності: 🔹 Google Gemini Pro + 5 ТБ - $45 за 12 місяців, $60 за 18 🔹 n8n - $75 за рік 🔹 Lovable Pro - $100 за рік 🔹 Adobe Creative Cloud Pro - $70 за 3 місяці 🔹 Canva Pro - $35 за рік 🔹 Duolingo Super - $35 за рік 🔹 Steam Gift Cards - номінали під індивідуальний запит Всі підписки робляться на ваш особистий акаунт 🤌🏻 У боті є й інші сервіси - якщо шукаєте щось конкретне, просто напишіть, підберуть. І окремо що важливе - це підтримка: не спрацювало → повернуть гроші, якщо злетить → відновлять. У простих ботах з такими темами такого нема. 👉 Оформити тут за посиланням у DataBuy 👀 Відгуки: t.me/+QXeInlp6hmhjZThi
😁 Невеличкий апдейт та два анонси Перше — так, знову трішки зник, але, нейрокозацтво, причина більш ніж поважна. 😨 Наразі в поті чола працюю над матеріалом про регулювання ШІ — що вже відбувається в Україні та у світі, і де/хто/як налажав. → Планово стаття піде в публікацію вже наступного тижня, але, якщо відверто — з цим не поспішаю, бо до теми регулювання повертаюсь вже, мабуть, втретє за останній рік. Дуже хочу, щоб матеріал все-таки був «тим самим», а не «черговим». ❤️ А щоб ви не сумували в очікуванні: огляд на Amplify вже майже готовий і виходить цього тижня. 💻 Спойлерів не буде, єдине, що напишу — буде цікаво)) 👉 Ще один важливий момент: лишаю збір на комплектуючі до FPV-дронів для батальйону безпілотних систем «Кондор» бригади «Буревій» — закиньте, скільки комфортно, всіх цьом!
Як виглядає AI-розробка в компанії, де агенти вже в щоденному процесі. Кирило Сулімовський - Head of Engineering, керує 6 інженерними командами на highload, 200+ мікро сервісів, 10k+ RPS. На воркшопі показує не «як має бути в теорії», а свій щоденний production-процес. Практичний воркшоп Agentic Engineering Workflow, дві частини: 📅 6 серпня, четвер, 19:00 - теорія: контекст, CLAUDE.md, субагенти, Ralph loop, переключення моделей 📅 8 серпня, субота, 13:00 - практика: повний шлях фічі від ідеї до коду в production, наживо Що всередині: 🟢 Spec-Driven Development як основа керованої AI-розробки 🟢 Контекст-інженерія: щоб агент не «забував» проєкт між сесіями 🟢 Субагенти в паралель: код, тести, рев'ю, security 🟢 Верифікаційні гейти, щоб агент не зламав усе одним рухом Буде корисно: Senior і Middle спеціалістам, Tech Lead'ам, Engineering-менеджерам, CTO і техфаундерам, які вже працюють з AI, але хочуть побудувати системний workflow. Два дні, живі демо на реальному проєкті. Практику можна проходити разом із Кирилом: він ділиться власним репозиторієм, тож ти не просто дивишся, а і робиш. Зараз діє найкраща ціна до старту. Буде й запис воркшопу. Деталі, наповнення і реєстрація 🔗
😠 ВЖЕ хтось помітив ЗНАЧНЕ зниження продуктивності Opus 5 після випуску?? → Дивовижне диво — пройшло 3 години, а Anthropic ще не понерфили модель, вау! Боже, бережи Амодея 🙏
🤵 Новий-чудово-неперевершений-бʼютіфул-емейзінг реліз від Anthropic (Як мінімум, якщо вірити бенчмаркам) 😁 Opus 5 is out — бігом тестувати, реальне життя почекає...
🤨 2024 рік: «Реклама плюс AI — це для мене щось особливо тривожне. Реклама для нас — це last resort» © Сем Альтман. 😂 Липень 2026-го, лендінг OpenAI: «Be part of the future of AI-native advertising ✨» → Оскільки вони все ж запустили рекламу в ChatGPT: вітаю, нейрокозацтво — виходить ми офіційно дожили до last resort від OpenAI))) Ну бо AGI розшифровується як Ads-Generated Income, а не те, що ви там думали. 👏 Але загалом вони молодці — арку «стати Google» пройдено за 10 років.
🤑 Про Kimi K3, GLM-5.2 та ще один сиквел «DeepSeek-moment» (або ні) За останні п'ять тижнів китайські АІ-лабораторії видали два релізи, які, як на мене, варто розглянути, при цьому обидві разом. 🔻13 червня Zhipu випустили GLM-5.2 — кодинг-модель з контекстом у мільйон токенів. 🔻А 16 липня Moonshot AI показали Kimi K3, яка практично вперше в історії опенсорсу постукала у двері топ-3. Почати думаю варто з K3, бо вона наразі «свіжіша» і зробила більше інфо-шуму. • За версією Moonshot: 2.8 трлн параметрів — найбільша відкрита модель в історії, приблизно вдвічі більша за будь-яку до неї, ~на 75% більша за DeepSeek V4 Pro (1.6T). Контекст — мільйон токенів, нативна мультимодальність: на вхід приймає не тільки текст, а й зображення. 😎 Технічного звіту станом на момент написання допису нема, тож архітектурні цифри — це поки самозвіт компанії, але масштаб зрозумілий. • Якщо говорити про результати, то на Artificial Analysis Index K3 набирає 57 — третя позиція у світі: позаду лише Claude Fable 5 (60) та GPT-5.6 Sol (59), і на один пункт вище за Opus 4.8 (56). Щоб було зрозуміло, наскільки це серйозно: жодна модель з (ну, майже) відкритими вагами ніколи не наближалась до топу настільки близько. 🤯 Розрив із абсолютним фронтиром настільки мінімальний, що різниця між Fable 5 і Opus 4.8 більша, ніж між Fable 5 і китайським опенсорсом. Тепер про GLM-5.2 — її реліз теж був доволі гучний, але з іншої причини: він ідеально вписався в таймінг. 😁 Модель вийшла 13 червня — буквально наступного ранку після того, як уряд США наказав Anthropic вимкнути Fable 5 і Mythos 5. Загалом обидва релізи направду важливі для АІ-комʼюніті, але тепер плавненько перейдемо до нюансів. І перший, дуже цікавий момент — галюцинації. • У Kimi K3 частка галюцинацій на незалежних тестах AA-Omniscience — 51%. У попередника, щоб ви розуміли, було 39%. При цьому точність зросла з 33% до 46%. → Тобто на кожен пункт нових знань модель отримала приблизно один пункт впевнених галюцинацій. Це рівно те, як виглядає вхід у фронтир-клас: • Claude Opus 4.8 — 36% • Claude Fable 5 — ~48% (Anthropic свідомо пожертвувала калібровкою заради рекордної точності у 61%) • Kimi K3 — 51% • GPT-5.5 — 86% • GPT-5.6 — чистого показника ще нема, але Artificial Analysis прямо пише: галюцинацій стало більше, ніж у 5.5 → При цьому, що дуже цікаво, GLM-5.2 має 28% — це за показниками найкраще калібрування серед УСІХ моделей фронтир-класу — китайських, американських, відкритих, закритих. • Але повертаючись до K3 — загалом, якщо дивитись на заголовки та поверхневі матеріали ЗМІ, у не дуже обізнаного читача (але точно не в тебе пімписник!) може скластись враження, що Kimi K3 — це ледве не топ-1 модель у світі. Чому так? 😂 Бо заголовки зроблені з одного бенчмарку: K3 дійсно взяла перше місце на Frontend Code Arena — і саме цей замір розійшовся пресою. Але це один лідерборд із 35 тестів, які прогнав сам Moonshot: у сумі K3 виграла приблизно сім, а більшість забрав Fable 5. 🤨 Чи є це насправді безпрецедентно в плані результатів, як для опенсорсу? Абсолютно точно так. Одна невеличка зірочка-приміточка для контексту: станом на зараз K3 — відкрита модель скоріше тільки за пресрелізом. • Вагів у публічному доступі поки нема — Moonshot обіцяє викласти їх до 27 липня, а поки К3 доступна тільки через закритий API компанії. 🥂 У GLM-5.2, до слова, ця історія прозоріша: ваги затримались на три дні після анонсу, але з 16 червня лежать на Hugging Face під MIT. Тепер про ґроші й геополітику. 😱 1.5 роки тому DeepSeek влаштував паніку приблизно у форматі «ого, моделька в 10 разів дешевша + майже таке ж розумна», і всі чекають сиквелу. Але я вас, можливо, трішки розчарую: його не буде — принаймні не в цьому жанрі та форматі. 💵K3 коштує $3/$15 за мільйон токенів — один в один з Claude Sonnet 5, аж до однакової ціни кешу ($0.30). Якщо брати вартість виконання типової задачі: K3 — $0.94, GPT-5.6 — $1.04. Проте це ще не означає, що Китай «перестав демпінгувати» — GLM-5.2 робить ту саму задачу за $0.32, а DeepSeek V4 Pro — взагалі за $0.04. 🤵 Це трішки про інше, бо демпінг — це коли ти дешевший, бо інакше тебе не куплять, а Moonshot вперше зафіксувала на китайський фронтир західний цінник — і риночєк це сприйняв цілком позитивно. • І «позитивно» — це ще м'яко кажучи, бо наступного дня після релізу API K3 пролежав майже шість годин, а самі Moonshot офіційно призупинили можливість оформлення нових підписок — бо, цитую, попит за 48 годин «підійшов впритул до меж наших потужностей». Тому й розглядати ці релізи варто разом: окремо це просто два сильні продукти, а разом — індикатор того, що китайський опенсорс дуже успішно виконує свою основну функцію — наздогнати. 😠 Він тепер може коштувати як західний, галюцинує як західний і, дуже ймовірно, регулюватиметься як західний. В Пекіні вже обговорюють власні експортні обмеження на АІ-моделі, схожі на ті, що були в червні від США. 🚬 І тут навіть неважливо, чи дійдуть ці обговорення до реальних обмежень — відкритість в АІ ніколи не була ідеологією. Це завжди була стратегія того, хто позаду. OpenAI, наприклад, публікувала все, поки їй не було чого втрачати — і «закрилась» рівно тоді, коли вирвалась вперед. • Китайські лабораторії теж роздавали ваги не з любові до комʼюніті, а тому, що це найдешевший інструмент проти лідера, з яким не можеш конкурувати напряму. 💻 Тож питання не в тому, чи закриються китайські лабораторії. Питання в тому, скільки ще пунктів AA Index у них лишилось до цього — і, судячи з K3, десь ± три.
🤵 Очевидно не по темі каналу, але що не липень, так привід зустрітись з приємними людьми та однодумцями :) 🤨 Було б, звісно ж, чудово щоб підстави для цієї зустрічі були трішки іншими, але вже що маємо Загалом за це можемо колективно подякувати завтра о 09:00 самі знаєте кому і де (якщо не в курсі «де» — ну погугліть, може трішки інтересу проявіть чи шо, дякую) → А самі «подяки» краще робити у вигляді хенд-мейд ілюстрацій на картонних картках або просто у вигляді особистого відвідування протесту 🥂 «Роль розумних політичних рішень дещо перенедооцінена», так би мовити
😀 Рутина, реклама та ринкові афірмації AI-агенти Я думаю в кожного є рутина, яку ви тихо ненавидите — умовно щоранку чекати пошту й календар, щоб зрозуміти, що перше в пріоритеті. → Або будь-який інший кейс: переносити міти, які й так ніхто не хотів призначати, писати «дякую, отримав, гляну» по 20 разів на день чи [вставте будь-що своє]. Десь приблизно на цьому місці випадково зійшлися мій біль та комерційна пропозиція. Якщо коротко, то до мене звернулись нейрокозаки з Amplify AI — сервіс персональних AI-агентів — і замовили огляд. Так, за гроші. Так, я погодився. 👉 І щоб бути відвертим з вами — ось умови, які ми зафіксували: • матеріал позначений як партнерський — ви завжди знатимете, де реклама • тестую сам, на своїх задачах, кілька тижнів • ви, крім огляду, отримаєте промокод: 2 місяці сервісу безкоштовно + $10 на баланс — щоб перевірити мої висновки власноруч 💻 По формату: це буде не суто рекламний допис, а повноцінна лонгрід-стаття — з реальними сценаріями, скрінами та чесним відгуком про те, як і що спрацювало. Тож, орієнтовно за пару тижнів, тут буде анонс з посиланням. 👾 Ну і головне, без чого я б за це не брався: матеріал оплачений, але редакційно мій, тому якщо у вас є питання чи сценарії, які варто перевірити — пишіть в коменти, включу в тестування. 👹 #реклама
🥃 Навчіть, будь ласка, OpenAI робити цікаві презентації — бо те, що є зараз це тупо скучна хуйня
🐈⬛ Планував якраз під зникнення Fable 5 з підписки опублікувати допис про те, скільки він орієнтовно обійдеться за API-рейтами. Але Anthropic буквально під дедлайн подовжили доступ до 12 липня. → Новина насправді чудова — і наводить на думку, що GPT-5.6 Sol вже дууууже близько (апдейт: вже завтра), бо роздавати речі просто так не дуже лягає в бізнес-стратегію Anthropic, а конкурентний тиск — єдиний відомий спосіб змусити корпорацію бути щедрою)))) Але реальні, хоч і доволі приблизні, цифєркі від цього нікуди не ділись. 😀 Отже, якщо вірити оцінкам комʼюніті, одна повна шкала Fable на підписці x20 ($200/міс) — це приблизно 150 мільйонів токенів. API-рейт Fable: $10/MTok на вхід, $50/MTok на вихід — вдвічі дорожче за Opus 4.8. Робимо не хитрі операції з множенням, і отримуємо, що: → Якщо використати 100% інпут (теоретичний мінімум) — це вам обійдеться в 1500 американських ґривень → Якщо використати використати 100% аутпут (теоретичний максимум) — $7500 Реальна цифра десь поміж цими значеннями, залежно від вашого розподілу input/output. 😗 Іншими словами, за $200 підписки ви отримували Fable на суму від $1,500 до $7,500 — субсидія від x7.5 до x37.5. Кожен підписник, який витискає максимум з лімітів Fable, коштує Anthropic від $1300 до $7300 упущеної вигоди. 🤵 Помножте на базу платних акаунтів — і стане зрозумілим, чому Fable їде з підписки перед IPO, яке Anthropic таргетують на жовтень з оцінкою під трильйон. 💻 Але це якщо ми сприймаємо, що «x20» — це дійсно x20. Адже, якщо вірити нещодавньому позову проти Anthropic, Claude Max x20 на практиці видає лише 6–8x від Pro, а Max x5 — приблизно 3.5x замість пʼяти)))
🤑 Про Upwork, брунатні штанці та брехню бенчмарків Кожен реліз нової моделі супроводжується одним і тим самим ритуалом: їй влаштовують іспит — задачі з кодингу, тести з медицини чи права — і потім звітують, що модель «обійшла людину». 🤡 Проблема в тому, що сам «іспит» — це зазвичай стерильна задача, чіткі умови та одна правильна відповідь (або, як це часто буває, взагалі задачі, які модель бачила на тренуванні). Але якщо вам хоч трішки більше, ніж 10 років, то ви розумієте, що реальна робота виглядає, мʼяко кажучи, інакше)) → В умовах коли клієнт пише «зроби красіво, як у конкурентів, тільки інакше... і не як у конкурентів» модель, що отримує 90% на бенчмарк-тестах, зазвичай розсипається об перший же реальний бриф. 🤵 Але є цікавий бенчмарк, який якраз присвячений цим реаліям та ринку праці — Remote Labor Index. Дуже коротко зупинимось на тому, як цей бенчмарк створювали. → Восени 2025-го Center for AI Safety разом зі Scale AI зробили річ, до якої чомусь ніхто не додумався раніше: замість вигадувати задачі — пішли на Upwork і викупили у фрилансерів їхні реальні завершені проєкти. Не просто описи, а повні проєкти: бриф від клієнта, вхідні файли й готову роботу, за яку їм заплатили ґроши. 🤯 Загалом так набралося 240 замовлень із 23 категорій: ювелірні 3D-моделі, архітектурні плани, рекламна анімація, монтаж, аудіо, геймдев, дашборди. Медіанна ціна проєкту — $200, медіанний час виконання — 11.5 годин, а весь цей кошик роботи разом коштував замовникам понад $140 тисяч. → При цьому у продавців цих проєктів у середньому 2 300+ відпрацьованих годин і по $23K заробітку на платформі — ну тобто в більшості випадків це не просто рандомний підробіток. Далі кожному агенту дають рівно те, що колись отримав фрилансер — бриф і файли, — і він видає власний результат. 🥃 Результат оцінює жива людина — кладе поруч дві роботи й відповідає на одне питання: чи прийняв би адекватний клієнт це замість людської роботи? Варіанти відповіді: «так» або «ні» — альтернатив немає. → Щодо можливого включення цих проєктів до тренувальних даних — 230 з 240 проєктів лежать у приватному сеті, брифи не гугляться, а для робіт, що колись світилися онлайн, ведуть окремий блокліст доменів. В таких умовах найкращі моделі станом на осінь минулого року закривали 2.5% проєктів — тобто 6 із 240. 😨 І ось нещодавно CAIS прогнали через бенчмарк свіжі моделі, результати: GPT-5.5 — 6.3%, Opus 4.8 — 8.3% та, найбільш очікуана модель, Fable 5 від Anthropic — 16.1%. З 2.5% → 16% за неповний рік, і найбільші зміни саме там, де було найгірше — 3D, CAD, відео. ☺️ Для розуміння контексту: Fable 5 встигли протестувати лише на 218 задачах із 240 — далі доступ до моделі обмежили. Але навіть якщо всі непрогнані кейси зарахувати як «невдача», вийде 14.6% — все ще перше місце з єбать яким відривом. → Це все дійсно чудово, але щоб коректно сприймати результати цього бенчмарку важливо проговорити один нюанс. Ось ці 16% — це не про те, що AI поглине шосту частину фрилансу. Це радше про те, що у 16% проєктів оцінювач не зміг сказати, що згенерована робота гірша за людську. 🔫 Якщо ваші штанці стали наближені до бруна́тного кольору — не поспішайте. Самі ж CAIS визнають: жодну з робіт Fable 5 замовник як фінальну б не прийняв. Але тут важлива не точка, а вектор руху. 😎 Бо в світі, де моделями рівня Fable 5 чи ну бодай Opus користується крихітна частка людей, досвід усіх інших — це безкоштовний ChatGPT чи AI Overview в видачі Google. → Тобто більшість бачить технологію в її найдешевшій версії — звідси й суспільне нерозуміння: людині поза нашою чудовою АІ-бульбашкою розповідають про якісь мільярдні інвестицій і загрозу автоматизації цілих робочих кластерів, а вона у підсумку бачить якусь шляпу, що плутається у чотирьох абзацах. RLI, як бенчмарк, міряє якраз ось цю верхню планку — моделі, до яких у більшості поки не дійшли руки та бюджети. Але верхня планка має звичку дешевшати і за рік-два спускатися в масові продукти. 🖕 Приблизно тут за класикою жанру я мав би написати щось заспокійливе, типу «але не перейматесь — AI лише інструмент у ваших руках». Не напишу — лякайтесь, бійтесь, панікуйте. Мені нравиця, як воно горить, як люди суєтяться, пожарки приїжджають… 🙅♂️ В будь-якому разі у вас (та й в мене) є приблизно стільки часу, скільки майбутній (!) верхній планці треба буде, щоб здешевіти до масового продукту. 💻 Перейматись можна, звісно, і вже, але рекомендую дочекатись трішки кращих та дешевших моделей)))
Трясця, ця геніально: існує спосіб економити до 60% токенів при використанні Fable 5. Для цього потрібен старий 👁👁👁 JPEG 😂 Логіка така: інструмент pxpipe просто бере ваш величезний промт, опис усіх skills та інші полотна й перетворює у зображення з текстом. Прикол у тому, що при обробці зображення токени витрачаються за кожен оброблений піксель, а не за кількість літер на ньому, через що виходить сильно дешевше, ще й контекст менше витрачаються. У демо на відео ту саму задачу вдалося виконати за 6.06$ проти звичайних 42,21$, при цьому контекст заповнився лише на 73,5 тисячі токенів (текстом забило б 96% контексту). За стиснення можна не хвилюватися: у 39 протестованих зображеннях Fable без проблем зчитав увесь текст. GitHub ооо донат на збір (залишилося 69 250.33)
😎 «Хочеться в це вірити» — Mistral та європейський АІ два роки по тому Я раніше писав про Mistral — тодій мій допис закінчувався буквально словами «хочеться в це вірити». ☺️ Так от, минуло два роки — пропоную подивитись, що з тієї романтики лишилось. Спершу про хороше. 🌚 Оскільки це по суті єдиний притомний розробник власних моделей у Європі, то ґрошей в них кидали чимало: seed-раунд на €105 млн у 2023-му, далі — €385 млн, потім €600 млн. → А потім ще €1,7 млрд під ручкою від ASML— тих самих ASML, що роблять літографічні машини для всього світового виробництва передових чипів (без EUV-літографії ASML — взагалі жодного сучасного чипа на планеті, ні в Nvidia, ні в когось ще не буде). Цю деталь запам'ятайте. Зараз, якщо вірити Bloomberg, Mistral ведуть переговори про ще один новий раунд — оцінка під €20 млрд. 😱 Щодо доходу — ARR зі слів менеджменту (це не аудована цифра!) виріс із ~$20 млн на початок 2025-го до понад $400 млн на початок 2026-го. 20х стрибок, об'єктивно — потужно. Cеред клієнтів: армія Франції, Airbus та BMW, а асистентами Mistral вже користуються 10 000 французьких чиновників. 🧠 Тобто як бізнес-історія Mistral виглядає чудово: єврики є, контракти є, оцінка летить вгору. Але є нюансик))) → Поки оцінка росте — розрив із фронтиром не те, щоб відчутно зменшився. 🤵♂ Якщо дивитись на Artificial Analysis Intelligence Index, то найкраща модель Mistral, Medium 3.5, має 30 балів. Фронтир (Opus 4.8, GPT-5.5) — 55-56. → І якщо ви думаєте «адмін йобнувся і порівнює Mistral з Anthropic — дуже обʼєктивно та коректно», то навіть відкриті китайські моделі знаходяться ближче до «закритих» американських капіталістичних інновацій. Той самий GLM-5.2 має 51 бал, тобто майже вдвічі більше за найрозумнішу модель Mistral. А DeepSeek V4 Pro і Kimi K2.6 — моделі, які всередині самого китайського опенсорсу вже навіть не лідери — тримають ±43–44 бали. 😒 Проговорю це словами через рот: китайські моделі, які програють іншим китайським моделям, все одно обходять найновішу та найкращу розробку Mistral із запасом у 13+ пунктів. Отже, маємо ситуацію, коли капітал подвоюється-потроюється, а технологічна дистанція лишається тою ж самою — десь ±20-25 пунктів. 🤯 І тут варто розділити дві речі: оцінка компанії — це ставка на майбутнє, а AA Index — це вимір теперішнього. → Але якщо ви думаєте, що «Mistral — ґавно, а не стартап» — нагадаю: на момент мого минулого допису це була контора на два десятки людей, яка виросла в щось притомне, і це справді єдиний живий європейський розробник власних frontier-моделей. А проблема ж насправді не в команді, адже для закриття цієї дистанції потрібен, перш за все, compute, якого в Європи є аж цілих 5% світових обчислювальних потужностей. 😊 І, судячи з усього, самі ж Mistral цей розрив відчувають просто чудово, бо у квітні цього року, замість чергового релізу моделі, вони релізять маніфест під промовистою назвою «European AI: a playbook to own it». → На першій ж сторінці слова Менша (СЕО Mistral якщо ви з контексту не поняли) про те, що без рішучих дій Європа ризикує отримати «surveillance threats, economic decline, strategic weakness, and even the erosion of our democratic freedoms». Документ насправді доволі цікавий та місцями ґрунтовний, якщо є настрій — раджу пробігтись очима. Загалом там аж 22 конкретні заходи для того, щоб Європа набула субʼєктності на АІ-ринку. 😭 В цьому ж маніфесті Mistral, до речі, підтверджує, що 80%+ цифрової інфраструктури Європи — не-ЄС постачальники, а на весь континент припадає лише 5% глобального venture capita. У США, для порівняння, цей показник — 52%. 💪 Іншими словами — сама компанія і є тим єдиним активом, на який вся ця «суверенність» має спертись — і водночас найкращим доказом того, чому у Європи з проблеми compute. → Бо навіть «суверенний» стек самого Mistral — це десятки тисяч Nvidia GPU у французьких дата-центрах, а найбільший акціонер компанії — та сама ASML з початку допису, чиї машини нікуди не їдуть без експортних ліцензій: формально — нідерландських, фактично — Вашингтонських)) 😁 Тобто європейська незалежність фізично зібрана на американо-тайвансько-нідерландському апаратному ланцюжку. І це не тому, що Mistral щось робить не так — просто іншого заліза в природі не існує. 💃 На думку Менша, яку він озвучив у травні з трибуни Національних зборів Франції, виграє той, хто контролює чипи та електрони — у Європи є +- 2 роки, щоб не стати «васальною державою» в плані АІ. Ну але ок — виглядає все так, ніби план є, дедлайни є, навіть бюджетик попередньо прописаний. 😡 Лишається тільки одне питаннячко — чи встигне цей євроремонт спрацювати раніше, ніж станеться щось, що перевірить цю «суверенність» на практиці? А ой.......
Практичний воркшоп Agentic Engineering Workflow з двох частин: 📅 3 липня, пʼятниця, 19:00 - теорія: контекст, CLAUDE.md, субагенти, Ralph loop, переключення моделей 📅 4 липня, субота, 13:00 - практика: повний шлях фічі від ідеї до коду в production, наживо Веде Кирило Сулімовський - Head of Engineering GameInspire, керує 6 інженерними командами на highload (10k+ RPS, 200+ мікросервісів). Показує не «як має бути в теорії», а свій щоденний production-процес з Claude Code. На воркшопі - повний цикл від ідеї до коду: 🟢 Spec-Driven Development як основа керованої AI-розробки 🟢 контекст-інженерія: щоб агент не «забував» проєкт між сесіями 🟢 субагенти в паралель: код, тести, рев'ю, security 🟢 верифікаційні гейти, щоб агент не зламав усе одним рухом Буде корисно: Senior і Middle спеціалістам, Tech Lead'ам, Engineering-менеджерам, CTO і техфаундерам, які вже працюють з AI, але хочуть побудувати системний workflow в роботі. Два дні, живі демо на реальному проєкті. Практику можна проходити разом із Кирилом: він ділиться власним репозиторієм, тож ти не просто дивишся, а і робиш. 🔥 Лише сьогодні діє найкраща ціна. Встигни зайняти місце - далі вона підніметься. Запис воркшопу теж буде. Деталі, наповнення і реєстрація 🔗