Имангулов Инженер
СтатистикаData Engineer, нёрд, вайбкодер. EN: https://linkedin.com/in/imangulov, @newezha, @tatarchgk. DM: @abimangulov
- Последний пост
- 3 авг.
- Последнее чтение
- 18:07
- Постов за неделю
- 0
- Всего постов
- 21
- Тип
- открытый
- Язык
- русский
- В каталоге с
- 12 авг.
- 1/24сутки в ленте
- 57
- 1/48двое суток
- 65
- 1/72трое суток
- 70
Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.
Посты
В том, насколько бесполезные вещи можно узнать с помощью искусственного интеллекта, меня злит только то, что эти бесполезные вещи придумал спросить не я.
Ура, закончил писать блок на International Clown Week. Сотоварищи-клоун_ессы подошли к делу очень серьезно, поэтому пришлось немного постараться, вопреки отпуску и неврастении. https://imangulova.github.io/games/ Daily Train Tracks #26 🚂✅ 🔴 8×8 · 0:49 Daily Battleships #26 🚢✅ 10×10 · 0:44 Русский Catfishing #55 - 5.5/10 🐟🐈🐟🐟🐈 🐈🐈🐟🐈🐠 Anagram Daily #24 10/20 Анаграмма дня #23 19/20
без подписи
без подписи
без подписи
без подписи
без подписи
В этом смысле мне нравится интернет 2.5, который выгрызает себе пространство свободы. Нескромно здесь посоветую и свой сайт, пока что на гитхабе, потому что мне лень переезжать, но пишу не про него. С большим интересом слежу за плеядой нью-йоркских и не только дизайнеров в Твиттере, которые пилят сайты, игры и другие классные штуки, поддерживают друг друга в творческом движе. Вы наверняка знаете про Нила Агарвала https://neal.fun/ (если думаете, что не знаете, посмотрите на список его проектов — знаете) Ещё посоветую вам Нолена Роялти — меня потрясли его проекты PacCam (пакмэн, которым ты управляешь своим лицом, пока оно кэпчурится с вебки) и One Million Checkboxes. https://eieio.games/ Сегодня в это число добавилась дизайнерка Сэми Смит https://samismith.com/ — я влюбился в её проект "Клипарт.Студио" Идея потрясающая — на сайт загружено куча винтажных журналов (но ты можешь загрузить и свои). Хотя формально идея в том, что с этими журналами ты можешь сделать коллажи, ещё это просто возможность полазать по старым журналам и поностальгировать по каким-то наивным и детским временам изучения цветастых, пахнущих неизвестно чем приятно-химическим, страниц. Я как раз думал оцифровать журналы самарских поэтов и положить их в интернет, а теперь чувствую себя почти обязанным так сделать. Ну и раз уж я потратил полчаса на свой коллаж, покажу и чужие коллажи с галереи этого сайта, которые нахожу прекрасными!
На днях видел мысль, которая меня потрясла: правые люди много заигрывают с ИИ-слопом (вы видели этих сгенерированных тредвайф и мигрантов, которые говорят, что едут вас обкрадывать). гипотеза одного блогера в том, что поскольку многие искусства — типа дизайна — были очень долго преимущественно левыми и немножко гейткиперскими, сейчас правые чувствуют себя "дорвавшимися" до искусства и свободы. В известном смысле мне кажется, что то же самое сейчас происходит с программированием и с инжинирингом данных — нет-нет, у стартапов и корпораций я буду продолжать просить высокую зарплату, но вот порог входа в программирование как творчество снизился страшно сильно, и это правда те самые "сто цветов", которым должно было цвесть. Очень нравится и то, как в этом разговоре Хэнк Грин использует парадокс Джевонса: может статься, что то, что ИИ делает вещи дешевле и быстрее, на самом деле даст дорогу куда большему софтвер-инженерному простору, чем было раньше; так же, как и переписчики книг в средневековье, увидевшие Библию Гуттенберга, не могли представить себе... ну, ежедневные газеты и миллионные тиражи. А что за иллюстрация у этого поста? Сейчас расскажу.
без подписи
Перед собесом решил изучить кабанчика (так в моём доме повелось называть книжку O'Reilly "Дизайн дата-интенсивных приложений"), думал, этично ли выкладывать что-то, что я по ней нагенерировал, в интернет, но авторское право в программировании, кхм, переживает не лучшие времена. Поэтому вот эта книга лежит у чела на гитхабе просто. Что это за чел? Как он до этого додумался? Почему никто не прибежал к ниму с кирпичом? Загадка. Но дело не в этом. Чтобы процесс обучения шёл быстрее (а я мог покататься на велике), решил сделать себе на ноутбуке диалоги-подкасты а-ля NotebookLM, но опенсорсно, чтоб потом быстро залить .mp3 себе в телеграм. В итоге сделал я это с помощью неплохой и лёгкой модели Piper и маленького питон-скрипта, но перед этим я попробовал mac'овский вариант озвучки с помощью той модели say, которая там преустановлена... Я нахожу что-то уютное в этом. Этот роботизированный, совсем не человеческий голос, спотыкающийся о смену языка в предложении или каждое незнакомое слово, словно флэшбек куда-нибудь 10 лет назад, когда было ещё не так очевидно, что все мы умрём. Поделюсь этим чудовищным и забавным артефактом с вами, друзья.
https://imangulova.github.io/games/ Daily Train Tracks #8 🚂✅ 🟠 7×7 · 1:22 Daily Battleships #8 🚢✅ 10×10 · 0:44 Anagram Daily #6 15/20 Анаграмма дня #5 14/20
У КОГО ИЗ КОМИКОВ САМЫЙ БОГАТЫЙ СЛОВАРНЫЙ ЗАПАС? Задавались ли вы этим вопросом? Наверняка нет! А вот мы с коллегой из канала невежда (он все сделал, я чисто идею подогнала) задались и проанализировали 571 выступление российских стендап-комиков. Мы загрузили тексты выступлений в нейросеть, а она проанализировала их по количеству уникальных лемм. Лемма — это словарная, или начальная, форма слова. Все грамматические формы одного и того же слова сводятся к одной лемме. То есть, если комик рассказывает про простату, слова «простата», «простаты», «простате», «простату» и так далее будут относиться к одной лемме. Вам уже, наверное, интересно, чей стендап посмотреть, чтобы пополнить свой словарный запас. Кликайте сюда: РЕЙТИНГ КОМИКОВ ПО СЛОВАРНОМУ ЗАПАСУ А еще мы нашли комикам их лексических побратимов. На этой странице вы сможете найти самых похожих друг на друга комиков по лексике, смыслу и манере повествования. ПОХОЖИЕ КОМИКИ Некоторые люди в списке уже являются иноагентами, а у некоторых все еще впереди.
без подписи
без подписи
без подписи
Сегодня: 1. Исправил баг в ЧГК-вокабуляре со словами и н-граммами "раздатки" / "раздаточный материал" 2. Исправил баг с шэрингом в Морском бое и других daily-games и исправил race-condition, по которому твоё собственное решение не учитывалось в finished решениях 3. Запилил с Юлей @chapellepozvonit большое исследование русского стэндапа — больше постов и исследований вечером 4. Благодаря внимательности Наиля узнал, что чемпионаты Турции по ЧГК проходили в рамках фестиваля "Турецкий берег". Добавил на карту chgk-worldwide Турцию и Черногорию (которую тоже отметил Наиль).
Вставил нейросеть в нейросеть https://imangulova.github.io/chgk-vocab/similarity.html Собственно, то, что наивный tf-idf провалит задачу поиска самых близких авторов, было предсказуемо (больше всех пишут Мерзляков и Кудрявцев, поэтому у всех в топ-3 похожести были Мерзляков и Кудрявцев) Но вот так фокус: оказалось, что за последние 10 лет, пока я не занимался ничем, похожим на сентимент анализ, появились ещё более умные способы. Самый умный из них — запихать всё в doc2vec, но и другие интересные тоже нашлись, смотрите: https://imangulova.github.io/chgk-vocab/howsim.html Короче, красиво получилось. Но и багов ещё много: один баг оказался таким: незнакомым словам пакет pymorph пытался автоматически "угадать" часть речи — так из Мэри Роуч получилось смешное слово "роучий", а Наиль Фарукшин не знал, откуда в его текстах появился глагол "Базть" (из фамилии Эрве Базена). Кстати, Эрве Базен появился у меня в одной из задач проекта "Анаграмма дня"... но про это уже в следующем посте.
без подписи
без подписи