- Последний пост
- 19 июн.
- Последнее чтение
- 13:11
- Постов за неделю
- 0
- Всего постов
- 20
- Тип
- открытый
- Язык
- русский
- В каталоге с
- 13 авг.
- 1/24сутки в ленте
- —
- 1/48двое суток
- —
- 1/72трое суток
- —
Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.
Посты
Гугл обновил документацию про переезд сайта - рекомендуется добавлять все варианты домена в инструмент изменения адреса: Если вы переносите свой сайт с одного домена на другой, обязательно отправьте запросы на изменение адреса для всех поддоменов, а также для вариантов старого доменного имени с www и без www (например, с en.example.com, www.example.com и example.com на new-example.net), даже если вы активно не используете эти варианты. Убедитесь, что все эти варианты подтверждены в Search Console.
💪 Парсинг доменов expireddomains.net через A-Parser Сегодня на почту пришла рассылка от A-Parser, пригодится тем, у кого на expireddomains.net нет кнопки экспорта в txt/csv файл. Обновление парсера для сбора данных об удаленных доменах Пресет полностью переписан на JS-парсер Учтена новая обязательная авторизация с MFA Реализована загрузка данных таблицы через XHR-запросы Обновлен набор колонок: убрана ALEXA, добавлены WBY, MMGR и List 🔗 https://a-parser.com/resources/320/ Сам не тестировал правда. Ну и само собой, заряженный на удачу промокод: SHILOV-30$-OFF ✉️ @bakalov_info | #aparser #дропы #expireddomains
https://regulation.gov.ru/projects/164913/
видео или голосовое, без подписи
Ну и допом резюмируем, что за инструменты есть у нас на борту (как в боте @affiliatefm_bot, так и на сайте): - Каноническая страница, выбранная Google: Покажет каноникал выбранный гуглом почти со 100% достоверностью результата, высокий аптайм инструмента, не ломается, обходит почти все виды защиты и клоаки - Смотреть как GoogleBot: Инструмент смотреть, как гугл бот, но фактически таковым все таки не является. Он предназначен больше для обхода защиты Cloudflare по флагу Known Bots. Но как полноценный GoogleBot он все таки себя вести не может, т.к. по некоторым паттернам его все же детектят, и он не покажет контент, доступный только поисковику. Иногда хорошо детектит цепочки редиректов последовательных. Иногда показывает скрытый от обычного юзера контент. - Google Cache: Инструмент покажет копию страницы с гугл кеша. Практически не обходится никакими видами защиты, но проблема в том, что он постоянно умирает (каждый час), и требует ручного перезапуска. Потому, инструмент хоть фактически и является охуенным, т.к. показывает все скрытое от юзера, и доступное только гугл боту, но, к сожалению, работает чрезмерно проблемно, и будет значительное время простаивать в нерабочем состоянии. Ну и бонусом ИИ-рерайтер: рерайтит статьи через chatgpt 4.1. Намеренно создан, чтобы рерайтить близко к оригинальной структуре источника, т.к. это то, что нужно в топе. Хоть на вид будто бы качество оставляет желать лучшего, но гуглу нравится, т.к. уникальность 95+%, он с удовольствием это кушает. Подписчикам 10 бесплатных рерайтов в день. Все инструменты доступны только подписчикам канала (иначе нам убьют рейт лимиты). Как с сайта, так и в виде тг мини апп (каноникал, гуглбот, кэш, рерайтер), так и в боте @affiliatefm_bot. P.S: Мы не гарантируем вечный лайфтайм указанных инструментов, т.к. все это время ранее они использовались исключительно внутри, по умеренным рейт лимитам. Так что, возможно, после выхода в паблик, качество их работоспособности ухудшится. А на дистанции может гугл и вовсе прикроет используемые лазейки.
Как ИИ извлекает контент со страниц сайта 🖥 Наткнулся на интересный анализ, в котором протестировали 15 вариантов HTML-кодов, для того, чтобы определить, как LLM-модели извлекают контент из веб-страниц. В данном анализе описан эксперимент, целью которого было оценить возможность извлечения структурированного контента из HTML-страниц с различными шаблонами разметки. Задача заключалась в определении того, какие структуры HTML позволяют успешно извлекать информацию, а какие создают проблемы для автоматизированных систем чтения. Было протестировано пятнадцать вариантов HTML-страниц, каждая из которых содержала информацию о продукте (название, описание и цена), но была структурирована совершенно по-разному. Результаты выявили интересные закономерности в том, как системы извлечения информации интерпретируют веб-контент. Процесс извлечения контента Когда LLM-модели парсят веб-страницы с помощью встроенных инструментов, они обычно не выполняют JavaScript. Это простой HTTP-запрос, который загружает статический HTML-код с сервера: 1. Скрипты JavaScript не выполняются 2. CSS-стили не отображаются 3. Отсутствует визуальный/рендеренный контекст 4. С сервера получается только необработанный HTML-код LLM-модели не видят полный HTML-код . Эвристические алгоритмы извлечения отфильтровывают то, что они считают "шумом", прежде чем передать контент модели. Определение основного контента Система определяет, что является "основным контентом", используя эвристические методы, такие как: 1. Плотность текста в контейнерах 2. Удаление элементов, не относящихся к контенту 3. Элементы, считающиеся "шумом", устраняются или игнорируются Обычно фильтруются такие элементы, как: - шаблонный текст - <nav> - <footer> - <aside> - <script> - <style> - <iframe> - <meta> - HTML-комментарии Это одна из причин, почему ни один веб-инструмент, выполняющий выборку данных внутри LLM, не считывает схему. Хотя другие ИИ, такие как Gemini и ChatGPT, не продемонстрировали проблем с извлечением информации в этом эксперименте, это не означает, что мы можем игнорировать структуру HTML. Способ преобразования контента в обычный текст в «режиме чтения» имеет семантическое значение, которое напрямую вытекает из DOM. Хорошо структурированная страница облегчает понимание контекста и контента, независимо от модели, обрабатывающей ее. Также в статье приведены 15 примеров HTML-кодов, и результаты извлечения контента из них . Рекомендую ознакомиться 😉 Источник: https://natzir.com/posicionamiento-buscadores/experimento-analisis-de-extraccion-de-contenido-html-en-claude/ #ии
Дима выложил пост про автоматизацию составления анкор-листа. Добавлю от себя: Можно выгружать фразы не через интерфейс GSC, а через Looker Studio, тогда: 1) Получите не 1000 ключей, а все, что есть в GSC 2) Можно выгружать сразу связку ключ - целевой url Также для повышения качества выгрузки есть возможность фильтрации (впрочем как и в GSC): — Можно вырезать брендовые запросы; — Можно вырезать фразы с ограничениями по позиции (не закупать на топ-1; не выгружать фразы с низкой средней позицией - там часто мусор) На скринах показал как это сделать. Ну и очевидно, так можно просто выгружать всю семантику из GSC, а не только первые 1000 фраз, но про это вроде и так уже все знают. *** Также аналогичные отчеты можно выгрузить из keys.so, ahrefs, ЯВМ, метрики и т.д. Удобно как для проектирования анкоров внешних ссылок, так и для автоматической перелинковки внутри своего сайта. _____________________________ #советы_и_инструкции Канал - Strong SEO
🔥 Возвращаем работоспособность сайтам за cloudflare На фоне массовых блокировок Cloudflare и Amazon, делюсь короткой инструкцией, как вернуть работоспособность вашим сайтам. 💡 Фишка проста: отключаем проксирование IP. Но в этом случае спалится реальный IP сервера (вы понимаете, о чём я). Чтобы этого избежать — можно использовать Fastly для проксирования IP-адреса. Сайты снова «летают», а адреса проксируются. ✅ Плюсы: • Бесплатный тариф ❌ Минусы: • Нет защиты, которую давал Cloudflare • Лимит трафика: 50 ГБ • Ограничение по запросам: 2 млн 🛠 Как настроить Fastly шаг за шагом: 1. Регистрируемся на fastly.com/signup 2. Можно использовать ту же почту, что и в Cloudflare, или временную: 10minutemail.net 3. Подтверждаем почту, активируем аккаунт 4. Входим в личный кабинет: manage.fastly.com 5. Появится окно Add a domain, host, and name 6. В Domain — указываем свой домен 7. В Host — IP-адрес вашего сервера 8. Service name — можно оставить как есть или указать своё 9. Жмём Deploy 10. Далее Configure DNS → Skip 11. После надписи Your site is now live — нажимаем Configure 12. Переходим в Security → TLS Management → Domains 13. Там будет подсказка: Create a CNAME for _acme-challenge.*****.com and point it to ******.fastly-validations.com 14. Идём в Cloudflare, где лежит домен, и создаём CNAME-запись в DNS 15. Отключаем проксирование (оставляем DNS Only) и сохраняем 16. Ждём валидацию от Fastly 17. Когда появится TLS status: Ready to activate → жмём View/Edit → копируем CNAME t.sni.global.fastly.net 18. Эту запись указываем вместо текущих A-записей в Cloudflare 19. Везде отключаем проксирование (DNS Only) в итоге у вас должно получится что-то такое: CNAME _acme-challenge ****.fastly-… DNS only Auto CNAME site.com t.sni.global.fastly.net DNS only Auto CNAME www t.sni.global.fastly.net DNS only Auto 20. Ждём немного и проверяем: IP сайта теперь принадлежит Fastly, Inc. 21. Нужен второй аккаунт? Чистим куки и повторяем процедуру (хотя это не всегда нужно) 📝 P.S. Возможно, потребуется внести правки в .htaccess, если у вас включён редирект или HSTS. by @seo_drift
🆕 Находим "мусор" в семантике через регулярки Яндекс выкатил небольшое обновление в Мониторинге запросов. А мы — вместе с GPT — уже накидали бетку конструктора, чтобы быстро находить или отсекать накрученные запросы 💡 Как пользоваться: 1. Перейди по ссылке: 🔗 https://seo-drift.ru/tools/sem-regex/ 2. Отметь нужные чекбоксы (наведи, чтобы прочитать описание каждого фильтра) 3. Внизу появится строка с готовым Regex 4. Скопируй и вставь его в фильтр в Вебмастере Пробуй, тестируй, делись фидбеком! by @seo_drift
Надоело листать вакансии? С прошлого года отбираю на какие можно посмотреть. По максимуму удалил повторы работного сайта. Листать каждые три дня одно и тоже, такое ) Вывел информацию, для принятия решения, открывать вакансию или нет. Вывел в чат уникальные вакансии каждого работодателя с 01.01.2025 в пределах месяца с ЗП, в вилку в которую попадает цифра 120k, и более (или эквивалент в валюте), или домен является ТОП хостом в доменной зоне RU (DR более 70). Получилось уже более 800 вакансий. А всего в базе уже более 6000. Сделал попытку определить: Принадлежность вакансии к одному из типов (список ниже) организации которая нанимает. Всего 24. Если вакансия в инхаусе, но тип ее определить сложно, присваивается Inhouse. И тип работы (удалённая, гибрид, офис). Если работодателем явно выставлена - удаленная работа, то она и выводиться. Для всех остальных определяется по тексту. Также основные hard скилы, которые кажутся небанальными и важными. И получилось хорошо (о мелких неточностях расскажете)) А полная база вакансий за 2 месяца, с большим количеством срезов в отдельном дашборде. MVP - https://seocareer.ru/ Парсинг проводился сначала, почти ежедневно, потом в основном раз в неделю по пятницам, а вакансии за неделю не закрывается. Вернулся к сбору два раза в неделю. Когда компания нанимала? Как долго она закрывает вакансию? Как часто она ищет кандидата? Что востребовано в вакансиях? Что с рынком? И еще много гипотез... Если у вас есть что сказать про вакансию, вы работали на этой позиции, или ходили на собеседование, поделитесь в комментарии к этой вакансии, ил в чате, куда в том числе эти комментарии и будут попадать - https://t.me/+W0oTbxhAJBNkNWU6 Пишите предложения, вопросы под одним из стартовых постов, обсудим. Нашли работу, поставьте лайк, порадуюсь
Сделал, кмк полезную историю по вакансиям, и собираюсь продолжить ее развитие. Буду рад репосту. С наступающим!
Полностью переработал весь центральный блок надстройки. Теперь там все инструменты связаны. Настройки из одной формы применяются в другой. Все переписано под XMLRiver, так как там есть выдача гугла, и она у меня уже тоже работает. Вся лемматизация ускорена в 10 раз. Все работает настолько быстро, насколько вообще XMLRiver отдает. Я составляю произвольный список слов и подсвечиваю их в выдаче красным. Зеленым светится "мой" продвигаемый сайт. А могу не один запрос так посмотреть, а список запросов. И Кнопки Я и G вывел в Excel на панель быстрого доступа через alt+3 , alt+4 (левый верхний угол) для быстрого просмотра выдачи. И внешний вид выдачи переработал. Это все кажется мне очень важным. А вы чем на майских занимались?
🚀 Скрипт для анализа запросов Яндекс.Вебмастера Недавно я попробовал использовать скрипт из этого поста, но он показался мне недостаточно информативным для моих задач. Основная идея там сводится к суммированию показов и кликов по страницам, а также расчету средней позиции. Однако мне хотелось большего контроля и гибкости в анализе, поэтому я сделал своё решение. 💡 Что получилось: Я создал собственный скрипт для анализа запросов из Яндекс.Вебмастера, который: ▫️Позволяет фильтровать данные по URL, ключевым словам и брендовым запросам. ▫️Поддерживает анализ динамики изменений метрик (показы, клики, позиции и т.д.). ▫️Рассчитывает процентные изменения, выделяет аномалии и предоставляет визуализацию в виде гистограмм. ▫️Полностью автоматизирует процесс, от фильтрации до формирования итогового файла. 📂 Код и инструкция: Скрипт доступен на GitHub: https://github.com/Fairfaks/wm-analyser. Там вы найдете всю информацию, включая подробное описание и примеры входных и выходных данных. 🙌 Почему это полезно: Если вам нужно больше, чем просто суммы показов и кликов, этот скрипт поможет глубже понять, что происходит с вашими запросами. А добавленные фильтры и возможности анализа позволят сосредоточиться на действительно важных данных. Попробуйте и поделитесь, если тоже найдете его полезным! 🚀
Topical Authority что это такое за зверь и как он работает? Все мы нихрена не знаем и не понимаем как работает Гугл, он типа любит ссылки и на этом познания сеошников заканчиваются, давайте немного разберем модную нынче тему тематической карты авторитета сайта. Мы все ее делаем в том или ином виде, но давайте посмотрим какие патенты есть у Google на этот счет и как он потом может ранжировать наш тематический авторитет. 1. Seed keyword + Keyword Categories (US11106712B2) Google начинает с ключевой темы (например, us visa) и строит семантические кластеры: 📍 например: "green card", "student visa", "immigration lawyer", "uscis". Чем больше категорий покрывает сайт — тем выше его тематическая полнота. 2. Affinity Score — метрика близости к теме Каждая фраза получает оценку связи с seed keyword, основанную на частоте совместных появлений в документах сайта. 📌 Пример: если "ds-160" часто встречается с "us visa" — это сильная семантическая пара. 3. Оценка по keyword coverage в кластере Google проверяет, насколько хорошо сайт покрывает все ключи внутри категории. 📊 Если у тебя есть только “F-1 visa”, но нет “J-1”, “B-2”, “H-1B” — тематика не считается полной. 4. N-граммовая модель качества (US9767157B2) Google использует n-граммы (фразы из 2–4 слов), чтобы предсказать качество сайта. 📈 Частота встречаемости этих фраз на авторитетных сайтах — главный сигнал. ✍️ Пример: "visa interview questions" — сильная фраза → улучшает оценку страницы. 5. Покрытие сущностей (Named Entities) Сайт, на котором часто упоминаются конкретные сущности (📌например, USCIS, Department of State, I-94, Embassy), получает больший вес как тематический источник. 6. Учет структуры URL и page depth По патенту 11106712B2, URL-глубина и путь (📌например: /usa/visas/f1/requirements) может влиять на вес страницы внутри тематики. Чем лучше структурирована группа страниц — тем выше доверие. 7. Взвешенность ключей: не только наличие, но и положение Фразы в title, H1, анкорах ссылок, первых абзацах → дают высший приоритет. А в футере, сайдбаре и т.п. — слабый сигнал или игнор. 8. Semantic conflict resolution (патент 11106712B2) Если на сайте появляются противоречивые темы (📌например, визы в США и казино), Google обнуляет слабые кластеры, оставляя только самые сильные тематически. 9. Агрегация на уровне siteChunk (кластер URL) Тематическая оценка применяется не только к страницам, но и к группам (например, /blog/, /guides/, /visas/). 📌 Если вся группа имеет высокие показатели — она становится тематическим “ядром” сайта. 10. Оценка стабильности и разнообразия (9767157B2) Смотрится не только “есть ли тема”, но и: a) разнообразие статей, b) регулярность публикаций, c) повторяемость ключевых тем → устойчивость к манипуляциям. Как Google ранжирует тематические кластеры и домены? Если у сайта есть кластер (например, /us-visas/), то он получает свой собственный “групповой рейтинг”, который влияет на все страницы в группе. (см СКРИН) Если у группы /us-visas/: a) высокое покрытие фраз (по 11106712B2), b) хорошее семантическое качество (по 9767157B2), c) сильное поведение (по 10055467B1), 📈 → Google будет ранжировать её выше и повышать весь кластер в поиске, даже если у отдельных страниц мало ссылок. Это и есть Topical Authority. P.S. Ну и конечно нужно делать оптимизацию по доктору Максу, иначе не взлетит :) Да вы все еще можете купить курс по PBN от Андрея Ставского с моим промо seotrend на 10%
🔂 Создание резервных копий сайтов и синхронизация баз данных между разными хостингами 🔥 Делимся готовой технологией по созданию системы резервирования и репликации баз данных для веб-сайтов, которая обеспечит их доступность даже при сбоях хостинга. ✔️ Такое решение будет полезно тем, кто сталкивается с нестабильными хостингами, хочет избежать потери данных и минимизировать время простоя. Рассказываем, как настроить автоматическую синхронизацию данных между основным и резервным серверами, используя Cloudflare и PHP. ⭐️ Бонусом даем ссылку на готовый скрипт, который мы разработали для решения этой задачи. ➡️ Все это в нашей новой статье: https://cutt.ly/IeBQ73KW
Всем добра Кто «правит» аукционами? Решили проверить и свести в 1 таблицу данные по всем аукционам гоудедди за ~2 месяца (июль-сентябрь). Что внутри: 1. Цена на каждый купленный домен 2. Разбивка цены по каждой категории и стоимости 3. Тематика каждого домена До/ после покупки 4. Отсев некупленных на аукционе доменов 5. Сводная статистика по всем доменам: сколько стоит в зависимости от старта сайта, др 6. Кто и сколько доменов хостится на cloudflare Ну и самое сладкое: Вы можете свести для себя всю необходимую аналитику которую вы посчитаете нужным - внутри есть все необходимые seo’шные данные, вы ограничены только своей фантазией Сама табличка https://docs.google.com/spreadsheets/d/1VKfLbEUE7F8Vbgzw4S1HPb5NKdEi4Lh5oY9CmadBUb4/edit?gid=569868604#gid=569868604 П.с. После этой аналитики можно не гадать, а почему же гугл выкатил фильтр против казино на дропах и что «не работают эти ваши дропы чет» :) Всегда ваши @mishkivinternete
Так народ я хочу сделать новый курс по Ecomm и Агрегаторам, вот его примерная программа: 1. Что важно знать перед продвижением? * Введение в оффлайн теорию, для чего это все нужно? * Что такое Proxima и какие у нее компоненты в Яндексе * Асессорские инструкции в отношение Агрегаторов и Ecomm сайтов * Типы магазинов и агрегаторов - классификация от Яндекса, что не является екоммом * Сценарии пользователей и интенты в екомм * Отзывы на сайте, что важно учитывать? в чем суть фильтра за антикачество, почему это важно * Что такое ТРАСТ сайта на языке факторов ранжирования в Яндексе 2. Оформление важных элементов сайта: * Главная страница, почему она важна и что на ней должно быть * Меню сайта, что в нем важно вывести * Гео привязка - варианты привязки и построение структуры, как совместить это для Яндекса и Гугла * Служебные страницы, как их оформлять (URL, мета тега, наполнение) * Опции листингов, что должен уметь ваш листинг (Тз для программистов, функционал) 3. Методы оптимизации основных типов страниц на первом этапе и последующая доработка по текстам и ссылкам: * Карточки, отзывы, характеристики * Категории, теги, бренды По текстовой оптимизации: * СЕОШНЫЕ метрики: вхождения + LSI - как оптимизировать? какими инструментами пользоваться? * Офлайн метрики текста (EAT в РФ): Полнота ответа, Актуальность, Авторитетность, Достоверность, Уместность - что это такое и как это проверять? По ссылкам: *Перелинковка для ранжирования и для индексации - когда и как использовать * Внешние ссылки для ранжирования - ключевые моменты при составления анкор листа и выборе доноров (Биржи, Дропы, Клей) 4. Фильтры и проблемы сайтов: * МПК - что это такое и как решать вопрос * Страница просканирована, но пока не проиндексирована и Обнаружена, не проиндексирована что делать * Баден Баден - в чем суть фильтра, как снять и не попасть * Аффилиат фильтр - в чем суть, на каких факторах считается, как накладывается и как снимается (не банальщина) 5. Как делать исследование ниши? * Как выявить реальных конкурентов и на что важно обращать внимание: структура, ссылки, перелинковка, ГЕО оптимизация, текстовая оптимизация + УТП * Анализ выдачи - конкуренты, смены алгоритмов, баги, накрутки * Самостоятельная разметка выдачи под разные задачи На курсе будет два тарифа для физ лиц и для Юр лиц, предварительные цены от 100к рублей, если вам интересна программа, то можно предварительно записаться сейчас по этой форме https://forms.gle/XMJJJ5UWvguS7XYr5 Если наберем 20 и более заявок, то курсу быть. Обратите внимание что моя программа будет отличаться от программы Алексея Чекушина https://seedu.ru/kurs-internet-magazin/ поэтому если вы уже смотрели его курс, то я рекомендую обязательно посмотреть и мой, так как Алексей на мой взгляд очень многие вопросы у себя на курсе не раскрыл - например что все касается проксимы и офлайн оценок, а это очень важно, потому что у нас есть хостовый вектор качества, так называемая "коммерческая компонента качества". Стартуем в конце Января 2025 года, последующий повтор будет только в 2026 году. В чем отличия моего основного курса от нового? Если вкратце, то будет в нем не будет фокуса на обзор всех алгоритмов ПС, а будет фокус только на работу с крупными сайтами и методами их оптимизации. И обратите внимание в программе нет слов - поведенческие факторы и коммерческие факторы :) Это не значит что вы про это ничего не узнаете, это означает что вы по настоящему поймете что вам важно в продвижении крупных сайтов - как говорит Михаил Сливинский: "Без Булщита" Увидимся на курсе :) для тех, кто купил мой основной курс https://dzhilavdarov-seo.ru/ будет значительная скидка :)
Кластеризатор массивных семантических ядер по схожести выдачи Для огромных семантических ядер скорость и масштабирумость группировки может быть более важна, чем ее точность, поэтому для таких случаев у меня был в запасе другой алгоритм. Он является продолжением идеи кластеризации через меру Жаккара описанной в предыдущих постах (1, 2). В комментариях к постам и в личных сообщениях возник интерес к решениям для массивных семантических ядер, поэтому я переписал предыдущий скрипт для них. За репост буду благодарен! 🙏 В алгоритме используется техника MinHash и LSH. Этот метод, основанный на хэшировании и индексации множеств, позволяет быстро искать частичные дубликаты на больших данных. Он также, как кластеризатор из предыдущих постов, менее ресурсоемкий, чем векторное преобразование и операции над матрицами. В чем разница между мерой Жаккара и этим решением? Точность vs. Эффективность: Коэффициент Жаккара обеспечивает точное значение схожести, но неэффективен для больших данных. MinHash и LSH предоставляют приближенное значение, но значительно более эффективны для обработки больших объемов данных. Например, японское семантическое ядро в 480 тысяч ключевых фраз было сгруппировано за 30 минут. Конечный результат вполне устроил, учитывая, что метод на основе Жаккара считал такой объем более суток. Отлично подойдет для дорвейщиков! Скачать можно здесь: https://drive.google.com/file/d/1b01TbXmWINe3w0haneMcHVy-opFZkwqH/view?usp=share_link Проект на Github: https://github.com/dartseoengineer/keyword-clustering-minhash Инструкция Внимание! Этот скрипт только кластеризует, для сбора выдачи используйте сторонние программы, например, A-Parser. 1. Предварительно установите библиотеки pandas и tqdm. pip install pandas pip install tqdm pip install datasketch 2. Инструкция по использованию скрипта в командной строке: Обязательные аргументы input_file: Путь к входному CSV файлу. output_file: Путь для сохранения выходного файла с кластеризованными ключевыми словами. Необязательные аргументы -s, --separator: Разделитель во входном файле (по умолчанию: `,`). -k, --keyword_col: Название столбца с ключевыми словами во входном файле (по умолчанию: `Keyword`). -u, --url_col: Название столбца с URL во входном файле (по умолчанию: `URL`). -t, --similarity_threshold: Порог схожести (по умолчанию: `0.6`). Пример команды в терминале python minhash-cluster-cli.py for-clustering.csv clustered_keywords.csv -s ';' -k 'keyword' -u 'url' -t 0.6 Файл результатов 1. Каждая группа в колонке Group имеет номер, начинающийся с 0. 2. Ключевые фразы, которые объеденены в один кластер, будут иметь один номер группы. 3. Если фраза не имеет общих групп с другими фразами, то она выделяется в отдельную группу. 4. Если фразы не имеют собранных URL, то они все выделяются в группу -1.
Скрипт на Python для массовой проверки Reverse DNS 🔎 Для работы со скриптом вам понадобится: 1. Сам питон - качаем от сюда https://www.python.org/downloads/ 2. Рабочая среда (я использую PyCharm) - скачать можно здесь https://www.jetbrains.com/ru-ru/pycharm/download/?section=windows 3. Пакетный менеджер pip (в командной строке пропишите pip install). Или установите по гайдам 4. Библиотека openpyxl для работы с Excel (в командной строке пропишите pip install openpyxl) Порядок действий следующий: 1. Скачиваем скрипт на рабочий стол 2. Скачиваем файл ip.txt также на рабочий стол 3. В файл ip.txt вставляем айпишники из логов серверов 4. Запускаем скрипт 5. Если все сделали правильно, на рабочем столе должен появиться эксель файл Скрипт и txt файл с примером ip-адресов будет в комментах под этим постом 😉 Как надо SEO +шить не надо 🔥 #техничка #python #скрипты
Проверка на реального бота ПС 🤖 Чтобы проверить является ли бот реальным, а не была произведена подмена User-agent при парсинге вашего сайта, просто выполните reverse dns. Reverse DNS (или обратный просмотр DNS) - это обращение к особой доменной зоне для определения имени узла по его IP-адресу c помощью PTR-записи. (источник). Если простыми словами, через Reverse DNS можно узнать домен зная с какого ip-адреса был сделан запрос к вашему серверу. Для этого достаточно прописать в консоле команду ping -a ip Пример запроса: ping -a 5.255.255.55 IP берем из ваших логов сервера. Вот основные подстроки ботов ПС, которые могут посетить ваш сайт: yandex.ru yandex.com yandex.net ya.ru google.ru google.com googlebot.com Например: если после выполнения обратного DNS вы видите следующие домены: spider.yandex.com nat64.yandex.net Это нормальные боты (не фейк и не подмена UA). Все остальное, можно не записывать в ваш SEO лог (в основные логи конечно же пишем все запросы запросы, в том числе пользователей). Как надо SEO +шить не надо 🔥 #техничка