Пакеты. Обходим Антироботы поисковиков

Форум Сообщества Практиков Конкурентной разведки (СПКР)

Конкурентная разведка, Бизнес-разведка, Корпоративная разведка,
Деловая разведка по открытым источникам в бизнесе.
Работаем строго в рамках закона.

Дезинформация и активные мероприятия в бизнесе
Форум Сообщества Практиков Конкурентной разведки (СПКР) »   Программируем пакеты СайтСпутника (для продвинутых юзеров) »   Пакеты. Обходим Антироботы поисковиков
RSS

Пакеты. Обходим Антироботы поисковиков

Пакеты. Обходим "антироботы" поисковиков

<<Назад  Вперед>>Страницы: 1 * 2 3 4
Печать
 
Vinni
Администратор

Всего сообщений: 2136
Рейтинг пользователя: 22


Ссылка


Дата регистрации на форуме:
5 июня 2009
А чего не попробовать использовать обращения через группу прокси для обхода таких ограничений? Вон в том же 3proxy есть фича - выбор прокси случайным образом из группы прокси для каждого запроса :wink:
Алексей Мыльников
Долгожитель форума

Откуда: Волгоград
Всего сообщений: 877
Рейтинг пользователя: 6


Ссылка


Дата регистрации на форуме:
22 июня 2009

Vinni написал:
[q]
А чего не попробовать использовать обращения через группу прокси для обхода таких ограничений? Вон в том же 3proxy есть фича - выбор прокси случайным образом из группы прокси для каждого запроса
[/q]

Причина следующая - соблюдение (не нарушение) правил, которые устанавливает используемый ресурс (в данном случае поисковик).

Не "хочет", например, Яндекс обрабатывать с одного компьютера 100 запросов в минуту, значит на то есть причина и, соответственно, не стоит пытаться обмануть "папу". Понять его можно: если на орбиту Яндекса будет запущено 100 СайтСпутников, каждый из которых начнет тянуть одеяло на себя, если другие разработчики программ будут создавать программы перегружающие его аналогичным или другим способом, то одеяло может и порваться ...

vbl
Модератор форума

Откуда: Нижний Новгород
Всего сообщений: 179
Рейтинг пользователя: 0


Ссылка


Дата регистрации на форуме:
10 июня 2009
Ура, на часть вопросов получил ответ. Проблема роботом Яндекса отравляет жизнь уже достаточно давно, но в обычном поиске с использованием СайтСпутника не сильно мешает. А вот вчера заметил, что эта же проблема всплывает и при создании карты сайта (в т.ч. углубленной). Как в этом случае исправить ситуацию?


---
Non progredi est regredi

http://www.informnn.ru
Информационная рассылка "Конкурентная разведка. Сам себе разведчик" - http://subscribe.ru/catalog/tech.razvedka
Алексей Мыльников
Долгожитель форума

Откуда: Волгоград
Всего сообщений: 877
Рейтинг пользователя: 6


Ссылка


Дата регистрации на форуме:
22 июня 2009

vbl написал:
[q]
Ура, на часть вопросов получил ответ. Проблема роботом Яндекса отравляет жизнь уже достаточно давно, но в обычном поиске с использованием СайтСпутника не сильно мешает. А вот вчера заметил, что эта же проблема всплывает и при создании карты сайта (в т.ч. углубленной). Как в этом случае исправить ситуацию?
[/q]

1. Ян_дек с "злопамятен", дайте ему забыть о Вас. Не ищите в нем 15-24 часа.
2. Можно войти в него через IE, задать любой поиск, ввести запрашиваемое на капче число, но все равно желательно выполнить пункт 1.
3. После этого при построении больших карт сайтов (КС) используйте параметр: "Настройки - Параметры - Вкладка Интернет - "Антиробот: пауза между открытиями страниц поисковиков (от 0 до 20 сек)".

Если мне попадаются большие сайты, то я сначала делаю построение стандартной КС, по которой видна общая структура сайта. Затем смотрю на ней папки или ресурсы, которые мне интересны и запускаю построение КС этих папок или ресурсов. Бывает, что подобное углубление по месту делаю 3-5 раз, потому что встречаются очень большие сайты, которые человек не в силах просмотреть и обработать. Особенно это помогает при последующем применениии функций поиска в невидимом интернете.

Vinni
Администратор

Всего сообщений: 2136
Рейтинг пользователя: 22


Ссылка


Дата регистрации на форуме:
5 июня 2009

Alexei Mylnikov написал:
[q]
1. Ян_дек с "злопамятен", дайте ему забыть о Вас. Не ищите в нем 15-24 часа.
[/q]


То есть он учитывает историю данного IP (и возможно использует куки) :wink:

vbl
Модератор форума

Откуда: Нижний Новгород
Всего сообщений: 179
Рейтинг пользователя: 0


Ссылка


Дата регистрации на форуме:
10 июня 2009

Alexei Mylnikov написал:
[q]
1. Ян_дек с "злопамятен", дайте ему забыть о Вас. Не ищите в нем 15-24 часа.
2. Можно войти в него через IE, задать любой поиск, ввести запрашиваемое на капче число, но все равно желательно выполнить пункт 1.
3. После этого при построении больших карт сайтов (КС) используйте параметр: "Настройки - Параметры - Вкладка Интернет - "Антиробот: пауза между открытиями страниц поисковиков (от 0 до 20 сек)".
[/q]


1. Понятно, ну тут мы ему нос утрем :evil: , айпишник то у нас динамический. Только придется каждый раз отключаться - подключаться

3. Используем, но если не сделать, то что я указал в пункте 1, то помогает мало. К тому же очень долго идет процесс. При выставлении паузы в 4 сек., карта сайта, по моим субъективным подсчетам, создается раза в три дольше (а это примерно пара часов).

---
Non progredi est regredi

http://www.informnn.ru
Информационная рассылка "Конкурентная разведка. Сам себе разведчик" - http://subscribe.ru/catalog/tech.razvedka
vbl
Модератор форума

Откуда: Нижний Новгород
Всего сообщений: 179
Рейтинг пользователя: 0


Ссылка


Дата регистрации на форуме:
10 июня 2009

Vinni написал:
[q]
То есть он учитывает историю данного IP (и возможно использует куки) :wink:
[/q]


На мой взгляд, куки он не использует, так как все проходит при разрыве и новом восстановлении соединения с интернетом (у нас динамичный IP).

---
Non progredi est regredi

http://www.informnn.ru
Информационная рассылка "Конкурентная разведка. Сам себе разведчик" - http://subscribe.ru/catalog/tech.razvedka
CI-KP
Администратор

Откуда: Екатеринбург
Всего сообщений: 5565
Рейтинг пользователя: 24


Ссылка


Дата регистрации на форуме:
15 мая 2009

vbl написал:
[q]
айпишник то у нас динамический. Только придется каждый раз отключаться - подключаться
[/q]

Да. Это помогает. А еще, у него прямо предусмотрена регистрация для "хороших роботов". Если айпишник статический. но количество запросов не больше, чем он пропускает - можно воспользоваться.

---
Ющук Евгений Леонидович, профессор УрГЭУ. www.razvedka-internet.ru; www.ci-razvedka.ru
Не всегда нужно стремиться совершать кражу со взломом там, где можно войти через дверь.
Vinni
Администратор

Всего сообщений: 2136
Рейтинг пользователя: 22


Ссылка


Дата регистрации на форуме:
5 июня 2009
Интересно, а если через Тор работать (какбэ через проксю), это поможет? :smile:
vbl
Модератор форума

Откуда: Нижний Новгород
Всего сообщений: 179
Рейтинг пользователя: 0


Ссылка


Дата регистрации на форуме:
10 июня 2009

CI-KP написал:
[q]
А еще, у него прямо предусмотрена регистрация для "хороших роботов"
[/q]


А можно ссылочку?

---
Non progredi est regredi

http://www.informnn.ru
Информационная рассылка "Конкурентная разведка. Сам себе разведчик" - http://subscribe.ru/catalog/tech.razvedka
<<Назад  Вперед>>Страницы: 1 * 2 3 4
Печать
Форум Сообщества Практиков Конкурентной разведки (СПКР) »   Программируем пакеты СайтСпутника (для продвинутых юзеров) »   Пакеты. Обходим Антироботы поисковиков
RSS

Последние RSS
Англоязычный интерфейс программы "Сайт Спутник"
Учебник по конкурентной разведке
Конкурентная разведка: маркетинг рисков и возможностей
Книга "История частной разведки США"
Книга "Нетворкинг для разведчиков"
Поиск и сбор информации в интернете в программе СайтСпутник
Новые видеоуроки по программе СайтСпутник для начинающих
Технологическая разведка
SiteSputnik. Мониторинг Телеграм
СайтСпутник: возврат к ранее установленной версии
SiteSputnik. Доступ к результатам работы из браузера
Анализ URL
Браузер для анонимной работы
Топливно-энергетический комплекс
Профессиональные сообщества СБ
Несколько Проектов в одном, выполнение Проектов по частям
SiteSputnik-Bot: Боты в программе СайтСпутник
К вопросу о телеграм
SiteSputnik: Автозамены до и после Рубрикации или Перевода
Демо-доступ к ИАС социальных сетей

Самые активные 20 тем RSS