У меня есть опыт парсинга сайтов, интернет-магазинов, каталогов в формат Excel (xlsx, xls, csv) или другой текстовый формат. Вот примеры: https://yadi.sk/d/8fzUZ9UU9YiC3w Я спарсил уже более 700 сайтов. В некоторых проектах я брал прайс-лист, сопоставлял товары со спарсенными мною данными сайта, также анализировал, есть ли фотография на товар, и добавлен ли он в интернет-магазине. Такой пример есть по ссылке выше. После парсинга, на скачанных картинках с сайта, иногда нужно удалить водяные знаки. Я делаю и это, смотрите другой мой кворк по удалению watermark https://kwork.ru/vector-tracing/9621286/1?ref=215711 В этот кворк входит: Парсинг 1 сайта. Формат файла Excel (xlsx, xls, csv). Набор из 8 очевидных полей со страницы (название, категория, цена, ссылки на картинку или какие-то другие данные). Без вариаций товара (цвета, размеры и пр). Скачивание одной основной фотографии со страницы. Объем до 20000 позиций. Все данные должны быть открыты и доступны в html, т. е. нет вывода данных подгрузкой контента или скриптами.