質問をすることでしか得られない、回答やアドバイスがある。

15分調べてもわからないことは、質問しよう!

新規登録して質問してみよう
ただいま回答率
85.50%
スクレイピング

スクレイピングとは、公開されているWebサイトからページ内の情報を抽出する技術です。

CSV

CSV(Comma-Separated Values)はコンマで区切られた明白なテキスト値のリストです。もしくは、そのフォーマットでひとつ以上のリストを含むファイルを指します。

Chrome

Google Chromeは携帯、テレビ、デスクトップなどの様々なプラットフォームで利用できるウェブブラウザです。Googleが開発したもので、Blink (レンダリングエンジン) とアプリケーションフレームワークを使用しています。

Python

Pythonは、コードの読みやすさが特徴的なプログラミング言語の1つです。 強い型付け、動的型付けに対応しており、後方互換性がないバージョン2系とバージョン3系が使用されています。 商用製品の開発にも無料で使用でき、OSだけでなく仮想環境にも対応。Unicodeによる文字列操作をサポートしているため、日本語処理も標準で可能です。

selenium

Selenium(セレニウム)は、ブラウザをプログラムで作動させるフレームワークです。この原理を使うことにより、ブラウザのユーザーテストなどを自動化にすることができます。

Q&A

解決済

1回答

1780閲覧

楽天市場からスクレイピングでデータを自動取得したいです。そのあとCSVに保存。

menuett

総合スコア15

スクレイピング

スクレイピングとは、公開されているWebサイトからページ内の情報を抽出する技術です。

CSV

CSV(Comma-Separated Values)はコンマで区切られた明白なテキスト値のリストです。もしくは、そのフォーマットでひとつ以上のリストを含むファイルを指します。

Chrome

Google Chromeは携帯、テレビ、デスクトップなどの様々なプラットフォームで利用できるウェブブラウザです。Googleが開発したもので、Blink (レンダリングエンジン) とアプリケーションフレームワークを使用しています。

Python

Pythonは、コードの読みやすさが特徴的なプログラミング言語の1つです。 強い型付け、動的型付けに対応しており、後方互換性がないバージョン2系とバージョン3系が使用されています。 商用製品の開発にも無料で使用でき、OSだけでなく仮想環境にも対応。Unicodeによる文字列操作をサポートしているため、日本語処理も標準で可能です。

selenium

Selenium(セレニウム)は、ブラウザをプログラムで作動させるフレームワークです。この原理を使うことにより、ブラウザのユーザーテストなどを自動化にすることができます。

0グッド

0クリップ

投稿2018/12/02 16:42

編集2018/12/04 14:02

Pythonスクレイピングで楽天市場から商品レビューと参考になった人数を自動で取得しようとしています。
以前はPhantomJSを使っていたのですが、seleniumでのサポートが終わったのでheadless Chromeで代用しようとしています。
やっている流れ
1.楽天市場のレビューを取得したいページに行きます。
2.そのページのURLをコピーします。
3.pageはページ数で最初は1にしておきます。pathは楽天レビューの「次の15件」のボタンのXpathです。
4.「次の15件」がそのページにあったらループ、なかったらbreakです
※なぜか「次の15件」のXpathが最初のページ以外違ったので、最後の方でpathを更新しています。
5.CSVに保存します。
csvには、参考になった人数,レビュー本文といった形式で保存します。
※参考になった人数が空の場合は0とする。
実行すると1ページ目はうまく取得できるのですが、2ページ目以降になると取得できません。
Pythonのバージョンは3.6.5です。
Windouws10,jupyter notebookで作成しました。


実行結果
---------------------------page: 1 -----------------------------

Starting to get reviews...

score text
0 39 この商品は色違いで3点目の購入です。今回はブラックを購入しました。\nよく伸びるので曲げ伸ば...
1 23 2016年10月にツイル&デニムのL、11月にデニムLLを。ツイル(ボルドー)は着衣の繊維が...
2 19 ずっと気になっていてやっと買えました。\n2592円(税抜)が24時間限定50%ポイント還元...
3 6 今年の冬は特に寒かったけどこのパンツで温かく過ごせました。何本も購入したのでほぼ毎日のように...
4 9 この冬大活躍しました。\n結局何回もリピ買いして計6本。穿くときのヒヤッと感が無いのも◎だし...
5 6 167cm、56kgでお肉は下半身に付く方です。\n以前ボルドーのLを購入してウェストも丈も...
6 6 レビューがいいので安心して購入しました。\n155センチ48キロ、サイズはSかMで、モノによ...
7 6 裏フリースの物を買っといてなんですが、あんまり足が太く見えたら嫌だなぁ~と思いワインのSサイ...
8 4 ⇒身長163cm 体重55kgでLを選びました。\n最初はMをお願いしたのですが、\nウエス...
9 4 本日届きました。\nレビューを見ると 「サイズにばらつきが有る」「生地が伸びる 伸びない」不...
10 4 165センチ、48キロ。普段のパンツはMで、ベージュとオリーブのMを購入。暖かいのに、シルエ...
11 3 161センチ52キロでMサイズを購入しました。\n骨盤が張っていてお尻も大きく太ももも太めな...
12 3 170cm55キロ、お尻が大き目なのでサイズLを購入。\nコーデュロイ ブラックです。\nス...
13 4 2018verのツイルの黒を購入しました。2年前に買ったMはちょうど良かったのですが、今回の...
14 3 168cm、55kg、トップスはM、ボトムスは物によりけりで、デニムは普段24インチです。...
next url:https://review.rakuten.co.jp/item/1/200612_10056893/2.1/
Moving to next page......

---------------------------page: 2 -----------------------------

Starting to get reviews...

NoSuchElementException Traceback (most recent call last)
#追加部分↓
<ipython-input-14-43bd36a04d9d> in <module>()
25 #dfつくる
26 for review in reviews:
---> 27 score=review.find_element_by_css_selector("span.revEntryAnsNum").text
28 text=review.find_element_by_css_selector("dd.revRvwUserEntryCmt.description").text
29 se=pd.Series([score,text],columns)

~\Anaconda3\lib\site-packages\selenium\webdriver\remote\webelement.py in find_element_by_css_selector(self, css_selector)
428 element = element.find_element_by_css_selector('#foo')
429 """
--> 430 return self.find_element(by=By.CSS_SELECTOR, value=css_selector)
431
432 def find_elements_by_css_selector(self, css_selector):

~\Anaconda3\lib\site-packages\selenium\webdriver\remote\webelement.py in find_element(self, by, value)
657
658 return self._execute(Command.FIND_CHILD_ELEMENT,
--> 659 {"using": by, "value": value})['value']
660
661 def find_elements(self, by=By.ID, value=None):

~\Anaconda3\lib\site-packages\selenium\webdriver\remote\webelement.py in _execute(self, command, params)
631 params = {}
632 params['id'] = self._id
--> 633 return self._parent.execute(command, params)
634
635 def find_element(self, by=By.ID, value=None):

~\Anaconda3\lib\site-packages\selenium\webdriver\remote\webdriver.py in execute(self, driver_command, params)
319 response = self.command_executor.execute(driver_command, params)
320 if response:
--> 321 self.error_handler.check_response(response)
322 response['value'] = self._unwrap_value(
323 response.get('value', None))

~\Anaconda3\lib\site-packages\selenium\webdriver\remote\errorhandler.py in check_response(self, response)
240 alert_text = value['alert'].get('text')
241 raise exception_class(message, screen, stacktrace, alert_text)
--> 242 raise exception_class(message, screen, stacktrace)
243
244 def _value_or_default(self, obj, key, default):

NoSuchElementException: Message: no such element: Unable to locate element: {"method":"css selector","selector":"span.revEntryAnsNum"}
(Session info: headless chrome=70.0.3538.110)
(Driver info: chromedriver=2.44.609538 (b655c5a60b0b544917107a59d4153d4bf78e1b90),platform=Windows NT 10.0.17134 x86_64)

このように2ページ目以降は取得できません。
この状況の解決方法を教えていただきたいです。  よろしくお願いします。

Python

1from selenium import webdriver 2from selenium.webdriver.chrome.options import Options 3import chromedriver_binary 4import pandas as pd 5import time 6 7options = Options() 8options.add_argument('--headless') 9driver = webdriver.Chrome(options=options) 10url="https://review.rakuten.co.jp/item/1/200612_10056893/1.1/" #URLをはる 11driver.get(url) 12page=1 13columns=["score","text"] #列の作成 14df=pd.DataFrame(columns=columns) 15path="//*[@id='revRvwSec']/div[1]/div/div[3]/div[16]/div/div/a[5]" 16 17while True: 18 print(" ") 19 print("---------------------------page: {} -----------------------------".format(page)) 20 print(" ") 21 print("Starting to get reviews...") 22 print(" ") 23 reviews=driver.find_elements_by_css_selector("div.revRvwUserMain") 24 #dfつくる 25 for review in reviews: 26 score=review.find_element_by_css_selector("span.revEntryAnsNum").text 27 text=review.find_element_by_css_selector("dd.revRvwUserEntryCmt.description").text 28 se=pd.Series([score,text],columns) 29 df=df.append(se,columns) 30 print(df) 31 32 if len(driver.find_elements_by_xpath(path))>0: 33 next_page=driver.find_element_by_xpath(path).get_attribute("href") 34 print("next url:{}".format(next_page)) 35 driver.get(next_page) 36 page+=1 37 driver.implicitly_wait(10) 38 print("Moving to next page......") 39 time.sleep(10) 40 path="//*[@id='revRvwSec']/div[1]/div/div[2]/div[16]/div/div/a[6]" #「次の15件」のXpathが最初のページ以外違ったので、最後の行でpathを更新しています。 41 else: 42 break 43#CSVに保存 44print(" ") 45print("Saving as csv.....") 46print("") 47df.to_csv("review.csv", encoding = 'utf_8_sig') 48print("Processing Exit")

気になる質問をクリップする

クリップした質問は、後からいつでもMYページで確認できます。

またクリップした質問に回答があった際、通知やメールを受け取ることができます。

バッドをするには、ログインかつ

こちらの条件を満たす必要があります。

Lhankor_Mhy

2018/12/04 11:49

エラーメッセージはそれだけですか?
menuett

2018/12/04 12:19

いいえ 質問が見づらくなると考え省略しました。編集で追加しておきます。
guest

回答1

0

ベストアンサー

span.revEntryAnsNumが存在しない、というエラーだと思います。
そこで、https://review.rakuten.co.jp/item/1/200612_10056893/2.1/を見てみたところ、みくりや。さんのレビューにはspan.revEntryAnsNumがありませんでした。

ですので、

1ページ目はうまく取得できるのですが、2ページ目以降になると取得できません。

というのは、ご質問者の勘違いで、ページ数とは全然関係がなく「1ページ目はたまたまうまく取得できていた」というのが正しいようです。

投稿2018/12/05 00:24

Lhankor_Mhy

総合スコア35871

バッドをするには、ログインかつ

こちらの条件を満たす必要があります。

menuett

2018/12/05 07:03

回答ありがとうございます。 try: score=review.find_element_by_css_selector("span.revEntryAnsNum").text except: score = "0" とすることで参考になった人数は0人ということでレビューデータが取得できました。 レビューデータが膨大なのでスクレイピングの時間がかかるのが面倒ですが、 ゆっくり待ちます。ありがとうございました。
guest

あなたの回答

tips

太字

斜体

打ち消し線

見出し

引用テキストの挿入

コードの挿入

リンクの挿入

リストの挿入

番号リストの挿入

表の挿入

水平線の挿入

プレビュー

15分調べてもわからないことは
teratailで質問しよう!

ただいまの回答率
85.50%

質問をまとめることで
思考を整理して素早く解決

テンプレート機能で
簡単に質問をまとめる

質問する

関連した質問