質問をすることでしか得られない、回答やアドバイスがある。

15分調べてもわからないことは、質問しよう!

新規登録して質問してみよう
ただいま回答率
87.20%
スクレイピング

スクレイピングとは、公開されているWebサイトからページ内の情報を抽出する技術です。

Beautiful Soup

Beautiful Soupは、Pythonのライブラリの一つ。スクレイピングに特化しています。HTMLデータの構文の解析を行うために、HTMLタグ/CSSのセレクタで抽出する部分を指定することが可能です。

if

if文とは様々なプログラミング言語で使用される制御構文の一種であり、条件によって処理の流れを制御します。

Python 3.x

Python 3はPythonプログラミング言語の最新バージョンであり、2008年12月3日にリリースされました。

Python

Pythonは、コードの読みやすさが特徴的なプログラミング言語の1つです。 強い型付け、動的型付けに対応しており、後方互換性がないバージョン2系とバージョン3系が使用されています。 商用製品の開発にも無料で使用でき、OSだけでなく仮想環境にも対応。Unicodeによる文字列操作をサポートしているため、日本語処理も標準で可能です。

解決済

Pythonスクレイピング:子要素が複数ある場合の条件分岐について

gomasan
gomasan

総合スコア0

スクレイピング

スクレイピングとは、公開されているWebサイトからページ内の情報を抽出する技術です。

Beautiful Soup

Beautiful Soupは、Pythonのライブラリの一つ。スクレイピングに特化しています。HTMLデータの構文の解析を行うために、HTMLタグ/CSSのセレクタで抽出する部分を指定することが可能です。

if

if文とは様々なプログラミング言語で使用される制御構文の一種であり、条件によって処理の流れを制御します。

Python 3.x

Python 3はPythonプログラミング言語の最新バージョンであり、2008年12月3日にリリースされました。

Python

Pythonは、コードの読みやすさが特徴的なプログラミング言語の1つです。 強い型付け、動的型付けに対応しており、後方互換性がないバージョン2系とバージョン3系が使用されています。 商用製品の開発にも無料で使用でき、OSだけでなく仮想環境にも対応。Unicodeによる文字列操作をサポートしているため、日本語処理も標準で可能です。

1回答

0評価

0クリップ

50閲覧

投稿2020/08/06 07:17

編集2022/01/12 10:58

5つ星で評価できるサイト(レストランのような)をスクレイピングし、スプレッドシートに連携しようとしています。
評価「4.0」などの数字では無く、画像を使用しているためclass名が分かれています。
class名が分かれている場合のリスト表記について苦戦しております。

行いたいこととしては、
「もし『<p class="hyoka">』の子要素である『 <i class="star_x_x">』」が
<i class="star_4_0">』の場合、A列には「4.0」と表示する。
もし『<i class="star_3_0">』の場合、「3.0」と表示する。」

HTMLの構造として、

HTML

<body> <main> <li class="review"> <p class="hyoka">      ::before <i class="star_4_0">評価</i> </p> </li> <li class="review"> <p class="hyoka">      ::before <i class="star_3_0">評価</i> </p> </li> <li class="review"> <p class="hyoka">      ::before <i class="star_4_0">評価</i> </p> </li> </main> </html>

ページの見た目としては、

評価★★★★☆ 評価★★★☆☆ 評価★★★★☆

となり、開発者モードで<i class="star_4_0">評価</i><i class="star_2_0">評価</i>にしてみると、

評価★★☆☆☆

と変わります。

一応こちらで書いているコードは、

Python

elements = soup.select('p.hyoka') //スプレッドシートへの連携は省略 scope = 省略 credentials 省略 ... // for index, e in enumerate(elements): num = index+1 wks.update_acell('A'+str(num), e.get_text())

iタグを直接elemntsで指定し同じA列に入れればいいのでは、と思いましたが、4.0や5.0が上から順番に並んでい区ため重なるセルが出てきました。。よく考えればこのやり方はダメだなと思っています。

どなたか少しでも情報いただけますと幸いです。
よろしくお願いいたします。

良い質問の評価を上げる

以下のような質問は評価を上げましょう

  • 質問内容が明確
  • 自分も答えを知りたい
  • 質問者以外のユーザにも役立つ

評価が高い質問は、TOPページの「注目」タブのフィードに表示されやすくなります。

気になる質問をクリップする

クリップした質問は、後からいつでもマイページで確認できます。

またクリップした質問に回答があった際、通知やメールを受け取ることができます。

teratailでは下記のような質問を「具体的に困っていることがない質問」、「サイトポリシーに違反する質問」と定義し、推奨していません。

  • プログラミングに関係のない質問
  • やってほしいことだけを記載した丸投げの質問
  • 問題・課題が含まれていない質問
  • 意図的に内容が抹消された質問
  • 過去に投稿した質問と同じ内容の質問
  • 広告と受け取られるような投稿

評価を下げると、トップページの「アクティブ」「注目」タブのフィードに表示されにくくなります。

meg_
meg_

2020/08/06 07:38

質問者さんのコードでは『<p class="hyoka">』の子要素である『 <i class="star_x_x">』が取得できていないと思われるのですが。ループ処理の中でiタグを取得する必要があるかと思います。
gomasan
gomasan

2020/08/06 08:02

ご確認いただきありがとうございます。一応こちらで「評価」という文言だけ抽出ができていまして、、ループ処理の中でiタグを抽出する・・・こちらとても良いご意見ありがとうございます。また質問内容を追記させていただきました。

まだ回答がついていません

会員登録して回答してみよう

15分調べてもわからないことは
teratailで質問しよう!

ただいまの回答率
87.20%

質問をまとめることで
思考を整理して素早く解決

テンプレート機能で
簡単に質問をまとめる

質問する

関連した質問

同じタグがついた質問を見る

スクレイピング

スクレイピングとは、公開されているWebサイトからページ内の情報を抽出する技術です。

Beautiful Soup

Beautiful Soupは、Pythonのライブラリの一つ。スクレイピングに特化しています。HTMLデータの構文の解析を行うために、HTMLタグ/CSSのセレクタで抽出する部分を指定することが可能です。

if

if文とは様々なプログラミング言語で使用される制御構文の一種であり、条件によって処理の流れを制御します。

Python 3.x

Python 3はPythonプログラミング言語の最新バージョンであり、2008年12月3日にリリースされました。

Python

Pythonは、コードの読みやすさが特徴的なプログラミング言語の1つです。 強い型付け、動的型付けに対応しており、後方互換性がないバージョン2系とバージョン3系が使用されています。 商用製品の開発にも無料で使用でき、OSだけでなく仮想環境にも対応。Unicodeによる文字列操作をサポートしているため、日本語処理も標準で可能です。