CodeZine編集部では、現場で活躍するデベロッパーをスターにするためのカンファレンス「Developers Summit」や、エンジニアの生きざまをブーストするためのイベント「Developers Boost」など、さまざまなカンファレンスを企画・運営しています。
連載目次 前回は、urllib.requestモジュールを利用して、Webからファイルを取得する方法の基本を見た。今回は、このモジュールを使って得たHTMLファイルからBeautiful Soup 4というライブラリを使って必要なデータを抜き出す方法を見てみよう。 スクレイピングとは スクレイピング(scraping)とは、Webサイトに表示されたHTMLページ(あるいはXMLなど、その他のリソース)から自分が必要とする情報を抽出する(抜き出す)ことだ。特に近年では、機械学習などで大量のデータを取得する必要が出てきていて、それを手作業で行うことは現実的ではないことから、プログラムを使ってそれを自動化(半自動化)することが多くなっている。 Pythonにもスクレイピングを行うためのフレームワークやライブラリといったものが幾つもある。今回はそれらの中でBeautiful Soup 4というライ
Webサイトの調査やマーケティング関連の業務の時に、スクレイピングを使うと業務を自動化できてとても便利ですよね。 phpでスクレイピングをする場合は、phpQueryを使うと簡単です。 今回は、phpQueryを使ったスクレイピング方法についてまとめました。 基本的な使い方から、実用的な方法までまとめています。 参考になればと思います。 基本編:phpQueryの使い方 phpQueryは、jqueryのようにDOM操作ができるライブラリです。 ライブラリ追加 composerを使ってライブラリをインストールします。 プロジェクトにcomposerが無ければ、以下のコマンドで初期化します。 $ composer init ライブラリを追加します。 $ composer require electrolinux/phpquery autoloadfile作成します。 $ composer d
リリース、障害情報などのサービスのお知らせ
最新の人気エントリーの配信
処理を実行中です
j次のブックマーク
k前のブックマーク
lあとで読む
eコメント一覧を開く
oページを開く