複数のWEBページの情報を取得してくるクローラを作りたい。
http://liginc.co.jp/programmer/archives/4848 を見ながらクローリングのためのコードを書いている。
// Initialize instance var sequelize = require('sequelize'); // Connect to database var connection = new sequelize('データベース名', 'ユーザ名', 'パスワード', {オプション: '値'}); // Define models var sites = connection.define('sites', { url: sequelize.TEXT, title: sequelize.STRING }); //Initialize instance var request = require("request"); var cheerio = require("cheerio"); // Define request url var requestUrl = "http://www.google.com"; // Send http request request({url: requestUrl}, function(error, response, body) { // If request succeed if (!error && response.statusCode == 200) { $ = cheerio.load(body); // Create cheerio instance // Get response data var url = response.request.href; var title = $("title").text(); console.log(url); console.log(title); // Create new instance var site = sites.build(); // Set fields site.url = url; site.title = title; // Save to database site.save() .success(function(anotherTask) { console.log('Succeed'); }) .error(function(error) { console.log(error); }); } // If error occured else { console.log("--------------------------------------------------"); if (error && "code" in error) { console.log("Error Code:" + error.code); } if (error && "errno" in error) { console.log("Error No:" + error.errno); } if (error && "syscall" in error) { console.log("Error Syscall:" + error.syscall); } if (response && "statusCode" in response) { console.log("Status Code:" + response.statusCode); } } });
と書いてある中に、
var requestUrl = "http://www.google.com";
とURLが書いてあるが、
複数のWEBページの情報を取得してくるクローラを作りたい場合にはどうしたら良いか?
例えば、nifty ( https://www.nifty.com/ )やlivedoor( http://www.livedoor.com/ )のサイトからもタイトルを取得してきてその情報をDBに入れるようにしたい。しかし、googleとniftyとlivedoorのwebのhtml構造は違う。
質問したい点は、
・取得してきたいWEBページの個数分スクリプトを作った方がいいのか?
・複数のURLをクローリングしたい場合、効率的にクローリングする方法はあるのか?
という点である。
ちなみに、1日1回指定のURLからクロールしたい。
回答2件
あなたの回答
tips
プレビュー
バッドをするには、ログインかつ
こちらの条件を満たす必要があります。
2018/06/12 14:54
2018/06/12 17:34
2018/06/13 12:25