国产精品天干天干,亚洲毛片在线,日韩gay小鲜肉啪啪18禁,女同Gay自慰喷水

歡迎光臨散文網 會員登陸 & 注冊

Java培訓:使用JAVA爬取網站數據

2022-12-14 14:15 作者:云和數據何老師  | 我要投稿


1.Jsoup介紹

– 官網文檔:https://jsoup.org  - Jsoup 是一款Java 的HTML解析器,可直接解析某個URL地址、HTML文本內容。它提供了一套非常省力的API,可通過DOM,CSS以及類似于jQuery的操作方法來取出和操作數據。

2. Jsoup快速入門

– 獲取網頁標題

String url = “https://search.jd.com/Search?keyword=手機&wq=手機&page=1”;
Document document = Jsoup.connect(url).get();
String title = document.select(“title”).text();
System.out.println(title);
“`
– 運行效果:手機 – 商品搜索 – 京東

3. 網站數據分析

3.1 分析網站的訪問地址

– 以京東商城為例,商品分頁列表的url地址,需要帶如下幾個參數,因此,在發(fā)送http請求時,需要攜帶正確的參數。

– URL:https://search.jd.com/Search?keyword=手機&wq=手機&page=1

3.2 分析網站的頁面結構

– 通過瀏覽器的開發(fā)者工具,可以分析出頁面中我們需要的html結構。

<img src=”assets/image-20220717171103097.png” alt=”image-20220717171103097″ style=”zoom:67%;” />
– 可以看出,我們需要的商品數據,封裝在一個id=J_goodsList的div標簽中,我們可以方便的通過DOM解析出這塊數據。

4. 實戰(zhàn)實現過程

– 獲取第1頁的商品基本數據

public static void main(String[] args) throws Exception {
//第1頁地址
String url = “https://search.jd.com/Search?keyword=手機&wq=手機&page=1”;
//發(fā)送http請求
Document document = Jsoup.connect(url).get();
//在id=J_goodsList的div下,獲取所有帶有data-sku屬性的li標簽
Elements lis = document.select(“div[id=J_goodsList] li[data-sku]”);
lis.forEach(
li -> {
//獲取商品sku
String sku = li.attr(“data-sku”);
//獲取商品name
String name = li.select(“div[class=’p-name p-name-type-2′] a em”).text();
//獲取商品圖片地址
String img = li.select(“div[class=p-img] a img[data-lazy-img]”).attr(“data-lazy-img”);

System.out.println(String.format(“%s, %s, %s”, sku, name, img));
}
);
}
– 效果預覽

1665718155423_1.jpg

– 改造為分頁獲取

public static void main(String[] args) throws Exception {
//第N頁地址
String url = “https://search.jd.com/Search?keyword=手機&wq=手機&page=” + i;
//發(fā)送http請求
Document document = Jsoup.connect(url).get();
//在id=J_goodsList的div下,獲取所有帶有data-sku屬性的li標簽
Elements lis = document.select(“div[id=J_goodsList] li[data-sku]”);
lis.forEach(
li -> {
//獲取商品sku
String sku = li.attr(“data-sku”);
//獲取商品name
String name = li.select(“div[class=’p-name p-name-type-2′] a em”).text();
//獲取商品圖片地址
String img = li.select(“div[class=p-img] a img[data-lazy-img]”).attr(“data-lazy-img”);

System.out.println(String.format(“%s, %s, %s”, sku, name, img));
}
);


Java培訓:使用JAVA爬取網站數據的評論 (共 條)

分享到微博請遵守國家法律
八宿县| 奉节县| 砀山县| 图木舒克市| 庆城县| 沙田区| 商城县| 虹口区| 寿阳县| 奉节县| 玉屏| 陆良县| 新野县| 黑山县| 竹北市| 吉木乃县| 平武县| 策勒县| 岳阳市| 北宁市| 华安县| 玛曲县| 云霄县| 白河县| 上虞市| 湄潭县| 昌黎县| 临清市| 宁强县| 乌拉特后旗| 蓬安县| 织金县| 特克斯县| 巩留县| 绩溪县| 临澧县| 拉萨市| 永福县| 蓝田县| 台东市| 顺平县|