婷婷综合国产,91蜜桃婷婷狠狠久久综合9色 ,九九九九九精品,国产综合av

主頁 > 知識庫 > 基于Python正則表達式提取搜索結果中的站點地址

基于Python正則表達式提取搜索結果中的站點地址

熱門標簽:宿遷智能外呼系統供應商 鄂州人工智能電銷機器人軟件 菏澤智能ai電銷機器人銷售公司 400免費電話去哪申請 css百度地圖標注位置顯示 地圖標注商戶中心要收錢多少 線上教育ai外呼系統 地圖標注字母的軟件 實用地圖標注app

正則表達式對于Python來說并不是獨有的,最近在把google搜索的結果中所有的站點地址導出,于是想到用python正則表達式提取搜索結果中的站點地址。

這其中涉及幾個需要解決的問題:

1、獲取搜索的結果文本

為了獲得更多的地址,我使用了Google的高級搜索功能,每個頁面顯示100條結果。

獲得顯示的結果后,可以查看源碼,并保持成文本文件就有了搜索的結果文本

2、分析如何提取站點信息

首先需要分析獲取的頁面,查看以怎樣的方式可以提取出站點信息。

我使用IE8自帶的開發工具(按F12就會彈出來)中的探查器功能查看自己要關心的內容有什么特殊的格式

從上圖可以看出我需要的站點在標簽cite>/cite>中,所以我使用正則表達式提取這其中的文本是否就可以呢?

3、編寫正則表達式來獲取站點地址

接下來的就是寫表達式了,我使用Python3.2編寫的,方便好用(~_~)

代碼如下,先把搜索結果頁面保持到e:/t3.txt中,在執行如下代碼

import re
p = re.compile(r'cite>([^>\/].+?)/cite>')
f = open("e:/t3.txt", encoding='utf-8')
content = f.read()
print ("\n".join(p.findall(content)))

運行如下:


大家可以對照一下運行效果圖,看看所有的站點地址是不是都給獲取到了。

您可能感興趣的文章:
  • python正則表達式從字符串中提取數字的思路詳解
  • Python使用正則表達式去除(過濾)HTML標簽提取文字功能
  • Python正則表達式匹配和提取IP地址
  • python利用正則表達式提取字符串
  • python 根據正則表達式提取指定的內容實例詳解
  • python使用正則表達式提取網頁URL的方法
  • python 利用正則表達式提取特殊信息

標簽:恩施 六安 池州 三亞 梅州 綿陽 咸陽 鞍山

巨人網絡通訊聲明:本文標題《基于Python正則表達式提取搜索結果中的站點地址》,本文關鍵詞  基于,Python,正則,表達式,;如發現本文內容存在版權問題,煩請提供相關信息告之我們,我們將及時溝通與處理。本站內容系統采集于網絡,涉及言論、版權與本站無關。
  • 相關文章
  • 下面列出與本文章《基于Python正則表達式提取搜索結果中的站點地址》相關的同類信息!
  • 本頁收集關于基于Python正則表達式提取搜索結果中的站點地址的相關信息資訊供網民參考!
  • 推薦文章
    主站蜘蛛池模板: 渑池县| 西乌珠穆沁旗| 山阴县| 太康县| 威远县| 临清市| 农安县| 隆德县| 隆林| 马山县| 科尔| 阳春市| 红安县| 合江县| 澄城县| 天水市| 西乌珠穆沁旗| 邳州市| 吉安市| 阳西县| 汤原县| 沾化县| 许昌市| 老河口市| 忻城县| 长阳| 昌都县| 扎赉特旗| 广宁县| 太仆寺旗| 西青区| 淄博市| 佛坪县| 宿州市| 宜黄县| 梨树县| 怀来县| 秀山| 肇州县| 犍为县| 盐池县|