无法从 pdb 数据库网站抓取 <div id="search-container">

Question

我是网络抓取的新手，正在尝试获取 pdb 网页上的每个 pdb ID，例如：

url= https://www.rcsb.org/search?request=%7B%22query%22%3A%7B%22parameters%22%3A%7B%22attribute%22%3A%22rcsb_entity_source_organism.rcsb_gene_name.value%22%2C%22operator%22%3A%22exact_match%22%2C%22value%22%3A%22MCF3%22%7D%2C%22type%22%3A%22terminal%22%2C%22service%22%3A%22text%22%2C%22node_id%22%3A0%7D%2C%22return_type%22%3A%22entry%22%2C%22request_options%22%3A%7B%22pager%22%3A%7B%22start%22%3A0%2C%22rows%22%3A100%7D%2C%22scoring_strategy%22%3A%22combined%22%2C%22sort%22%3A%5B%7B%22sort_by%22%3A%22score%22%2C%22direction%22%3A%22desc%22%7D%5D%7D%2C%22request_info%22%3A%7B%22src%22%3A%22ui%22%2C%22query_id%22%3A%22c75bbf18a058a812f5384f297528d4b6%22%7D%7D

在这里，我正在尝试获取像 "3ZBF" 和 "4UXL" 这样的 ID。

我写了下面的代码：

url='https://www.rcsb.org/search?request=%7B%22query%22%3A%7B%22parameters%22%3A%7B%22attribute%22%3A%22rcsb_entity_source_organism.rcsb_gene_name.value%22%2C%22operator%22%3A%22exact_match%22%2C%22value%22%3A%22MCF3%22%7D%2C%22type%22%3A%22terminal%22%2C%22service%22%3A%22text%22%2C%22node_id%22%3A0%7D%2C%22return_type%22%3A%22entry%22%2C%22request_options%22%3A%7B%22pager%22%3A%7B%22start%22%3A0%2C%22rows%22%3A100%7D%2C%22scoring_strategy%22%3A%22combined%22%2C%22sort%22%3A%5B%7B%22sort_by%22%3A%22score%22%2C%22direction%22%3A%22desc%22%7D%5D%7D%2C%22request_info%22%3A%7B%22src%22%3A%22ui%22%2C%22query_id%22%3A%22c75bbf18a058a812f5384f297528d4b6%22%7D%7D'

page = requests.get(url)

data = page.text

soup = BeautifulSoup(data, "html.parser")

tex_tag= soup.find('div',{"class":"container","id":"maincontentcontainer"})

new_line=tex_tag.find("div",{"id":"search-container"})

print(new_line)

print(tex_tag.prettify())

在这里，我看不到 < div id="search-container"> 的内部。我查看了网页上的 html 文件，pdb IDS 在 < div id="search-container" > 内。

你能建议我一个解决方案或者给我一些关于如何解决这个问题的见解吗？

提前谢谢你。

Answer 1

此站点使用 API 在呈现结果之前获取结果。它来自这个 url :

POST https://www.rcsb.org/search/gql

在 JSON 输入中传递了标识符列表：

import requests

ids = ["3ZBF","4UXL"]

r = requests.post("https://www.rcsb.org/search/gql",
    json = {
        "attributes": None,
        "identifiers": ids,
        "returnType": "entry",
        "report": "search_summary"
    })

print(r.json())

Answer 2

此脚本将根据您的搜索打印所有标识符 URL:

import json
import requests
import urllib.parse


url = 'https://www.rcsb.org/search?request=%7B%22query%22%3A%7B%22parameters%22%3A%7B%22attribute%22%3A%22rcsb_entity_source_organism.rcsb_gene_name.value%22%2C%22operator%22%3A%22exact_match%22%2C%22value%22%3A%22MCF3%22%7D%2C%22type%22%3A%22terminal%22%2C%22service%22%3A%22text%22%2C%22node_id%22%3A0%7D%2C%22return_type%22%3A%22entry%22%2C%22request_options%22%3A%7B%22pager%22%3A%7B%22start%22%3A0%2C%22rows%22%3A100%7D%2C%22scoring_strategy%22%3A%22combined%22%2C%22sort%22%3A%5B%7B%22sort_by%22%3A%22score%22%2C%22direction%22%3A%22desc%22%7D%5D%7D%2C%22request_info%22%3A%7B%22src%22%3A%22ui%22%2C%22query_id%22%3A%22c75bbf18a058a812f5384f297528d4b6%22%7D%7D'
search_link = 'https://www.rcsb.org/search/data'

json_data = url.split('=')[-1]
json_data = json.loads(urllib.parse.unquote(json_data))

data = requests.post(search_link, json=json_data).json()

# uncomment this to print all data:
# print(json.dumps(data, indent=4))

for r in data['result_set']:
    print(r['identifier'])

打印：

3ZBF
4UXL

无法从 pdb 数据库网站抓取 <div id="search-container">

Cannot scrape <div id="search-container"> from pdb databank website

html

urllib

beautifulsoup

web-scraping

pdb