Rvest爬虫实战:NPB数据抓取技巧分享
时间:2026-02-05 12:15:40
301浏览
收藏
各位小伙伴们,大家好呀!看看今天我又给各位带来了什么文章?本文标题是《Rvest爬虫实战:抓取NPB官网数据技巧》,很明显是关于文章的文章哈哈哈,其中内容主要会涉及到等等,如果能帮到你,觉得很不错的话,欢迎各位多多点评和分享!

本文详解如何使用 R 语言的 rvest 包稳定抓取 npb.jp 网站上的棒球统计表格,重点解决 SSL 证书错误、动态结构识别与 CSS 选择器失效等常见问题,并提供可复用的健壮代码方案。
在使用 rvest 抓取日本职业棒球联盟(NPB)官网(如 https://npb.jp/bis/eng/2022/stats/std_c.html)时,初学者常遇到“无法定位表格”的问题——这并非因为网页结构复杂,而多源于三个关键因素:HTTPS 证书验证失败、HTML 实际结构与开发者工具显示不一致、以及过度嵌套的 CSS 选择器导致节点匹配失败。
原始代码中使用的 CSS 选择器 #stdivmaintbl > table > tbody > tr > td > div:nth-child(1) 过于具体且依赖 DOM 渲染路径,而 NPB 官网实际采用的是语义化类名(如 .stdtblmain)包裹表格,且页面中存在多个同类型表格(例如投手/打者统计),直接硬编码层级极易断裂。
✅ 推荐做法是:优先使用语义清晰的 class 名称定位,避免深度层级依赖。实测表明,.stdtblmain 是该页面所有主统计表的统一容器类,配合 html_table() 可自动解析其内部
元素:library(rvest)
library(magrittr)
# 方案一:绕过 SSL 证书问题(推荐用于调试)
# 将网页另存为本地 HTML 文件(右键 → “另存为” → 纯文本 HTML)
url <- "baseball.html" # 替换为你的本地路径
tables <- url %>%
read_html() %>%
html_nodes(".stdtblmain") %>%
html_table(header = TRUE, fill = TRUE)
# 获取第一个主表(通常为打者综合统计)
df_batters <- tables[[1]]
head(df_batters[, 1:10]) # 查看前10列预览⚠️ 注意事项:
- 证书错误处理:若直接读取 URL 报错 SSL certificate problem(常见于 macOS 或旧版 libcurl),请先用浏览器保存网页源码为 baseball.html,再本地读取;或临时启用证书忽略(仅限测试环境):
Sys.setenv("CURL_CA_BUNDLE" = "") # 不推荐生产环境使用 - 表格空值与合并单元格:NPB 表格大量使用 rowspan/colspan 和空
占位,html_table(fill = TRUE) 可自动填充缺失值,但需后续清洗(如删除重复标题行、清理 "***" 占位符)。- 多表提取:页面通常包含多个 .stdtblmain 表格(如打者、投手、守备),可用 length(tables) 查看数量,再按索引提取:
df_pitchers <- tables[[2]] # 第二个主表常为投手数据 ? 总结:成功抓取的核心在于「简化选择器 + 善用容错参数 + 本地化调试先行」。不要迷信浏览器开发者工具中看到的完整路径,而应观察 的顶层容器类;始终开启 fill = TRUE 应对不规则 HTML;并将网络请求问题隔离为本地文件处理,大幅提升开发效率与稳定性。好了,本文到此结束,带大家了解了《Rvest爬虫实战:NPB数据抓取技巧分享》,希望本文对你有所帮助!关注golang学习网公众号,给大家分享更多文章知识!
您即将跳转至第三方网站,请注意保护好个人信息和财产安全!
继续访问
-
502
收藏
-
501
收藏
-
501
收藏
-
501
收藏
-
501
收藏
-
499
收藏
-
353
收藏
-
430
收藏
-
273
收藏
-
266
收藏
-
195
收藏
-
251
收藏
-
455
收藏
-
477
收藏
-
412
收藏
-
370
收藏
-
156
收藏
-
-
前端进阶之JavaScript设计模式
- 设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
-
立即学习
543次学习
-
-
GO语言核心编程课程
- 本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
-
立即学习
516次学习
-
-
简单聊聊mysql8与网络通信
- 如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
-
立即学习
500次学习
-
-
JavaScript正则表达式基础与实战
- 在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
-
立即学习
487次学习
-
-
从零制作响应式网站—Grid布局
- 本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
-
立即学习
485次学习
|