Go 怎么提取网页链接并补全相对地址
来源:17golang原创
时间:2026-09-06 03:18:43 298浏览 收藏
抓网页链接通常不是把 HTML 当字符串做正则替换,而是先让 golang.org/x/net/html 按 HTML5 规则构建节点树,再读取 a 元素的 href。相对地址的补全交给 net/url:页面是 https://example.com/docs/index.html 时,../api 才能被正确解释成对应的绝对地址。
html.Parse负责理解 HTML 结构,不能把解析结果当作未经处理的原文。url.ResolveReference会根据页面基准 URL 处理foo、/docs和../api。- 提取和后续抓取要分开;对外链至少检查
scheme与host。
先划清网页输入和外链风险
这类小工具的输入有三个:页面 URL、页面 HTML 和页面里出现的 href。输出可以只是规范化后的字符串列表,不必在提取阶段马上发起 HTTP 请求。这样做的好处是,解析器只负责读取结构,访问策略单独负责判断目标是否允许。
空 href、纯片段地址(例如 #comments)通常不是新的页面;mailto:、javascript: 等 scheme 也不应直接交给 HTTP 客户端。若抓取器有站点范围,还要把规范化后的 host 放进 allowlist 判断。
用 html.Parse 找到真正的 a[href] 节点
html.Parse 返回文档树。下面的递归遍历只取元素节点中的 href,并保留链接文本,代码没有假设标签一定写成完整的开始/结束形式,因为 HTML5 解析器会处理常见的省略和嵌套情况。
package main
import (
"fmt"
"io"
"strings"
"golang.org/x/net/html"
)
type Link struct {
Href string
Text string
}
func textOf(n *html.Node) string {
var b strings.Builder
var walk func(*html.Node)
walk = func(cur *html.Node) {
if cur.Type == html.TextNode {
b.WriteString(cur.Data)
}
for child := cur.FirstChild; child != nil; child = child.NextSibling {
walk(child)
}
}
walk(n)
return strings.Join(strings.Fields(b.String()), " ")
}
func extractLinks(r io.Reader) ([]Link, error) {
doc, err := html.Parse(r) // 让 HTML5 解析器负责构建文档树。
if err != nil {
return nil, err
}
links := make([]Link, 0)
var walk func(*html.Node)
walk = func(n *html.Node) {
if n.Type == html.ElementNode && n.Data == "a" {
for _, attr := range n.Attr {
if attr.Key == "href" && strings.TrimSpace(attr.Val) != "" {
links = append(links, Link{Href: attr.Val, Text: textOf(n)})
break
}
}
}
for child := n.FirstChild; child != nil; child = child.NextSibling {
walk(child)
}
}
walk(doc)
return links, nil
}
func main() {
links, err := extractLinks(strings.NewReader(`FooAPI`))
if err != nil {
panic(err) // 示例直接退出;服务中应记录错误并返回可诊断信息。
}
for _, link := range links {
fmt.Printf("%s -> %s\\n", link.Text, link.Href)
}
}

这里没有使用 n.Descendants(),是为了让遍历逻辑在较老的 Go 编译环境中也容易读懂。官方文档还特别提醒:解析输入应为 UTF-8;如果页面实际是其他编码,应先完成字符集转换再交给解析器。
用 ResolveReference 把相对地址变成绝对地址
地址补全不要自己拼斜杠。先分别解析页面基准地址和 href,再调用 ResolveReference。它会根据引用形式处理目录、文件名、根路径和上级路径。
package main
import (
"fmt"
"net/url"
"strings"
)
func normalizeLink(pageURL, rawHref string) (*url.URL, error) {
href := strings.TrimSpace(rawHref)
if href == "" || strings.HasPrefix(href, "#") {
return nil, nil // 空值和当前页面片段不产生新的页面地址。
}
base, err := url.Parse(pageURL) // 页面 URL 是所有相对引用的基准。
if err != nil {
return nil, err
}
ref, err := url.Parse(href) // 先解析引用,再让标准库处理路径规则。
if err != nil {
return nil, err
}
if ref.Scheme != "" && ref.Scheme != "http" && ref.Scheme != "https" {
return nil, nil // 不把 mailto、javascript 等交给 HTTP 抓取器。
}
resolved := base.ResolveReference(ref)
if resolved.Scheme != "http" && resolved.Scheme != "https" {
return nil, nil // 只保留本示例允许的网络协议。
}
resolved.Fragment = "" // 爬取页面本身时,片段通常不改变 HTTP 资源。
return resolved, nil
}
func main() {
for _, raw := range []string{"foo", "/docs", "../api", "#part"} {
u, err := normalizeLink("https://example.com/docs/index.html", raw)
if err != nil {
fmt.Println("invalid:", raw, err)
continue
}
if u != nil {
fmt.Println(raw, "=>", u.String())
}
}
}

例如基准地址带有 index.html 时,foo 会落在当前目录;以斜杠开头的 /docs 从站点根路径计算;../api 则回到上一级目录。最终结果仍应以 u.String() 作为后续记录或请求的地址。
提取完成后再做 host allowlist 复查
解析器能告诉你“这是什么链接”,不能替你决定“能不能访问”。如果页面内容不可信,href 可能指向外部主机。把允许的 scheme、host 和是否保留片段写成独立规则,便于审计和测试。
| 输入 | 处理 | 结果 |
|---|---|---|
foo | 按页面目录解析 | 站内绝对 URL |
/docs | 按 host 根路径解析 | 站内绝对 URL |
../api | 回退一个目录 | 站内绝对 URL |
mailto: 或未知 scheme | 拒绝进入 HTTP 请求 | 跳过 |
安全判断前如果依赖 HTML 的语义结构,官方建议把解析结果重新序列化后再作信任决策,因为 HTML5 解析可能补出节点、调整父子关系或改变原始嵌套。一个实用的复查顺序是:确认页面 URL 可解析、确认结果 scheme、确认 host 在允许集合、限制重定向,并为每次拒绝记录原始 href 与原因。
常见问题
为什么不用正则表达式直接匹配 href?
正则很难覆盖 HTML 实体、大小写、未闭合标签和嵌套规则。需要理解文档结构时,用 html.Parse 更稳妥。
相对链接补全后要不要保留片段?
如果用途是抓取页面资源,通常清除 Fragment;如果用途是生成站内导航,则应保留,并按业务去重。
页面不是 UTF-8 怎么办?
先根据响应头或页面声明完成字符集转换,再把 UTF-8 字节交给 html.Parse;不要让解析器承担编码猜测。
-
- 前端进阶之JavaScript设计模式
- 设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
- 立即学习 543次学习
-
- GO语言核心编程课程
- 本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
- 立即学习 516次学习
-
- 简单聊聊mysql8与网络通信
- 如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
- 立即学习 500次学习
-
- JavaScript正则表达式基础与实战
- 在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
- 立即学习 487次学习
-
- 从零制作响应式网站—Grid布局
- 本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
- 立即学习 485次学习