登录
推荐 文章 Go 技术 课程 下载 专题 AI
首页 >  Golang >  Go教程

Go 怎么提取网页链接并补全相对地址

来源:17golang原创

时间:2026-09-06 03:18:43 298浏览 收藏

抓网页链接通常不是把 HTML 当字符串做正则替换,而是先让 golang.org/x/net/html 按 HTML5 规则构建节点树,再读取 a 元素的 href。相对地址的补全交给 net/url:页面是 https://example.com/docs/index.html 时,../api 才能被正确解释成对应的绝对地址。

要点速览
  • html.Parse 负责理解 HTML 结构,不能把解析结果当作未经处理的原文。
  • url.ResolveReference 会根据页面基准 URL 处理 foo/docs../api
  • 提取和后续抓取要分开;对外链至少检查 schemehost

先划清网页输入和外链风险

这类小工具的输入有三个:页面 URL、页面 HTML 和页面里出现的 href。输出可以只是规范化后的字符串列表,不必在提取阶段马上发起 HTTP 请求。这样做的好处是,解析器只负责读取结构,访问策略单独负责判断目标是否允许。

空 href、纯片段地址(例如 #comments)通常不是新的页面;mailto:javascript: 等 scheme 也不应直接交给 HTTP 客户端。若抓取器有站点范围,还要把规范化后的 host 放进 allowlist 判断。

用 html.Parse 找到真正的 a[href] 节点

html.Parse 返回文档树。下面的递归遍历只取元素节点中的 href,并保留链接文本,代码没有假设标签一定写成完整的开始/结束形式,因为 HTML5 解析器会处理常见的省略和嵌套情况。

package main

import (
    "fmt"
    "io"
    "strings"

    "golang.org/x/net/html"
)

type Link struct {
    Href string
    Text string
}

func textOf(n *html.Node) string {
    var b strings.Builder
    var walk func(*html.Node)
    walk = func(cur *html.Node) {
        if cur.Type == html.TextNode {
            b.WriteString(cur.Data)
        }
        for child := cur.FirstChild; child != nil; child = child.NextSibling {
            walk(child)
        }
    }
    walk(n)
    return strings.Join(strings.Fields(b.String()), " ")
}

func extractLinks(r io.Reader) ([]Link, error) {
    doc, err := html.Parse(r) // 让 HTML5 解析器负责构建文档树。
    if err != nil {
        return nil, err
    }

    links := make([]Link, 0)
    var walk func(*html.Node)
    walk = func(n *html.Node) {
        if n.Type == html.ElementNode && n.Data == "a" {
            for _, attr := range n.Attr {
                if attr.Key == "href" && strings.TrimSpace(attr.Val) != "" {
                    links = append(links, Link{Href: attr.Val, Text: textOf(n)})
                    break
                }
            }
        }
        for child := n.FirstChild; child != nil; child = child.NextSibling {
            walk(child)
        }
    }
    walk(doc)
    return links, nil
}

func main() {
    links, err := extractLinks(strings.NewReader(`FooAPI`))
    if err != nil {
        panic(err) // 示例直接退出;服务中应记录错误并返回可诊断信息。
    }
    for _, link := range links {
        fmt.Printf("%s -> %s\\n", link.Text, link.Href)
    }
}
Go html.Parse 构建 HTML 文档树并从 a 元素读取 href 属性的静态关系图
图1:HTML 文档树中的 a 元素与 href 属性是提取网页链接的输入边界。

这里没有使用 n.Descendants(),是为了让遍历逻辑在较老的 Go 编译环境中也容易读懂。官方文档还特别提醒:解析输入应为 UTF-8;如果页面实际是其他编码,应先完成字符集转换再交给解析器。

用 ResolveReference 把相对地址变成绝对地址

地址补全不要自己拼斜杠。先分别解析页面基准地址和 href,再调用 ResolveReference。它会根据引用形式处理目录、文件名、根路径和上级路径。

package main

import (
    "fmt"
    "net/url"
    "strings"
)

func normalizeLink(pageURL, rawHref string) (*url.URL, error) {
    href := strings.TrimSpace(rawHref)
    if href == "" || strings.HasPrefix(href, "#") {
        return nil, nil // 空值和当前页面片段不产生新的页面地址。
    }

    base, err := url.Parse(pageURL) // 页面 URL 是所有相对引用的基准。
    if err != nil {
        return nil, err
    }
    ref, err := url.Parse(href) // 先解析引用,再让标准库处理路径规则。
    if err != nil {
        return nil, err
    }
    if ref.Scheme != "" && ref.Scheme != "http" && ref.Scheme != "https" {
        return nil, nil // 不把 mailto、javascript 等交给 HTTP 抓取器。
    }

    resolved := base.ResolveReference(ref)
    if resolved.Scheme != "http" && resolved.Scheme != "https" {
        return nil, nil // 只保留本示例允许的网络协议。
    }
    resolved.Fragment = "" // 爬取页面本身时,片段通常不改变 HTTP 资源。
    return resolved, nil
}

func main() {
    for _, raw := range []string{"foo", "/docs", "../api", "#part"} {
        u, err := normalizeLink("https://example.com/docs/index.html", raw)
        if err != nil {
            fmt.Println("invalid:", raw, err)
            continue
        }
        if u != nil {
            fmt.Println(raw, "=>", u.String())
        }
    }
}
Go url.Parse 与 ResolveReference 根据页面基准 URL 补全相对 href 并经过 scheme host 边界检查的关系图
图2:相对 href 先经过页面基准 URL 规范化,再由 scheme 与 host 边界决定是否允许后续访问。

例如基准地址带有 index.html 时,foo 会落在当前目录;以斜杠开头的 /docs 从站点根路径计算;../api 则回到上一级目录。最终结果仍应以 u.String() 作为后续记录或请求的地址。

提取完成后再做 host allowlist 复查

解析器能告诉你“这是什么链接”,不能替你决定“能不能访问”。如果页面内容不可信,href 可能指向外部主机。把允许的 scheme、host 和是否保留片段写成独立规则,便于审计和测试。

输入处理结果
foo按页面目录解析站内绝对 URL
/docs按 host 根路径解析站内绝对 URL
../api回退一个目录站内绝对 URL
mailto: 或未知 scheme拒绝进入 HTTP 请求跳过

安全判断前如果依赖 HTML 的语义结构,官方建议把解析结果重新序列化后再作信任决策,因为 HTML5 解析可能补出节点、调整父子关系或改变原始嵌套。一个实用的复查顺序是:确认页面 URL 可解析、确认结果 scheme、确认 host 在允许集合、限制重定向,并为每次拒绝记录原始 href 与原因。

常见问题

为什么不用正则表达式直接匹配 href?

正则很难覆盖 HTML 实体、大小写、未闭合标签和嵌套规则。需要理解文档结构时,用 html.Parse 更稳妥。

相对链接补全后要不要保留片段?

如果用途是抓取页面资源,通常清除 Fragment;如果用途是生成站内导航,则应保留,并按业务去重。

页面不是 UTF-8 怎么办?

先根据响应头或页面声明完成字符集转换,再把 UTF-8 字节交给 html.Parse;不要让解析器承担编码猜测。

声明:本文转载于:17golang原创 如有侵犯,请联系study_golang@163.com删除
相关阅读
更多>
最新阅读
更多>
课程推荐
更多>