登录
首页 >  Golang >  Go教程

Golang多协程爬虫实现教程

时间:2026-02-18 16:52:34 288浏览 收藏

本文深入浅出地讲解了如何利用 Go 语言的 goroutine、sync.WaitGroup 和带缓冲 channel 构建高效可控的多协程网络爬虫——通过并发发起 HTTP 请求大幅提升抓取速度,用 channel 实现信号量机制精准限制并发数防止资源耗尽或触发反爬,再结合 goquery 解析 HTML 并通过 channel 统一收集结果,整套方案兼具高性能、低开销与工程实用性,是 Go 并发编程在真实场景中的典型范例。

Golang如何实现多协程爬虫_Golang 多协程爬虫实践

多协程爬虫在 Golang 中非常常见,得益于其轻量级的 goroutine 和高效的并发模型。使用多个协程可以显著提升爬取效率,同时保持代码简洁。下面介绍如何用 Golang 实现一个简单但实用的多协程爬虫。

1. 使用 Goroutine 发起并发请求

Golang 的 goroutine 让并发变得简单。只需在函数调用前加上 go 关键字,就能启动一个新协程执行任务。

例如,我们有一组 URL 需要抓取:

urls := []string{
    "https://httpbin.org/delay/1",
    "https://httpbin.org/delay/2",
    "https://httpbin.org/get",
}

可以用协程并发请求:

for _, url := range urls {
    go fetch(url)
}

但这样会立即返回,主程序可能在协程完成前退出。需要使用 sync.WaitGroup 控制等待。

2. 控制协程数量:避免资源耗尽

如果 URL 很多,直接为每个都开协程会导致内存暴涨或被目标网站封禁。应使用信号量机制控制最大并发数。

通过带缓冲的 channel 模拟信号量:

semaphore := make(chan struct{}, 10) // 最大 10 个并发
var wg sync.WaitGroup
<p>for _, url := range urls {
wg.Add(1)
go func(u string) {
defer wg.Done()
semaphore <- struct{}{} // 获取令牌
defer func() { <-semaphore }() // 释放令牌</p><pre class="brush:php;toolbar:false;">    fetch(u)
}(url)

} wg.Wait() // 等待所有任务完成

这种方式既能并发,又能限制同时运行的协程数量。

3. 数据提取与结果收集

爬取页面后通常需要解析 HTML 提取数据。可使用 goquery 库(类似 jQuery)来操作 DOM。

安装:

go get github.com/PuerkitoBio/goquery

示例:提取标题

func parseTitle(body io.Reader) string {
    doc, _ := goquery.NewDocumentFromReader(body)
    return doc.Find("title").Text()
}

将结果通过 channel 收集,避免竞态条件:

results := make(chan string, len(urls))
// 在协程中:
title := parseTitle(resp.Body)
results 

4. 错误处理与重试机制

网络请求可能失败,需加入错误判断和简单重试。

func fetchWithRetry(url string, maxRetries int) error {
    var err error
    for i := 0; i 

配合 context 可实现超时控制:

ctx, cancel := context.WithTimeout(context.Background(), 10*time.Second)
req, _ := http.NewRequestWithContext(ctx, "GET", url, nil)
client.Do(req)

基本上就这些。Golang 多协程爬虫的核心是合理利用 goroutine、channel 和 WaitGroup,控制并发规模,安全提取数据。不复杂但容易忽略细节,比如限流和错误处理。写好之后性能通常远超单线程爬虫。

终于介绍完啦!小伙伴们,这篇关于《Golang多协程爬虫实现教程》的介绍应该让你收获多多了吧!欢迎大家收藏或分享给更多需要学习的朋友吧~golang学习网公众号也会发布Golang相关知识,快来关注吧!

资料下载
相关阅读
更多>
最新阅读
更多>
课程推荐
更多>