Go 爬虫小例

ChenAfrica 的个人博客 / 0 / 0 / 创建于 3年前 / 更新于 3年前

package main

import (
    "fmt"
    "io/ioutil"
    "net/http"
    "regexp"
    "strings"
    "sync"
)

const URL = "https://learnku.com/go?filter=created_at_1_month&order=score&l=y"

var wg sync.WaitGroup

func main() {
    wg.Add(1)
    go fetchArticles()
    wg.Wait()
    fmt.Println("完成抓取....")
}
func fetchArticles() {
    defer wg.Done()
    req, _ := http.NewRequest("GET", URL, nil)
    resp, _ := http.DefaultClient.Do(req)
    // 读取网页内容
    content, _ := ioutil.ReadAll(resp.Body)
    // 二进制文件转成网页内容
    respBody := string(content)
    // 正则表达式匹配
    reg := regexp.MustCompile(`<span class="topic-title">(?s:(.*?))</span>`)
    if reg == nil {
        fmt.Println("regex err")
        return
    }
    result := reg.FindAllStringSubmatch(respBody, -1)
    for _, values := range result {
        // 这里可以去除html元素和空格
        title := trimHtml(values[1])
        fmt.Println(title)
    }
}
// 去除html元素标签
func trimHtml(src string) string {
    //将HTML标签全转换成小写
    re, _ := regexp.Compile("\\<[\\S\\s]+?\\>")
    src = re.ReplaceAllStringFunc(src, strings.ToLower)
    //去除STYLE
    re, _ = regexp.Compile("\\<style[\\S\\s]+?\\</style\\>")
    src = re.ReplaceAllString(src, "")
    //去除SCRIPT
    re, _ = regexp.Compile("\\<script[\\S\\s]+?\\</script\\>")
    src = re.ReplaceAllString(src, "")
    //去除所有尖括号内的HTML代码，并换成换行符
    re, _ = regexp.Compile("\\<[\\S\\s]+?\\>")
    src = re.ReplaceAllString(src, "\n")
    //去除连续的换行符
    re, _ = regexp.Compile("\\s{2,}")
    src = re.ReplaceAllString(src, "\n")
    return strings.TrimSpace(src)
}

本作品采用《CC 协议》，转载必须注明作者和本文链接

Laravel 9.x 译者 93 声望

暂无个人描述~

推荐文章：

更多推荐...

花了小半年开发的 AI 套壳 APP（Golang 后端），然而大势已过，现已完全开源啦 14 / 7 |

[初学者]学以致用，go小白写了一段爬虫 17 / 7 |

创业半年，我的GOFLY在线客服系统算是有点小成绩了 41 / 50 |

学习 Go 以来的第一个小项目 toNovel 22 / 20 |

colly 自动抓取资讯 12 / 5 |

一个基于 golang 的爬虫电影站 17 / 12 |

讨论数量: 0

(=￣ω￣=)··· 暂无内容！

讨论应以学习和精进为目的。请勿发布不友善或者负能量的内容，与人为善，比聪明更重要！

帮助

未填写

私信

文章归档

1 篇 2022 年 7 月 1 篇 2022 年 6 月 11 篇 2022 年 5 月 3 篇 2022 年 1 月 1 篇 2021 年 12 月 1 篇 2021 年 8 月 1 篇 2021 年 6 月 5 篇 2021 年 5 月 3 篇 2020 年 12 月

3年前笔记 - 从PHP到Go的封装、继承、多态 3年前单例挖坑笔记 3年前 Go 爬虫小例 3年前笔记 - go的一些常用包 3年前笔记 - goroutine、channel详解

8 一文读懂什么是依赖注入, Ioc容器 2 Laravel多对多模型关联 2 笔记 - go的一些常用包 1 单例挖坑笔记 1 笔记 - goroutine、channel详解

成为赞助商