登录
推荐 文章 Go 技术 课程 下载 专题 AI
首页 >  文章 >  python教程

Python pathlib.Path.glob 递归匹配隐藏目录怎么处理

来源:17golang原创

时间:2026-09-10 13:38:30 207浏览 收藏

pathlib.Path.glob() 递归查找文件时,隐藏目录是否能匹配,关键不在于额外打开一个“显示隐藏文件”开关,而在于 pathlib 和 glob 模块的规则不同:Path.glob("**/*.py") 会进入普通目录和点号开头的隐藏目录。若目标是排除 .git、缓存或构建目录,就要在结果中检查路径组件,或者在遍历目录时提前裁剪。

官方文档:https://docs.python.org/3/library/pathlib.html

要点速览
  • pathlib 不把点号开头的路径当作特殊项,** 会递归匹配到隐藏目录。
  • 只想包含隐藏目录时直接使用 globrglob;想排除时检查相对路径的每个组件。
  • 目录树很大时,用 Path.walk()dirnames 中移除隐藏目录,减少后续扫描。

Path.glob 为什么会匹配到隐藏目录

Path.glob() 接收相对模式,** 表示任意层级的文件或目录组件。pathlib 的点号文件名没有特殊排除语义,所以 .cache.git 这样的目录和 src 一样会参与匹配。Path.rglob("*.py") 可以理解为在模式前加上 **/

Python pathlib Path.glob 使用 ** 递归匹配普通目录与隐藏目录中的 Python 文件
图1:pathlib 的 ** 递归会进入普通目录和隐藏目录;点号开头的路径不会被自动排除。

因此下面的代码会把隐藏目录中的 Python 文件也纳入结果:

from pathlib import Path

root = Path("project")
# ** 会递归进入每一层目录,pathlib 不会自动排除点号目录
matches = list(root.glob("**/*.py"))

# glob 返回顺序不固定;需要稳定输出时显式排序
for path in sorted(matches):
    print(path)

如果你只是希望“递归查找所有 Python 文件”,这已经是正确写法;不要为了匹配隐藏目录再拼接一个 .* 模式。只有需要排除隐藏目录时,才需要增加过滤逻辑。

包含隐藏目录和排除隐藏目录,写法不是一回事

包含隐藏目录的规则很简单:使用 root.glob("**/*.py")root.rglob("*.py")。排除时不能只判断文件名,因为普通目录下的文件可能位于隐藏目录的更深层;应该检查相对于根目录的每一个路径组件。

from pathlib import Path

def is_hidden_component(name: str) -> bool:
    # 单独处理当前目录标记,避免把空名称当成隐藏项
    return bool(name) and name.startswith(".") and name not in {".", ".."}

root = Path("project")
visible_python_files = []
for path in root.rglob("*.py"):
    relative_parts = path.relative_to(root).parts
    # 任意一层是隐藏目录或隐藏文件,就不纳入公开文件集
    if any(is_hidden_component(part) for part in relative_parts):
        continue
    visible_python_files.append(path)

for path in sorted(visible_python_files):
    print(path)
目标建议写法注意点
包含隐藏目录中的文件root.rglob("*.py")点号路径不会自动排除
排除所有隐藏路径遍历结果并检查每个 relative_to(root).parts不要只检查最后一个文件名
只找隐藏目录中的文件保留包含点号组件的结果明确是否把隐藏文件本身也算入

要排除隐藏目录时,先过滤还是先裁剪

目录规模不大时,“先 glob、后过滤”最直观,也便于复用 rglob 的匹配模式。若目录树很深,仍然遍历了 .git 或缓存目录,就会产生不必要的扫描。Python 3.12 及更高版本可以考虑 Path.walk(),在继续进入子目录前修改 dirnames

Python Path.walk 通过 dirnames 裁剪隐藏目录与 glob 结果过滤的对比关系图
图2:结果集过滤适合小范围查找;需要减少深层扫描时,可在 Path.walk() 的目录列表中裁剪隐藏目录。
from pathlib import Path

root = Path("project")
for directory, dirnames, filenames in root.walk():
    # top_down=True 时修改 dirnames,就能阻止后续进入隐藏目录
    dirnames[:] = [name for name in dirnames if not name.startswith(".")]
    for filename in filenames:
        if filename.endswith(".py") and not filename.startswith("."):
            print(directory / filename)

这个方案的重点是“裁剪目录”,而不是把隐藏目录访问后再丢弃。它适合明确不需要扫描隐藏目录的项目文件、源码或导入目录。若还要跟随符号链接、处理权限错误或跨 Python 版本运行,应把这些条件写进脚本说明,不能仅凭输出为空就判断目录不存在。

最后检查排序、符号链接和权限边界

globrglob 的结果没有保证顺序,生成清单、比较差异或写入缓存前应使用 sorted()。在递归模式下,pathlib 默认不会沿着符号链接继续扩展 **;如果业务确实需要跟随链接,要评估循环和重复文件的风险,再显式使用支持该参数的 Python 版本。

当前官方文档还说明,扫描目录时产生的 OSError 会被抑制,其中包括访问无权限目录时的 PermissionError。这意味着“没有匹配结果”不一定等于“没有文件”,生产脚本可以在关键目录上额外调用 stat() 或在遍历方案中设置错误处理,保留可诊断信息。

常见问题

Path.glob("**/*.py") 会自动跳过 .git 吗?

不会。pathlib 中点号开头的路径不是特殊排除项;要跳过 .git,应按路径组件过滤,或在 Path.walk() 中裁剪目录。

glob()rglob() 怎么选?

需要表达完整相对模式时用 glob();只想从当前根目录递归匹配某个文件模式时,rglob("*.py") 更短。两者都要考虑无序结果和符号链接边界。

为什么代码在一个目录有结果,换个目录却为空?

可能是根路径不同、权限导致扫描错误被抑制,也可能是模式只匹配文件而实际目标是目录。先打印根路径和相对组件,再对关键目录执行显式状态检查。

声明:本文转载于:17golang原创 如有侵犯,请联系study_golang@163.com删除
相关阅读
更多>
最新阅读
更多>
课程推荐
更多>