大模型批量输入为什么要设置 padding 和 attention_mask
来源:17golang原创
时间:2026-09-06 00:12:03 282浏览 收藏
把多条文本一起送进大模型时,最容易混淆的是 padding 和 attention_mask:前者解决“每条文本长度不同,张量无法对齐”,后者解决“补出来的位置不能被模型当成真实内容”。两者通常由 tokenizer 一起返回,再原样传给模型。
padding=True让一个 batch 内的序列变成规则矩阵,但不会截断超长文本。attention_mask中通常用 1 表示有效 token、0 表示 padding 位置;不要只传input_ids。truncation、max_length和padding_side分别处理长度上限与补齐方向,需按模型类型确认。
把不等长文本整理成可计算的批次
单条调用时,token 序列可以各自保持长度;批量调用则通常要组成形如 [batch_size, sequence_length] 的规则张量。例如一条输入被切成 6 个 token,另一条被切成 10 个 token,它们不能直接堆成同一个二维矩阵。padding=True 会把较短样本补到当前 batch 的最长长度;padding="max_length" 则补到显式指定的 max_length。
这里的 padding token 只是占位符,不代表文本真的多了几个词。批量效率和显存占用也会受到补齐长度影响:把一批长短差异很大的文本放在一起,短文本会产生更多无效位置。

让 attention_mask 标出真正有效的位置
补齐之后,模型还需要知道哪些位置应该参与注意力。tokenizer 返回的 attention_mask 通常与 input_ids 形状一致:真实 token 位置为 1,padding 位置为 0。不同模型对额外 mask 的具体处理可能不同,但“补齐位置不应被当成有效输入”是批处理的核心约束。
from transformers import AutoTokenizer, AutoModelForSequenceClassification
# 使用同一个 tokenizer 处理整个 batch,确保 input_ids 与 mask 一一对应
tokenizer = AutoTokenizer.from_pretrained("bert-base-chinese")
texts = ["这个接口返回很快", "批量输入的长度可能不同"]
batch = tokenizer(
texts,
padding=True, # 补到当前 batch 的最长序列
truncation=True, # 超过上限时按 max_length 截断
max_length=32,
return_tensors="pt"
)
# 将 tokenizer 生成的 attention_mask 一起交给模型
model = AutoModelForSequenceClassification.from_pretrained("bert-base-chinese")
outputs = model(**batch)
print(batch["input_ids"].shape)
print(batch["attention_mask"].shape)
示例中的 **batch 会把 input_ids 和 attention_mask 一起传入;如果某个模型还需要 token_type_ids,tokenizer 也可能将它放入同一个字典。排查时先检查这些键的形状是否一致,再看模型文档要求哪些输入。

同时处理超长输入与生成方向
padding 只负责“补短”,不能让超出模型最大输入长度的文本自动变短。因此通常把 truncation=True 与 max_length 一起考虑。max_length 应根据模型可接受长度、任务需要和显存预算设置;截断前要确认被舍弃的是哪一段,避免把关键指令或标签截掉。
补齐方向由 padding_side 控制,可选 "right" 或 "left"。编码任务常见右侧补齐,因而有效 token 从序列开头开始;部分自回归生成场景会采用左侧补齐,让不同样本的最新 token 对齐。但这不是可以对所有模型统一套用的规则,应查看目标模型和 tokenizer 的配置。
| 参数 | 解决的问题 | 常见边界 |
|---|---|---|
padding | 让 batch 内长度对齐 | 会增加占位 token,不负责截断 |
attention_mask | 标出有效与补齐位置 | 必须和 input_ids 同批、同形状传递 |
truncation | 处理超过上限的输入 | 可能丢失文本,需明确截断策略 |
padding_side | 决定从左侧还是右侧补齐 | 生成模型要按模型要求确认 |
把批处理配置接到模型调用和排查清单
一个稳定的批量推理封装,至少要固定 tokenizer、最大长度、补齐策略和返回张量类型,并把这些配置写入日志。出现“单条正常、批量异常”时,可以按下面顺序排查:
- 先确认是否真的传入了
attention_mask,不要手工用全 1 mask 覆盖 tokenizer 的结果。 - 比较
input_ids.shape与attention_mask.shape,两者的 batch 和序列维度必须对应。 - 确认 tokenizer 是否有可用的
pad_token;没有时不要随意拿普通词元代替,应按目标模型的官方配置处理。 - 记录
padding=True还是padding="max_length",并核对max_length是否造成过度补齐或意外截断。
如果任务是训练而不是推理,还要额外区分输入的 attention_mask 与标签的 loss mask:前者告诉模型哪些输入位置有效,后者决定哪些标签位置参与损失计算,不能因为名字相似就混用。
常见问题
padding=True 和 padding="max_length" 有什么区别?
前者默认补到当前 batch 的最长序列,通常更省无效计算;后者补到指定的 max_length,形状更固定,但可能产生更多 padding。
attention_mask 可以不传吗?
如果没有 padding,某些模型可能可以推断全 1 mask;但批量输入一旦包含补齐位置,就应优先传 tokenizer 返回的 mask,并以目标模型文档为准。
为什么设置了 padding 仍然报长度错误?
因为 padding 只会补短,不会缩短长文本。检查是否同时设置了合适的 truncation=True 和 max_length,并确认该长度不超过模型限制。
记住一句话:padding 负责把形状排整齐,attention_mask 负责告诉模型哪些位置算数;长度上限和补齐方向则是模型与任务共同决定的配置。
-
501 收藏
-
501 收藏
-
501 收藏
-
501 收藏
-
501 收藏
-
286 收藏
-
103 收藏
-
299 收藏
-
科技周边 · 人工智能 | 1天前 | oauth · 人工智能 · mcp · Agent 工程 · resource MCP OAuth 2.1 RFC 8707 token audience 远程 MCP123 收藏
-
119 收藏
-
293 收藏
-
科技周边 · 人工智能 | 2天前 | 异步任务 · mcp · 协议扩展 · MCP Tasks io.modelcontextprotocol/tasks tasks/get tasks/update260 收藏
-
305 收藏
-
377 收藏
-
398 收藏
-
科技周边 · 人工智能 | 3天前 | 人工智能 · api设计 · gemini · AI Agent Gemini Interactions API previous_interaction_id store=false 多轮状态432 收藏
-
427 收藏
-
- 前端进阶之JavaScript设计模式
- 设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
- 立即学习 543次学习
-
- GO语言核心编程课程
- 本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
- 立即学习 516次学习
-
- 简单聊聊mysql8与网络通信
- 如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
- 立即学习 500次学习
-
- JavaScript正则表达式基础与实战
- 在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
- 立即学习 487次学习
-
- 从零制作响应式网站—Grid布局
- 本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
- 立即学习 485次学习