人工智能技术文章
-
科技周边 · 人工智能 | 1天前 | python · 人工智能 · shuffle Hugging Face Datasets streaming IterableDataset buffer_size
Hugging Face Datasets 的 streaming 模式可用 IterableDataset.shuffle 在有限缓冲区内随机采样,无需下载完整数据集。本文说明 buffer_size、seed、set_epoch、分片顺序以及 take/skip 的调用边界。470 收藏 -
RAG 重排不要用同一个 TopK 同时控制召回和上下文。本文给出 candidate_k 与 final_top_k 的起始范围、三组评估指标、调参顺序和可直接落地的 Python 示例。468 收藏 -
向量检索不应把租户、文档类型等硬约束交给 embedding 猜测。本文以 Qdrant 为例,把过滤字段写入 payload、提前建立 payload index,再用 Filter 绑定向量召回,并说明应用层后置筛选、字段选择性和索引成本的边界。467 收藏 -
从首字延迟 TTFT、分段间隔和客户端断线三个信号入手,搭建大模型流式输出的观测口径,并给出 Go 服务端记录与回放验收方法。466 收藏 -
把 AI 接口从普通聊天模型切到推理模型时,max_tokens 不是简单改个字段名。本文从请求兼容、推理 token 预算、截断判断和回滚核对四个方面,给出一套可复用的迁移检查方法。464 收藏 -
Responses API 同时声明多个函数工具时,可用 tool_choice 的 allowed_tools 将当前轮次限制到指定子集,再用 auto、required 或 none 表达调用策略。本文给出参数结构、选择边界和服务端安全检查。463 收藏 -
AI 推理服务的 p95、p99 延迟突然抖动时,不要只看 GPU 利用率。本文用请求、排队、输入处理、模型计算和输出处理的分段指标,结合并发与吞吐变化,判断瓶颈究竟在调度排队还是模型计算。462 收藏 -
多模态模型识别扫描表格时,漏列通常不是模型单点失误,而是图像缩放、表格线、列坐标和结构化输出共同造成的。本文给出一套从输入预处理到坐标复核、局部纠错和结果验收的实用流程。461 收藏 -
AI Agent 一轮工具调用可能已经改写库存、发送通知,却在最后一步返回超时。本文用订单履约场景拆开部分成功的状态记录、补偿动作和安全重试边界,给出可落地的验收清单。460 收藏 -
no_grad 关闭反向梯度记录且更宽松;inference_mode 进一步关闭视图追踪、版本计数器更新与 forward-mode AD,但推理张量不能进入后续 autograd 计算。本文给出选择表和安全写法。458 收藏 -
Gemini 3.5 Flash 已建议用 thinking_level 替代 thinking_budget。本文用同一组请求对比 minimal、low、medium、high,说明迁移写法、选档边界与回归检查。457 收藏 -
扩散模型固定 seed 仍有细节差异,通常不是 seed 失效,而是 Generator 状态、scheduler、精度、CUDA 后端和硬件不同。本文给出一套可复现排查清单。457 收藏 -
Transformers 批量生成时,padding_side 配错会让 decoder-only 模型把补齐 token 当成生成起点。本文用 input_ids、attention_mask 和 generate 的关系说明 left padding 的配置方法、pad_token 处理与回归检查边界。457 收藏 -
本文演示 PEFT 多个 LoRA adapter 的命名加载、加权组合与推理激活,说明 linear、cat、SVD、TIES 和 DARE 的选择边界及评测方法。454 收藏 -
MCP 工具注解能帮助客户端理解工具是否只读、是否可能破坏环境、重复调用是否幂等以及是否访问开放世界,但它们只是提示而非权限系统。本文给出从服务端声明到客户端审批的安全验收清单。452 收藏