人工智能技术文章
-
模型路由不只是按名称转发请求,而是根据任务难度、质量门槛、延迟预算和相对成本选择模型。本文用一个 Python 小项目实现可解释分类、分档选择、失败回退、质量升级和离线评测。147 收藏 -
Responses API 一次返回多个 function_call 时,不要只处理第一项;保留完整 response.output,按每个 call_id 执行工具并逐条回传 function_call_output,才能避免结果串线。146 收藏 -
OCR 表格跨页合并不能简单拼接文本。本文从页级表格、重复表头、列位归一化和跨页断行四个边界入手,给出可落地的合并伪代码与结果检查清单。145 收藏 -
从 handler.py 的 EndpointHandler 结构、依赖管理、本地测试到 Custom 任务部署,说明 Hugging Face Inference Endpoint 编写自定义 Handler 的完整边界。145 收藏 -
统一 Hugging Face Evaluate 输入时,应该统一 predictions 和 references 的批次外壳,同时以 metric.features 保留每个指标的元素类型与嵌套边界。本文给出适配器写法、compute 与 add_batch 共用方式,以及组合指标前必须检查的兼容条件。134 收藏 -
梳理 Transformers generate 的 EOS、max_new_tokens、stop_strings 与自定义 StoppingCriteria,演示批量提示词、多候选返回、纯新增 token 解码和输出分组。133 收藏 -
PDF 图表检索失败时,先区分抽取、模态 embedding、向量集合和视觉重排四层。本文用固定回归样本和配置检查,定位图表到底在哪一层丢失。132 收藏 -
在 Transformers generate 中自定义 StoppingCriteria,用 tokenizer 生成的 token 序列匹配等标记,并处理批量生成、提示词误匹配和兜底长度限制。 120 收藏 -
LLM评测不要把事实错误和表达偏差混成一个总分。本文给出分层标签、证据字段、分项统计和复核一致性的可复用设计。115 收藏 -
语音转写与说话人分离遇到重叠发言时,不要按片段顺序抢词或直接删掉重叠区;应保留普通 diarization,再用词级时间交集决定归属,无法判断的结果进入 ambiguous 复核。115 收藏 -
用 Hugging Face 风格的评估数据组织方式,拆解 RAG 引用支撑度的字段契约、覆盖检查、语义判定和分层排障方法。115 收藏 -
Transformers 量化配置选择的关键不只是显存大小,还要看推理、QLoRA 微调、精度容忍度和硬件后端。本文用 BitsAndBytesConfig 对比 int8 与 int4 的适用边界,并给出检查清单。113 收藏 -
RAG 中不要让模型猜来源。给每个检索片段保留稳定 chunk_id,让模型返回可校验的 citations,再由应用层回填标题、页码和原文位置。111 收藏 -
Responses API 的结构化输出不会自动校验工具返回值。本文用统一错误信封、function_call_output 和严格 JSON Schema 保留错误码、消息与可重试标记,并说明为什么还要保存原始工具结果。111 收藏 -
AI Agent 记忆不应把所有对话永久保存。本文用会话、任务和用户事实三层模型,说明字段设计、写入门槛、分层检索与冲突处理方法。110 收藏