人工智能技术文章
-
Diffusers 临时禁用 LoRA 不需要卸载权重,调用 disable_lora() 可回到基础模型推理,随后用 enable_lora() 恢复;本文同时区分卸载、删除和多适配器场景。309 收藏 -
本地视觉模型服务最容易被忽略的问题,不是单次推理慢,而是上传任务无限排队。本文用 Python asyncio.Queue(maxsize=2) 建立背压,让生产者在队列满时等待,并用 inference_mode、task_done 和显存检查验证流水线是否真的稳定。308 收藏 -
Diffusers 单文件模型不能靠改后缀变成组件目录。正确做法是用匹配的 Pipeline.from_single_file() 读取权重,再用 save_pretrained() 保存配置、组件子目录和权重文件;配置推断失败时显式提供 config。308 收藏 -
AI Agent 工具调用失败时,不要无条件重放模型请求。本文用统一错误信封、错误码分层、原始 call_id 回传和有限重试预算,让模型只重试可修复问题,并避免副作用重复执行。307 收藏 -
MCP 2026-07-28 无状态改造移除了协议层会话,但业务状态仍需显式保存。文章用 basket_id、Mcp-Method、ttlMs、cacheScope 与 Trace Context 梳理迁移边界。305 收藏 -
AI Agent 调用外部工具时,超时只解决等待上限,幂等键才解决重复副作用。本文用统一 deadline、幂等账本和结果分类,给出可落地的调用边界与排查清单。305 收藏 -
Go 接入 Responses API 图片理解时,最容易踩到的不是模型参数,而是 MIME 类型、Base64 体积和失败回退没有在客户端先处理。本文用一个图片质检接口说明如何预检文件、估算请求大小、设置超时,并把失败结果安全地送入人工队列。303 收藏 -
面向离线推理任务,介绍如何用 Transformers pipeline 接入流式数据、按样本长度和显存选择 batch_size,并为显存不足与失败批次保留可恢复的降级路径。301 收藏 -
用 LiteLLM Proxy 把多家模型收敛到统一入口,再通过虚拟 Key 做模型白名单、团队预算和速率限制,让客户端不用感知供应商差异。299 收藏 -
Responses API 的多轮工具调用关键在于保留 function_call 的 call_id,用 function_call_output 回传业务结果,并在后续请求中正确续接响应状态。本文用 Python 拆解完整循环、异常处理和状态保存取舍。299 收藏 -
AI 流式回答显示到一半、刷新后状态混乱,通常不是模型少返回了一句,而是增量缓冲、结束事件和可恢复状态没有分开处理。本文用一个浏览器流式阅读器示例拆开这条链路。298 收藏 -
AI Agent 在工具调用中容易遇到参数漂移:字段名变化、旧版本参数残留和失败后无法复现。本文用版本快照、字段校验与失败回放搭出一条可验收的处理链。297 收藏 -
向量检索返回相似度高的片段,不等于答案一定可靠。本文用一个轻量 Python 示例,把 query_points、score_threshold、source_id 和引用片段串成可验收的检索链,并处理空召回与低分结果。297 收藏 -
用 DataCollatorWithPadding 让 Transformers 按 batch 内最长文本动态补齐,并配合 attention_mask、截断和长度分桶减少无效推理计算。297 收藏 -
长上下文应用不应把全部聊天记录直接拼进请求。本文用近期消息、滚动摘要和按需检索三层结构,配合 token 预算、去重与计数,减少无关历史进入模型上下文。296 收藏