人工智能技术文章
-
科技周边 · 人工智能 | 4天前 | rag · 检索增强生成 · 文档切分 · 引用溯源 · 人工智能工程 · chunk overlap chunk_id RAG切块配置 RAG引用定位 offset mapping
从文档结构、token预算、重叠窗口和稳定元数据四个方面,说明RAG切块与引用定位的配置方法、排查顺序和常见误区。404 收藏 -
用 Ollama Modelfile 固化 SYSTEM 系统提示和 num_ctx 上下文长度,说明 ollama create、ollama show、ollama ps 的配合方式,以及服务环境和客户端覆盖配置的排查思路。403 收藏 -
用 PEFT 的 merge_and_unload 合并 LoRA adapter,固定 tokenizer、输入和生成参数,再通过 token 与 logits 对比判断合并前后是否一致。399 收藏 -
同一个模型请求失败,并不代表应该立刻换到下一个模型。本文按超时、限流、服务异常和内容拒答拆开处理,给出路由状态、重试边界、降级策略与可验收的实现路径。398 收藏 -
说明 Gemini API 隐式缓存的启用范围、最低输入 token 门槛、公共前缀组织方式,以及如何用 usage.total_cached_tokens 核对命中。398 收藏 -
模型输出 JSON 偶尔带有 Markdown 围栏时,先判断拒答和截断状态,再只清理首尾围栏,最后用 encoding/json 解码并执行字段级业务校验。398 收藏 -
多模态接口接入后,小图片能成功,大图片却报请求过大或上下文超限。本文从原始字节、base64 膨胀和 token 预算三层定位问题,再给出压缩、尺寸校验与请求组装的可复现处理顺序。397 收藏 -
科技周边 · 人工智能 | 4天前 | 人工智能 · 性能排查 · 提示词工程 · Hugging Face · 模型推理 · KV Cache · 提示词缓存动态字段 DynamicCache KV缓存 Transformers缓存 past_key_values use_cache StaticCache
本文以 Hugging Face Transformers 的 DynamicCache 为例,说明提示词缓存动态字段的配置边界,覆盖 use_cache、past_key_values、迭代对话、窗口上限、回滚、显存排查以及切换 StaticCache 的判断方法。397 收藏 -
AI 接口采用流式输出后,JSON 可能被拆在多个数据块里,直接逐块反序列化会遇到半截对象和重复消费。本文用 Go 的缓冲区、边界扫描和字段完整性检查,构造一条可复现的流式解析链路。395 收藏 -
多模态知识库接入图片后,成本和延迟往往不是由文件大小单独决定。本文从图片任务、detail 级别、裁剪策略和上下文预算四个维度,给出可执行的输入分层与验收方法。394 收藏 -
Gemini Flex inference 用标准价格的一半换取可让渡容量,适合不赶实时结果的评测、数据丰富和后台链路。本文用 service_tier=flex 的请求示例拆开 429、503、超时、重试和 Batch 的边界,避免把低价请求误接到用户关键路径。394 收藏 -
Hugging Face Responses API 可以在同一个 input 数组中组合 input_text 与 input_image。本文用 Python 和 OpenAI SDK 说明请求结构,并按令牌权限、模型路由、图片 URL 和输出字段拆解常见失败原因。392 收藏 -
围绕真实初筛候选集配置 reranker 评估,说明 positive、negative、documents、candidate_k、rerank_k 的边界,并用 MRR@10、nDCG@10、MAP 对比基线与重排结果,定位召回、截断和分数解释问题。388 收藏 -
AI 推理延迟不能只看一个平均数:本文用 TTFT、TPOT/ITL 和端到端耗时拆开聊天、Agent、代码生成与批处理的观测口径,并给出排队、检索、prefill、decode 的定位方法。387 收藏 -
视觉表格识别前,先统一 xyxy 坐标、比例扩边和边界裁剪,再交给 Hugging Face image processor 做 resize、归一化等预处理。本文给出可复用代码和排查清单。387 收藏