人工智能技术文章
-
多模态模型的图片成本不只取决于文件大小,还取决于处理器如何把像素切成视觉 token。本文以 Hugging Face Transformers 的 processor 为参照,说明服务端怎样读取 min_pixels、max_pixels,按像素预算等比例缩放,再决定压缩、裁剪和监控字段。259 收藏 -
本地量化模型显存不足时,先拆分权重、KV cache 和计算缓冲区,再按真实输入选择上下文长度。本文给出 2048、4096、8192 的起点判断,以及上下文、KV 缓存精度、批大小和量化档位的调节顺序。258 收藏 -
解释 Safetensors 如何用文件头中的 shape、dtype 与 data_offsets 定位权重切片,说明 get_slice、零拷贝、内存映射和 GPU 传输的真实边界。258 收藏 -
Gemini API 的 Context Caching 适合反复使用同一份长上下文的场景。本文用 cachedContents.create 创建缓存,再把 cache.name 绑定到 generateContent,讲清缓存内容、动态问题和 TTL 的边界。257 收藏 -
长文档问答不能只返回文件名。本文给出文档版本、章节锚点、内容块、引用卡片和答案断言的完整映射方法,并补充覆盖率、锚点解析、版本一致性、低证据拒答与回滚检查。257 收藏 -
大模型返回的工具参数只是建议,不是业务事实。本文用 Go 做一个小型工具调用网关,演示如何校验参数、限制动作范围、用请求键去重,并在失败后安全重试。255 收藏 -
Go 服务把模型的流式输出转发给浏览器时,客户端刷新或断网会让上游请求继续消耗连接和配额。本文用 Request.Context、HTTP 流读取和取消信号复盘这个故障,并给出可验证的清理与回滚方案。254 收藏 -
排查大模型多轮工具调用中的上下文丢失,梳理 tool_call_id、并行结果配对和消息回放验收。252 收藏 -
从一个知识库问答召回率下降的现场出发,拆解查询与文档向量任务类型、topK基线和Recall@K验证方法,帮助定位RAG检索问题到底在编码、切块还是排序。251 收藏 -
本地大模型推理中,KV cache 容量和 batch size 共享显存预算。本文从输入长度、并发、TTFT、TPOT 与长尾延迟出发,给出可落地的配置起点、压测矩阵和超限回退策略。251 收藏 -
说明 PEFT LoRA 的 target_modules 如何按模型模块树、任务范围和参数预算选择,并给出默认目标、all-linear、MoE 特例与命中检查方法。251 收藏 -
科技周边 · 人工智能 | 1个月前 | 异步任务 · 人工智能 · openai · 工程实践 · OpenAI Batch API 部分结果 cancelling cancelled output_file_id error_file_id
OpenAI Batch API 取消请求后不会瞬间变成最终状态。本文用 cancelling、cancelled、output_file_id、error_file_id 和 request_counts 拆开取消收口流程,说明如何保留部分成功结果、核对失败行,并避免把取消误判成整批回滚。250 收藏 -
科技周边 · 人工智能 | 1天前 | JSON · python · 人工智能 · 工程实践 · 结构化输出 · Pydantic JSON Schema AI 结构化输出 模型重试 兜底解析 大模型工程
模型稳定输出 JSON 不能只靠提示词。本文用 JSON Schema、Pydantic 校验、分类重试与受控兜底解析,搭建一条可观测的结构化输出链路。250 收藏 -
bitsandbytes 4-bit 量化只压缩冻结基座权重,LoRA 参数、梯度、优化器状态、激活与 CUDA 工作区仍会占用显存。本文给出 NF4 配置、峰值测量方法和 OOM 调整顺序,说明 QLoRA 单卡训练的真实边界。249 收藏 -
用 OpenAI Structured Outputs 约束嵌套 JSON 时,关键是逐层声明 required,并在每个 object 节点关闭 additionalProperties,再用 nullable 表达业务可选值。247 收藏