人工智能技术文章
-
本地大模型量化后变慢,不一定是量化本身造成的。本文用显存峰值、首 token 延迟、生成 token/s 和上下文长度的对照实验,区分权重显存压力与 KV Cache 上下文瓶颈,并比较 4/8 bit、缓存卸载和量化缓存的选择。433 收藏 -
LoRA 微调效果不只取决于 rank 和学习率,训练样本的角色、模板、结束标记与推理入口也必须保持一致。本文用 messages 示例说明如何固定这份格式契约。426 收藏 -
OpenAI File Search 可以在 vector store file 上写入 attributes,再用 file_search.filters 通过 eq、and、or、in 和数值范围条件缩小检索范围。本文用租户、语言和年份示例说明字段设计、复合过滤以及空结果排查。426 收藏 -
Prompt 变化不能只靠复制文本和人工回忆。本文用模板、变量、模型配置、输入集和输出指标五类记录,搭建可重放、可比较、可回滚的版本流程。412 收藏 -
向量检索通常应先执行租户、权限、状态和时间等硬过滤,再做向量或混合召回与 rerank,最后应用阈值、去重和多样性检查,本文给出可落地的判断顺序。409 收藏 -
图像问答不稳定,常常不是模型不会看,而是说明文字和视觉证据没有分层。本文给出冲突分类、证据优先级、结构化输入和人工复核的实用提示设计。404 收藏 -
从文档结构、token预算、重叠窗口和稳定元数据四个方面,说明RAG切块与引用定位的配置方法、排查顺序和常见误区。404 收藏 -
用 Ollama Modelfile 固化 SYSTEM 系统提示和 num_ctx 上下文长度,说明 ollama create、ollama show、ollama ps 的配合方式,以及服务环境和客户端覆盖配置的排查思路。403 收藏 -
按 decoder-only 生成、训练、encoder-only 和 encoder-decoder 任务拆解 Tokenizer 左右填充选择,并说明 attention_mask、pad_token 与标签屏蔽。399 收藏 -
模型输出 JSON 偶尔带有 Markdown 围栏时,先判断拒答和截断状态,再只清理首尾围栏,最后用 encoding/json 解码并执行字段级业务校验。398 收藏 -
量化推理选精度不能只看模型参数量,还要扣除 KV cache、激活、运行时余量和量化元数据。本文用显存预算、位宽估算和 Transformers BitsAndBytesConfig,说明何时选择 FP16/BF16、INT8 或 INT4,并给出吞吐与质量的验证边界。398 收藏 -
科技周边 · 人工智能 | 3星期前 | 人工智能 · 性能排查 · 提示词工程 · 提示词缓存动态字段 DynamicCache KV缓存 Transformers缓存 past_key_values use_cache StaticCache
本文以 Hugging Face Transformers 的 DynamicCache 为例,说明提示词缓存动态字段的配置边界,覆盖 use_cache、past_key_values、迭代对话、窗口上限、回滚、显存排查以及切换 StaticCache 的判断方法。397 收藏 -
图像生成提示词不要只堆风格词。本文把任务目标、主体、位置、留白、画幅和排除项拆成可复用结构,说明如何让生成结果更贴近文章配图、海报或手机画布的版式要求。394 收藏 -
Hugging Face Responses API 可以在同一个 input 数组中组合 input_text 与 input_image。本文用 Python 和 OpenAI SDK 说明请求结构,并按令牌权限、模型路由、图片 URL 和输出字段拆解常见失败原因。392 收藏 -
围绕真实初筛候选集配置 reranker 评估,说明 positive、negative、documents、candidate_k、rerank_k 的边界,并用 MRR@10、nDCG@10、MAP 对比基线与重排结果,定位召回、截断和分数解释问题。388 收藏