人工智能技术文章
-
科技周边 · 人工智能 | 2天前 | 缓存 · 人工智能 · 提示词工程 · 提示词缓存 cache_control Prompt Caching 静态前缀 cache_read_input_tokens
提示词缓存命中率低时,先把工具定义、系统规则和稳定上下文划为前缀,把时间戳、用户问题和检索结果留在后缀,再用 usage 字段判断断点、TTL、长度门槛和并发时序问题。453 收藏 -
模型路由不应只选模型,还要分别控制推理强度与硬上限。本文给出四档难度信号、升级条件、Go 路由示例和最小回归指标,帮助团队兼顾质量、延迟与成本。232 收藏 -
用固定节点、根递归引用和输出预算约束结构化输出中的树状字段,并区分正常结果、拒答与截断响应。215 收藏 -
智能体工具重试的关键不是固定重放,而是先分类失败,再用共享预算、幂等键、退避、熔断和审计日志控制风险。本文给出三种策略对比与可运行的 Python 控制器。236 收藏 -
多模态模型的视觉令牌主要受图片预处理分辨率和图片数量影响。本文以 Transformers 与 Qwen2.5-VL 为例,说明如何用 min_pixels、max_pixels 和任务分级配置控制显存、延迟与识别细节。196 收藏 -
连续批处理会在每轮推理后移出已完成请求并补入新请求,减少批次槽位浪费;调优还需同时约束 Token 预算、KV Cache 与延迟。404 收藏 -
静态量化的校准集不能只随机抽训练样本。本文从线上预处理、来源领域、长度形状、常见分布和关键长尾建立覆盖矩阵,并说明如何用独立评估与漂移监控判断校准是否可靠。372 收藏 -
LoRA 合并后输出变化很大,先不要盲目重训。本文从基础模型、适配器缩放、量化与 dtype、推理随机性和 tokenizer 五层排查,并给出确定性对照代码与回归清单。404 收藏 -
RAG 的 chunk_overlap 过大,会让相邻分块产生高度相似的向量,top-k 被同一来源的重复内容占满。本文从切分边界、候选池、去重和 MMR 重排四个方面给出可回归的调整方法。409 收藏 -
合成数据不能仅凭外观接近真实样本就直接替代。本文从覆盖率、分布与相关关系、真实留出集任务效果、偏差和隐私四层检查,说明如何决定它适合补充、加权使用还是禁止替代。128 收藏 -
把提示词模板、变量契约和固定回归样例放进同一次 Git 提交,配合输入哈希、模型参数与可回退版本,解决改完提示词却无法复现和比较的问题。111 收藏 -
电脑操作型智能体上线前,应同时限制运行环境、代理身份、目标站点、可执行动作与数据流,并为外发、购买、删除、授权等高后果动作设置逐次人工确认。本文给出分层护栏、风险矩阵、审计回滚和最小验证清单。286 收藏 -
本地模型只缩短了资料到推理引擎的链路,并不会自动封闭插件、日志、向量库、监听端口、同步备份和输出协作等路径。本文用“本地受控处理区”模式梳理常见泄露面、典型实现、反例和上线检查清单。127 收藏 -
混合召回应让关键词与向量检索并行产生候选,再用 RRF 等可解释方法合并名次,而不是直接相加不同量纲的原始分数。本文给出实现骨架、参数选择、过滤边界与评估方法。293 收藏 -
智能体一次任务答对,不代表执行过程可靠。本文用一个可落地的评测表,把最终结果、工具轨迹、成本、延迟和失败恢复拆开衡量,并给出规则评分与版本对比方法。290 收藏