人工智能技术文章
-
AI 代理调用搜索、数据库或文件工具时,完整结果直接塞进上下文会挤压后续推理空间。本文用 Go 演示摘要与原始响应分离、引用句柄回取和失败状态核对。272 收藏 -
本地视觉模型服务最容易被忽略的问题,不是单次推理慢,而是上传任务无限排队。本文用 Python asyncio.Queue(maxsize=2) 建立背压,让生产者在队列满时等待,并用 inference_mode、task_done 和显存检查验证流水线是否真的稳定。308 收藏 -
大模型工具调用经常把参数省略、传 null 和传空对象混在一起。本文用 Go 的 json.RawMessage 保留原始状态,再按工具契约做缺失、null、空对象和合法参数的分支校验。443 收藏 -
大模型回答出现整段重复时,不要只把 temperature 调高。本文按请求参数、采样范围和停止条件拆开排查,给出一个可复现的参数核对流程,并说明哪些现象属于模型能力边界,哪些是客户端拼接造成的。470 收藏 -
科技周边 · 人工智能 | 1星期前 | 数据迁移 · 人工智能 · rag · embedding · 向量检索 · 向量数据库 向量维度 OpenAI Embeddings dimensions 索引迁移
向量检索系统里,模型、dimensions 参数和索引维度必须形成一份可检查的契约。本文用 OpenAI Embeddings 的请求参数、双索引回填和查询路由,说明如何迁移维度而不让新旧向量混在一起。105 收藏 -
大模型评测中的长答案偏好,往往和位置偏差、格式线索混在一起。本文用成对盲评、交换答案位置和重复试验拆开这几个因素,并给出可复核的 Python 验收流程。329 收藏 -
RAG 的 chunk overlap 不是越大越好。本文从标题层级切片、token 上限和检索命中三个可测边界出发,给出一套可复现的初始参数、验证方法和调整顺序。309 收藏 -
RAG 应用不能把最高相似度直接当成答案可信度。本文用可复现的分层规则,把 query_embedding、similarity_score、上下文预算和引用保留串成一条检索到回答的质量控制链。325 收藏 -
视觉语言模型接入 OCR 时,结果漂移往往不是模型突然失忆,而是裁切坐标、原图尺寸和结构化字段没有对齐。本文用一条可复核的数据路径拆开问题,并给出校验与回退做法。406 收藏 -
RAG 流程里,检索命中不等于可以直接交给模型。本文用来源分层、上下文拼接、引用保留和空结果分支,搭出一条可核对、可回退的回答链路。170 收藏 -
MCP 服务端不能看到客户端声明了 elicitation 就直接发送任意模式。本文按初始化能力、form 与 url 分支、请求结果和失败回退,说明如何核对客户端支持范围并守住敏感信息边界。221 收藏 -
向量检索的 top_k 越大不一定让 RAG 答案更好。本文用一个可运行的 Python 小实验说明如何按 source_id 分组、保留上下文多样性,再把有限的候选片段交给生成模型。261 收藏 -
用 Python 把大模型返回的 JSON 经过解析、字段校验和有限重试,避免把半截或缺字段的数据直接写入业务流程。501 收藏 -
RAG 不是召回越多越好。本文从 retrieve、rerank、budget、prompt 四个真实环节拆解上下文被截断的原因,并给出可验证的预算分配与降级方案。495 收藏 -
多模态批处理完成后,输入行与输出行可能顺序不同,失败请求也可能单独落在错误文件。本文用 custom_id 建立稳定主键,再按 JSONL 逐行解析、分离成功与失败,并给出可重跑而不重复记账的对账流程。319 收藏