人工智能技术文章
-
批量推理服务把长任务和短任务混在一个先进先出队列里时,小请求会被大任务拖住。本文用 Go 的 heap.Interface、优先级字段和 worker 调度,拆出一条可验证的隔离路径,并说明公平性与取消边界。274 收藏 -
多模态模型处理长截图或复杂表格时,整图输入常把小字号和列关系一起压缩掉。本文用区域裁剪、坐标记录和字段映射三步,搭建一套可复核的表格识别流程,避免只看最终文本猜错位置。221 收藏 -
AI 接口采用流式输出后,JSON 可能被拆在多个数据块里,直接逐块反序列化会遇到半截对象和重复消费。本文用 Go 的缓冲区、边界扫描和字段完整性检查,构造一条可复现的流式解析链路。395 收藏 -
多模型推理服务常见的问题不是请求发不出去,而是任务一拥而上把显存和上游连接同时压满。本文用 Python asyncio.Semaphore 限制并发入口,配合 TaskGroup、超时和结果核对,给出一套可验证的推理任务调度写法。260 收藏 -
AI 代理调用搜索、数据库或文件工具时,完整结果直接塞进上下文会挤压后续推理空间。本文用 Go 演示摘要与原始响应分离、引用句柄回取和失败状态核对。272 收藏 -
本地视觉模型服务最容易被忽略的问题,不是单次推理慢,而是上传任务无限排队。本文用 Python asyncio.Queue(maxsize=2) 建立背压,让生产者在队列满时等待,并用 inference_mode、task_done 和显存检查验证流水线是否真的稳定。308 收藏 -
大模型工具调用经常把参数省略、传 null 和传空对象混在一起。本文用 Go 的 json.RawMessage 保留原始状态,再按工具契约做缺失、null、空对象和合法参数的分支校验。443 收藏 -
大模型回答出现整段重复时,不要只把 temperature 调高。本文按请求参数、采样范围和停止条件拆开排查,给出一个可复现的参数核对流程,并说明哪些现象属于模型能力边界,哪些是客户端拼接造成的。470 收藏 -
科技周边 · 人工智能 | 1天前 | 数据迁移 · 人工智能 · rag · embedding · 向量检索 · 向量数据库 向量维度 OpenAI Embeddings dimensions 索引迁移
向量检索系统里,模型、dimensions 参数和索引维度必须形成一份可检查的契约。本文用 OpenAI Embeddings 的请求参数、双索引回填和查询路由,说明如何迁移维度而不让新旧向量混在一起。105 收藏 -
大模型评测中的长答案偏好,往往和位置偏差、格式线索混在一起。本文用成对盲评、交换答案位置和重复试验拆开这几个因素,并给出可复核的 Python 验收流程。329 收藏 -
RAG 的 chunk overlap 不是越大越好。本文从标题层级切片、token 上限和检索命中三个可测边界出发,给出一套可复现的初始参数、验证方法和调整顺序。309 收藏 -
RAG 应用不能把最高相似度直接当成答案可信度。本文用可复现的分层规则,把 query_embedding、similarity_score、上下文预算和引用保留串成一条检索到回答的质量控制链。325 收藏 -
视觉语言模型接入 OCR 时,结果漂移往往不是模型突然失忆,而是裁切坐标、原图尺寸和结构化字段没有对齐。本文用一条可复核的数据路径拆开问题,并给出校验与回退做法。406 收藏 -
RAG 流程里,检索命中不等于可以直接交给模型。本文用来源分层、上下文拼接、引用保留和空结果分支,搭出一条可核对、可回退的回答链路。170 收藏 -
MCP 服务端不能看到客户端声明了 elicitation 就直接发送任意模式。本文按初始化能力、form 与 url 分支、请求结果和失败回退,说明如何核对客户端支持范围并守住敏感信息边界。221 收藏