人工智能技术文章
-
大模型以流式方式返回 JSON 时,任意一个分片都可能停在字符串或对象中间。本文用 Go 写一个增量缓冲器,以括号配对判断候选完整度,最后再用标准 JSON 解析和业务字段校验收口。284 收藏 -
把整张长图直接交给视觉模型,常见结果是文字区域太小、成本偏高且难以复核。本文用 OCR 返回的 boundingPoly 先定位目标区域,再把归一化坐标映射为像素矩形,最后用二次识别确认裁剪没有偏移。425 收藏 -
长文切片容易在 RAG 召回中占满候选集。本文用 Go 演示按来源分桶、限制每桶配额,再把候选交给 rerank,最后按 token 预算组装上下文,并给出可复查的召回指标。118 收藏 -
批量推理入口如果直接为每个请求创建 goroutine,短时间内就会把下游模型服务和本地内存一起推高。本文用 Go 的 channel 信号量限制并发,配合 context 取消、结果回收和失败清理,给出一条可以验收的控制路径。331 收藏 -
批量推理服务把长任务和短任务混在一个先进先出队列里时,小请求会被大任务拖住。本文用 Go 的 heap.Interface、优先级字段和 worker 调度,拆出一条可验证的隔离路径,并说明公平性与取消边界。274 收藏 -
多模态模型处理长截图或复杂表格时,整图输入常把小字号和列关系一起压缩掉。本文用区域裁剪、坐标记录和字段映射三步,搭建一套可复核的表格识别流程,避免只看最终文本猜错位置。221 收藏 -
AI 接口采用流式输出后,JSON 可能被拆在多个数据块里,直接逐块反序列化会遇到半截对象和重复消费。本文用 Go 的缓冲区、边界扫描和字段完整性检查,构造一条可复现的流式解析链路。395 收藏 -
多模型推理服务常见的问题不是请求发不出去,而是任务一拥而上把显存和上游连接同时压满。本文用 Python asyncio.Semaphore 限制并发入口,配合 TaskGroup、超时和结果核对,给出一套可验证的推理任务调度写法。260 收藏 -
AI 代理调用搜索、数据库或文件工具时,完整结果直接塞进上下文会挤压后续推理空间。本文用 Go 演示摘要与原始响应分离、引用句柄回取和失败状态核对。272 收藏 -
本地视觉模型服务最容易被忽略的问题,不是单次推理慢,而是上传任务无限排队。本文用 Python asyncio.Queue(maxsize=2) 建立背压,让生产者在队列满时等待,并用 inference_mode、task_done 和显存检查验证流水线是否真的稳定。308 收藏 -
大模型工具调用经常把参数省略、传 null 和传空对象混在一起。本文用 Go 的 json.RawMessage 保留原始状态,再按工具契约做缺失、null、空对象和合法参数的分支校验。443 收藏 -
大模型回答出现整段重复时,不要只把 temperature 调高。本文按请求参数、采样范围和停止条件拆开排查,给出一个可复现的参数核对流程,并说明哪些现象属于模型能力边界,哪些是客户端拼接造成的。470 收藏 -
科技周边 · 人工智能 | 2天前 | 数据迁移 · 人工智能 · rag · embedding · 向量检索 · 向量数据库 向量维度 OpenAI Embeddings dimensions 索引迁移
向量检索系统里,模型、dimensions 参数和索引维度必须形成一份可检查的契约。本文用 OpenAI Embeddings 的请求参数、双索引回填和查询路由,说明如何迁移维度而不让新旧向量混在一起。105 收藏 -
大模型评测中的长答案偏好,往往和位置偏差、格式线索混在一起。本文用成对盲评、交换答案位置和重复试验拆开这几个因素,并给出可复核的 Python 验收流程。329 收藏 -
RAG 的 chunk overlap 不是越大越好。本文从标题层级切片、token 上限和检索命中三个可测边界出发,给出一套可复现的初始参数、验证方法和调整顺序。309 收藏