人工智能技术文章
-
科技周边 · 人工智能 | 6天前 | JSON · 人工智能 · schema · 工程实践 · 大模型 · Python LLM JSONSchema 结构化输出 JSON Schema 有限重试
LLM 输出 JSON 不稳定时,不能只靠提示词要求“返回 JSON”。本文用一个工单分类小项目拆解解析、JSON Schema 校验、错误分类和有限重试,并说明为什么业务失败不该混入格式重试。480 收藏 -
Reranker 分数不是通用的相关性刻度。本文从分数归一化、候选集标注、分层阈值和 top-k 兜底四个方面,说明如何减少相关答案被过滤的问题。477 收藏 -
多智能体系统出错时,单看模型调用或 HTTP 状态往往找不到根因。本文从一次用户任务出发,拆解 agent 委派、交接、工具调用和记忆读写的追踪边界,给出可回放的链路设计与检查清单。474 收藏 -
用 Qdrant payload 保存 tenant_id 和 doc_type,通过 must 组合租户与文档类型过滤条件,并为高频字段建立 payload index,让向量检索先守住知识库权限边界。473 收藏 -
Embedding 模型切换时,旧向量不能只看维度是否相同。本文从维度、语义空间和索引元数据三个层面说明混用风险,并给出重嵌入、建新索引和灰度切换的迁移做法。473 收藏 -
分类评测集不均衡时,macro 与 micro 不是谁更高级的问题,而是按类别平均还是按样本汇总。本文用统一口径、混淆矩阵和复核清单解释两者差异。473 收藏 -
科技周边 · 人工智能 | 1星期前 | python · 人工智能 · transformers · 流式输出 · SSE Transformers TextIteratorStreamer 流式生成
用 TextIteratorStreamer 接收 Transformers 的增量文本,再通过 FastAPI SSE 传给浏览器,完成一个可处理异常和断开的流式生成接口。472 收藏 -
大模型回答出现整段重复时,不要只把 temperature 调高。本文按请求参数、采样范围和停止条件拆开排查,给出一个可复现的参数核对流程,并说明哪些现象属于模型能力边界,哪些是客户端拼接造成的。470 收藏 -
从首字延迟 TTFT、分段间隔和客户端断线三个信号入手,搭建大模型流式输出的观测口径,并给出 Go 服务端记录与回放验收方法。466 收藏 -
科技周边 · 人工智能 | 3星期前 | 人工智能 · openai · 兼容性 · Chat Completions · 推理模型 · token预算 AI推理模型 max_tokens max_completion_tokens 参数迁移
把 AI 接口从普通聊天模型切到推理模型时,max_tokens 不是简单改个字段名。本文从请求兼容、推理 token 预算、截断判断和回滚核对四个方面,给出一套可复用的迁移检查方法。464 收藏 -
Responses API 同时声明多个函数工具时,可用 tool_choice 的 allowed_tools 将当前轮次限制到指定子集,再用 auto、required 或 none 表达调用策略。本文给出参数结构、选择边界和服务端安全检查。463 收藏 -
AI 推理服务的 p95、p99 延迟突然抖动时,不要只看 GPU 利用率。本文用请求、排队、输入处理、模型计算和输出处理的分段指标,结合并发与吞吐变化,判断瓶颈究竟在调度排队还是模型计算。462 收藏 -
多模态模型识别扫描表格时,漏列通常不是模型单点失误,而是图像缩放、表格线、列坐标和结构化输出共同造成的。本文给出一套从输入预处理到坐标复核、局部纠错和结果验收的实用流程。461 收藏 -
AI Agent 一轮工具调用可能已经改写库存、发送通知,却在最后一步返回超时。本文用订单履约场景拆开部分成功的状态记录、补偿动作和安全重试边界,给出可落地的验收清单。460 收藏 -
Gemini 3.5 Flash 已建议用 thinking_level 替代 thinking_budget。本文用同一组请求对比 minimal、low、medium、high,说明迁移写法、选档边界与回归检查。457 收藏