Go语言技术文章
-
批量推理服务把长任务和短任务混在一个先进先出队列里时,小请求会被大任务拖住。本文用 Go 的 heap.Interface、优先级字段和 worker 调度,拆出一条可验证的隔离路径,并说明公平性与取消边界。274 收藏 -
多模态模型处理长截图或复杂表格时,整图输入常把小字号和列关系一起压缩掉。本文用区域裁剪、坐标记录和字段映射三步,搭建一套可复核的表格识别流程,避免只看最终文本猜错位置。221 收藏 -
AI 接口采用流式输出后,JSON 可能被拆在多个数据块里,直接逐块反序列化会遇到半截对象和重复消费。本文用 Go 的缓冲区、边界扫描和字段完整性检查,构造一条可复现的流式解析链路。395 收藏 -
多模型推理服务常见的问题不是请求发不出去,而是任务一拥而上把显存和上游连接同时压满。本文用 Python asyncio.Semaphore 限制并发入口,配合 TaskGroup、超时和结果核对,给出一套可验证的推理任务调度写法。260 收藏 -
AI 代理调用搜索、数据库或文件工具时,完整结果直接塞进上下文会挤压后续推理空间。本文用 Go 演示摘要与原始响应分离、引用句柄回取和失败状态核对。272 收藏 -
科技周边 · 业界新闻 | 3星期前 | 云原生 · 监控 · kubernetes · 版本发布 · 资源监控 Kubernetes 1.37 Metrics API kubectl top HorizontalPodAutoscaler
Kubernetes 1.37 将 metrics.k8s.io API 推进到稳定的 v1。变化不只是版本标签:集群团队需要把 metrics-server、kubectl top、HorizontalPodAutoscaler 和权限链路放在同一条验收路径上,确认监控数据能可靠支持扩缩容决策。280 收藏 -
本地视觉模型服务最容易被忽略的问题,不是单次推理慢,而是上传任务无限排队。本文用 Python asyncio.Queue(maxsize=2) 建立背压,让生产者在队列满时等待,并用 inference_mode、task_done 和显存检查验证流水线是否真的稳定。308 收藏 -
大模型工具调用经常把参数省略、传 null 和传空对象混在一起。本文用 Go 的 json.RawMessage 保留原始状态,再按工具契约做缺失、null、空对象和合法参数的分支校验。443 收藏 -
大模型回答出现整段重复时,不要只把 temperature 调高。本文按请求参数、采样范围和停止条件拆开排查,给出一个可复现的参数核对流程,并说明哪些现象属于模型能力边界,哪些是客户端拼接造成的。470 收藏 -
向量检索系统里,模型、dimensions 参数和索引维度必须形成一份可检查的契约。本文用 OpenAI Embeddings 的请求参数、双索引回填和查询路由,说明如何迁移维度而不让新旧向量混在一起。105 收藏 -
WebMCP 是面向浏览器代理的提议式 Web 标准,可把 JavaScript 函数或 HTML 表单暴露成结构化工具。本文结合 Chrome 官方文档,拆解试用入口、权限边界、工具调用链和不支持时的渐进增强回退方案。354 收藏 -
大模型评测中的长答案偏好,往往和位置偏差、格式线索混在一起。本文用成对盲评、交换答案位置和重复试验拆开这几个因素,并给出可复核的 Python 验收流程。329 收藏 -
科技周边 · 业界新闻 | 3星期前 | css · chrome · 前端开发 · 业界新闻 · Web API 文本高亮 Chrome 152 CSS Custom Highlight getClientRects
Chrome 152 把 OpaqueRange 与 getClientRects、CSS Custom Highlight 的组合带到更清晰的 Web 平台路线中。本文从搜索结果高亮和悬浮标注场景出发,拆解矩形边界、渲染高亮、能力判断与降级策略。390 收藏 -
Kubernetes v1.37 将 WatchCache 初始化与恢复时的请求洪峰处理得更稳:理解 API Server 如何限制回源、客户端为何必须处理 HTTP 429,以及升级后怎样验证控制面恢复。198 收藏 -
RAG 的 chunk overlap 不是越大越好。本文从标题层级切片、token 上限和检索命中三个可测边界出发,给出一套可复现的初始参数、验证方法和调整顺序。309 收藏