Go语言技术文章
-
Hugging Face 生态通过 Sentence Transformers MultiVectorEncoder 降低了多向量检索的使用门槛,但 token 级索引会带来更高的存储与重排成本。本文比较稠密召回、多向量重排和全库多向量方案,给出训练与上线检查清单。461 收藏 -
Gradio 长任务不要只等函数返回:用生成器 yield 阶段状态,用 gr.Progress 显示进度,再用 cancels 连接停止按钮,同时明确 UI 取消与外部作业停止的边界。197 收藏 -
Hugging Face 新增 WebGPU kernels 后,浏览器本地推理不能只看算子数量或单项倍数,还要评估 WebGPU 平台、kernel 契约、完整链路性能与回退策略。161 收藏 -
量化模型精度下降时,不要只看一个总分。本文用固定输入、配对预测和分桶误差,区分评测条件不一致、长输入敏感与校准集覆盖不足,并给出可复用的对照脚本。124 收藏 -
Assistants API 进入弃用后的迁移重点,不是替换一个接口地址,而是重新划分会话状态、工具调用、输出解析和数据保留边界。本文给出旧对象到 Responses API 的映射表、适配代码和可回滚灰度顺序。210 收藏 -
用 PEFT 的 merge_and_unload 合并 LoRA adapter,固定 tokenizer、输入和生成参数,再通过 token 与 logits 对比判断合并前后是否一致。399 收藏 -
OpenAI Agents SDK 引入沙箱工作区、权限和快照后,开发者应把执行身份、文件权限、主机路径授权与外层审批拆开设计。本文给出一套可落地的权限分层与发布前检查清单。169 收藏 -
用 DataCollatorWithPadding 让 Transformers 按 batch 内最长文本动态补齐,并配合 attention_mask、截断和长度分桶减少无效推理计算。297 收藏 -
CNCF 最新平台工程成熟度讨论把“有标准工具”和“真正自助服务”区分开来。本文结合队列、例外请求与团队边界,拆解内部开发平台的渐进式改造路径。364 收藏 -
多租户向量检索不能只依赖相似度。本文说明如何从服务端鉴权上下文得到 tenant_id,为记录建立精确过滤字段,并比较共享集合、分区键和独立集合的隔离边界。108 收藏 -
Kubernetes 运行 AI 并不等于平台已经准备好 AI。本文结合近期 CNCF、Kubernetes 和 Kueue 官方资料,解释 GPU 与异构资源、模型版本、评估观测和开发者黄金路径如何把 AI 工作负载推向平台工程。258 收藏 -
RAG 检索结果过多时,不要只调小 top_k。本文拆分候选去重、重排、上下文压缩与预算装箱,给出可落地的选择规则、Python 示例和四项排查指标。207 收藏 -
CNCF近期关于异构AI基础设施的讨论,核心不是只管理GPU,而是把CPU预处理、GPU推理、数据通道、扩缩容信号和可观测性放进同一条资源链路。191 收藏 -
用 OpenAI Agents SDK 的 RunState、session_state 和 snapshot 区分三种恢复边界,再用工作区检查点把沙箱任务拆成可重试、可回滚的阶段。441 收藏 -
OpenTelemetry 在 2026 年正式毕业,意味着它更适合纳入企业长期观测架构,但不等于某个后端产品自动胜出。本文拆解项目成熟度、采集处理层、后端能力和试点验收边界,帮助团队做出可回滚的观测平台选型。150 收藏