鸿渐Space
聚焦人工智能的中文博客
142篇收录文章访问博客 →
最新文章
-
全球 token 均价跌破 1 美元之后,应用层开始按完成率报价2026/09/04
公开数据显示全球每百万 token 推理均价已跌破 1 美元。模型便宜之后,产品竞争力转到完成率、延迟和人工兜底比例。
-
Flash 档追上旗舰分:9 月 API 选型按任务拆档2026/09/04
Gemini 3.8 Flash 以每百万 token 0.75 / 3.75 美元贴近独立指数上的旗舰模型,开发者选型从追最强变成按任务选档。
-
用失败样本做回归:模型对比从感觉变成表格2026/09/04
把线上或作业里的失败输入收成回归集,每次换模型、改提示词都先跑这批样本,避免「看起来更好」的错觉。
-
新学期 RAG 最小闭环:先固定语料再接 Agent2026/09/04
开学项目最稳的路径是先跑通检索问答:固定一份语料、一套评测问句,确认命中率后再加工具和多 Agent。
-
开学第一周先做评测集:20 条真实样本够用一学期2026/09/04
把暑期项目收口成可复跑的评测:固定模型版本,用 20 至 50 条真实样本记录通过率、延迟和单任务成本。
-
大模型网关自建指南:把 API 账单砍掉四成2026/09/04
多模型、多厂商、多计价规则,账单越看越糊涂。自建一层薄网关,省钱、可观测、随时切换,一箭三雕。
-
T-agent 设计笔记(二):给 Agent 建立体检制度2026/09/03
没有评测的 Agent 系统如同没有体检的人,生病了都不知道从哪查起。本文公开 T-agent 的三层评测体系。
-
开源与闭源:大模型生态的楚河汉界2026/09/01
开源权重攻城略地,闭源巨头高筑城墙。这盘棋下到中盘,真正的问题已经不是谁能赢,而是棋盘正在换。
-
48 小时黑客松生存手册:从踩坑到领奖2026/08/30
参加过十一场黑客松之后,我把反复验证有效的节奏表、工具清单与踩坑名录整理成了这本手册。
-
RAG 系统调优实录:从能用到的可靠2026/08/28
RAG 之难,不在检索,而在「检而得当」。本文以一个真实项目为例,记录从基线到 92% 命中率的十二次迭代。