Insights

关于 AI 系统的
技术研究。

覆盖 Agent 编排架构、模型能力边界与 AI 工程可靠性。每篇标注数据来源,并给出结论的适用范围。

研究报告14 分钟读

一致性有一个平凡解:多模态生成的指标陷阱

视频生成的时序一致性指标存在一个退化解——让画面别动。基准作者在论文里用了「作弊」这个词描述它。当一致性成为叙事类生成的核心约束时,指标怎么设计,决定了优化会走向哪里。

2026-08-05阅读
研究报告16 分钟读

基线决定结论:模型路由的成本经济学

同一类路由技术,与随机分配相比是「提升六成」,与一个不需要训练的单模型相比是「落后两成」。两份公开评测的分歧不在方法,在对照基线的选择——而基线通常写在论文的正文里,不在被引用的那句结论里。

2026-08-05阅读
研究报告15 分钟读

装得下不等于用得上:长上下文与检索之争缺失的变量

三份独立材料对「长上下文能否取代检索」给出了方向相反的结论。而在一份研究内部的受控对比中,仅仅更换检索的实现方式,就足以翻转结论方向——这个变量在多数对比实验中没有被单独报告。

2026-08-05阅读
研究报告18 分钟读

验证危机:AI 编码的瓶颈已经不在生成侧

基准分数在涨,完全委托率却停在 0–20%。本文提出一种解释:行业用来判断「AI 编码行不行」的基准、感知、测试这三层手段,正在同时失效。

2026-08-05阅读
研究报告17 分钟读

并行读,串行写:2026 年 Agent 编排架构的收敛点

两年里最激烈的架构争论正在收敛。把三方材料——一方的立场反转、一份趋势报告、一份失败分类研究——放在一起看,它们指向同一条判据;此前这条判据没有被作为统一标准交叉验证过。

2026-08-05阅读
实测14 分钟读

路径估算先于结论:一个新站 15 天的 AI 爬虫 UA 日志观察

对自有服务器 15 天 nginx 日志按 User-Agent 与路径做分类:携带 AI 爬虫 UA 且命中站点路径清单的请求为搜索引擎 UA 组的 1.7 至 2.1 倍,其中 62% 只请求 robots.txt 与 sitemap.xml。UA 身份未经核验。

2026-08-04阅读