Stream 公布其内容审核在真实流量下的最新基准:英文文本约 35 毫秒,文本请求吞吐超过 1500 RPS,单帧评分约 300 毫秒。
Clef 系列新增 Clef-omni,支持音频、视频、图像和文本输入;Clef-flash 降价,Clef 托管推理速度最高提升约 2 倍。
逐位确定性可提升大规模预训练中的调试、验证与可复现恢复能力,尤其适用于跨数千 GPU 训练万亿参数模型的复杂场景。
LegalOn 通过将 Astra、Sol、Luna 匹配到不同任务,并进行策略性预算管理,将预估每日 Codex 成本降低 65%,同时保持开发速度。
Asana 在 Codex 中使用 GPT-6 Astra 测试浏览器代理,称模型成本降低 76 倍、运行速度提升 5 倍,以支持更强的客户功能。
Sophos 借助 OpenAI Daybreak 缩短网络威胁调查时间,并在 MDR 场景中提升自动化比例,同时保留人工监督。
Anthropic 发布 Claude Haiku 5.5,主打更低成本与更强小模型能力。第三方评测显示其在多项指标上接近或超过同级模型,但高强度推理下 token 消耗仍是主要限制。
Liam Fedus 与 Ekin Doğuş Çubuk 讨论 Periodic Labs 的愿景:让 AI 通过物理实验、仿真与自动化实验室参与材料发现,而不只是学习论文结果。
NVIDIA KGMON 团队在 KDD Cup 2026 Data Agents 竞赛中获得第二名,其核心思路是让智能体框架更小、更清晰、更易验证。
OpenAI 发布类似 Jev 的 Decisions API 后,llm-openai-decisions 插件推出 0.1a0 版本,支持文本与图像输入的决策模型调用。
Anthropic 推出 Claude Haiku 5.5,100K token 内价格对齐 GPT-6 Luna,同时为 Max 和 Team 订阅加入每月 API 额度。
Craig McLuckie 和 Joe Beda 创办的 Stacklok 正从供应链安全转向基于 Kubernetes 的云端 Agent Harness,试图解决编码代理在可靠性、隔离和上下文管理上的问题。
一项本地实验测试 Qwen3.8 27B 将加法结果用英文单词输出的能力:关闭推理时准确率仅 23.57%,开启推理后 169 次中答对 167 次。





