LegalOn 通过将 Astra、Sol、Luna 匹配到不同任务,并进行策略性预算管理,将预估每日 Codex 成本降低 65%,同时保持开发速度。
Asana 在 Codex 中使用 GPT-6 Astra 测试浏览器代理,称模型成本降低 76 倍、运行速度提升 5 倍,以支持更强的客户功能。
Sophos 借助 OpenAI Daybreak 缩短网络威胁调查时间,并在 MDR 场景中提升自动化比例,同时保留人工监督。
Anthropic 发布 Claude Haiku 5.5,主打更低成本与更强小模型能力。第三方评测显示其在多项指标上接近或超过同级模型,但高强度推理下 token 消耗仍是主要限制。
Liam Fedus 与 Ekin Doğuş Çubuk 讨论 Periodic Labs 的愿景:让 AI 通过物理实验、仿真与自动化实验室参与材料发现,而不只是学习论文结果。
OpenAI 发布类似 Jev 的 Decisions API 后,llm-openai-decisions 插件推出 0.1a0 版本,支持文本与图像输入的决策模型调用。
Anthropic 推出 Claude Haiku 5.5,100K token 内价格对齐 GPT-6 Luna,同时为 Max 和 Team 订阅加入每月 API 额度。
Craig McLuckie 和 Joe Beda 创办的 Stacklok 正从供应链安全转向基于 Kubernetes 的云端 Agent Harness,试图解决编码代理在可靠性、隔离和上下文管理上的问题。
一项本地实验测试 Qwen3.8 27B 将加法结果用英文单词输出的能力:关闭推理时准确率仅 23.57%,开启推理后 169 次中答对 167 次。
一次让 Claude Opus 5.5 设计文本乐谱格式、生成曲目并制作浏览器播放器的实验,结果意外接近复古冒险游戏配乐。
Datasette 1.0a41 已支持 OpenTelemetry,可将追踪数据发送到 Parseable,并在本地 Web 界面中查看请求和数据库查询的 span 瀑布图。
Mistral 发布 Large 4 预览版,模型规模达 1 万亿参数、490 亿激活参数,并计划在本月底开放权重。


