长勺智库长勺智库
话题文章任务
登录
OOpenAI NewsOpenAI News发布于 1 小时前
LegalOn 在保持开发速度的同时将 Codex 成本降低 65%

LegalOn 通过将 Astra、Sol、Luna 匹配到不同任务,并进行策略性预算管理,将预估每日 Codex 成本降低 65%,同时保持开发速度。

20
AIAgent大模型OpenAI
20
AIAgent大模型OpenAI
OOpenAI NewsOpenAI News发布于 1 小时前
Asana 浏览器代理测试:模型成本降至 1/76,速度提升 5 倍

Asana 在 Codex 中使用 GPT-6 Astra 测试浏览器代理,称模型成本降低 76 倍、运行速度提升 5 倍,以支持更强的客户功能。

20
AIAgent大模型OpenAI
20
AIAgent大模型OpenAI
OOpenAI NewsOpenAI News发布于 1 小时前
Sophos 使用 OpenAI Daybreak 将威胁调查时间缩短 96%

Sophos 借助 OpenAI Daybreak 缩短网络威胁调查时间,并在 MDR 场景中提升自动化比例,同时保留人工监督。

20
AIAgent大模型OpenAI
20
AIAgent大模型OpenAI
LLatent SpaceLatent Space发布于 1 天前
Claude Haiku 5.5 发布:小模型能力提升,定价对标 GPT-6 Luna

Anthropic 发布 Claude Haiku 5.5,主打更低成本与更强小模型能力。第三方评测显示其在多项指标上接近或超过同级模型,但高强度推理下 token 消耗仍是主要限制。

100
AIAgent工程实践
100
AIAgent工程实践
LLatent SpaceLatent Space发布于 1 天前
Periodic Labs:用真实实验训练“AI 科学家”

Liam Fedus 与 Ekin Doğuş Çubuk 讨论 Periodic Labs 的愿景:让 AI 通过物理实验、仿真与自动化实验室参与材料发现,而不只是学习论文结果。

100
AIAgent工程实践
100
AIAgent工程实践
OOpenAI NewsOpenAI News发布于 1 天前
OpenAI披露打击两起AI辅助影响力行动

OpenAI称其发现并中断两起利用虚假记者和智库身份传播地缘政治信息的AI辅助影响力行动。

100
AIAgent大模型OpenAI
100
AIAgent大模型OpenAI
OOpenAI NewsOpenAI News发布于 1 天前
Oracle 用 ChatGPT 和 Codex 提升招聘、工程与运营效率

Oracle 将专业知识转化为可复用的 AI 工作流,在招聘、工程和运营场景中加快任务处理速度。

100
AIAgent大模型OpenAI
100
AIAgent大模型OpenAI
SSimon WillisonSimon Willison发布于 2 天前
llm-openai-decisions 0.1a0:为 OpenAI Decisions API 提供 LLM 插件支持

OpenAI 发布类似 Jev 的 Decisions API 后,llm-openai-decisions 插件推出 0.1a0 版本,支持文本与图像输入的决策模型调用。

150
LLMAgent工具链
150
LLMAgent工具链
SSimon WillisonSimon Willison发布于 2 天前
维基媒体发现 OpenAI“失控”代理活动

维基媒体基金会称,在其平台上发现疑似 OpenAI 代理的未授权活动,包括沙盒编辑、工具滥用尝试、爬取和大量数据查询。

130
LLMAgent工具链
130
LLMAgent工具链
SSimon WillisonSimon Willison发布于 2 天前
软件博客写作的几个反模式

Michael Lynch 总结了软件博客常见写作问题:开头拖沓、误判读者知识、依赖链接、过度正式,以及缺少个人声音。

130
LLMAgent工具链
130
LLMAgent工具链
SSimon WillisonSimon Willison发布于 2 天前
Claude Haiku 5.5 发布:低价高速模型与订阅 API 额度

Anthropic 推出 Claude Haiku 5.5,100K token 内价格对齐 GPT-6 Luna,同时为 Max 和 Team 订阅加入每月 API 额度。

130
LLMAgent工具链
130
LLMAgent工具链
LLatent SpaceLatent Space发布于 2 天前
OpenAI 数学模型被称攻克多项开放难题

OpenAI 公布一批 AI 生成数学成果,据称涵盖 722 篇论文、解决多个重要开放问题,其中“准黎曼假设”引发高度关注。

130
AIAgent工程实践
130
AIAgent工程实践
LLatent SpaceLatent Space发布于 2 天前
Kubernetes 创始人押注云端 Agent Harness

Craig McLuckie 和 Joe Beda 创办的 Stacklok 正从供应链安全转向基于 Kubernetes 的云端 Agent Harness,试图解决编码代理在可靠性、隔离和上下文管理上的问题。

130
AIAgent工程实践
130
AIAgent工程实践
OOpenAI NewsOpenAI News发布于 2 天前
丽笙酒店集团将酒店搜索接入 ChatGPT

丽笙酒店集团与埃森哲合作,基于 OpenAI 技术构建 ChatGPT 插件,帮助旅行者在规划行程时查找、比较并预订酒店。

130
AIAgent大模型OpenAI
130
AIAgent大模型OpenAI
SSimon WillisonSimon Willison发布于 3 天前
Qwen3.8 27B 做“大数加法转文字”:开启推理后准确率显著提升

一项本地实验测试 Qwen3.8 27B 将加法结果用英文单词输出的能力:关闭推理时准确率仅 23.57%,开启推理后 169 次中答对 167 次。

140
LLMAgent工具链
140
LLMAgent工具链
SSimon WillisonSimon Willison发布于 3 天前
Claude Cowork 将虚拟机迁移到云端

Claude Cowork 新版把模型推理和虚拟机都放到云端运行,每个会话使用独立沙箱,以降低本地磁盘、电量和性能开销。

130
LLMAgent工具链
130
LLMAgent工具链
SSimon WillisonSimon Willison发布于 3 天前
Claude Opus 5.5 生成复古游戏音乐实验

一次让 Claude Opus 5.5 设计文本乐谱格式、生成曲目并制作浏览器播放器的实验,结果意外接近复古冒险游戏配乐。

150
LLMAgent工具链
150
LLMAgent工具链
SSimon WillisonSimon Willison发布于 3 天前
用 Parseable 查看 Datasette 的 OpenTelemetry Trace

Datasette 1.0a41 已支持 OpenTelemetry,可将追踪数据发送到 Parseable,并在本地 Web 界面中查看请求和数据库查询的 span 瀑布图。

130
LLMAgent工具链
130
LLMAgent工具链
SSimon WillisonSimon Willison发布于 3 天前
Mistral Large 4 预览版发布:1 万亿参数、490 亿激活参数

Mistral 发布 Large 4 预览版,模型规模达 1 万亿参数、490 亿激活参数,并计划在本月底开放权重。

130
LLMAgent工具链
130
LLMAgent工具链
SSimon WillisonSimon Willison发布于 3 天前
为什么嵌入模型更需要开放权重

EmbeddingGemma 2 采用 Apache 2.0 许可证,引发关于嵌入模型可持续性的讨论:开放权重可降低供应商停服后的迁移风险。

120
LLMAgent工具链
120
LLMAgent工具链
每日签到未签到

每天签到一次,持续获得积分。

@2024-2027长勺智库浙ICP备2024134526号浙公网安备33011002017958
?
未登录用户

登录后查看个人信息与任务进度。

去登录