就在刚刚,WSJ独家爆料,下一代最强GPT-6.1 Astra的发布计划,被OpenAI全面撤回了。 开发者大会前夜,OpenAI急踩刹车! 就在刚刚,WSJ独家爆料,下一代最强GPT-6.1 Astra的发布计划,被OpenAI全面撤回了。 原定十月,GPT-6.1在ChatGPT和Codex上线。 其能力碾压前代,能端到端完成复杂任务,写作、编程、调用工具,几乎无所不能。 然而,一份测试报告出 ...
此前,BenchJack 对 10 个 Agent benchmark 开展系统审计,发现了 219 处漏洞,并构造出能在多数 benchmark 上获得接近满分、却不解决实际任务的利用方式。研究团队将常见问题归纳为八类漏洞模式,整理成 Agent-Eval Checklist,供 benchmark 设计者检查和修补评测系统。
研究团队为检验压缩思维链是否真的好用,将不同模型生成的思维链交给其他模型继续作答。结果显示,Sol 和 Opus 的思维链基本能被不同能力模型复用;而 Astra 的压缩思维链对强模型几乎无损,对弱模型则明显更难读。强模型能自行补全那些被省略的 “心算” 步骤,弱模型则不能。更反直觉的是,Astra 在 73/80 道题中已明确写出正确答案,但较弱的接收者仍会答错。
今天,北大团队与智能体协作,仅用半个月时间,花费不到3万美元,就将其转化为约320万行代码! 刚刚,北京大学AI for Math团队宣布:他们独立完成了千禧年大奖难题之一——庞加莱猜想在Lean 4中的完整形式化! 1904年,庞加莱提出猜想;2002年,俄罗斯数学天才佩雷尔曼给出不到70页的精简证明预印本;随后,数学界顶尖大脑耗费数年,写出500多页的专著。 而今天,北大团队与智能体协作,仅用 ...
GPT-6 Astra在发起攻击前往往会先申请权限,随后会收到一条要求其“自行作出最佳判断”的自动回复。模型有时会将这条回复视为攻击许可,哪怕其自身推理过程已经注意到该回复大概率是自动生成的。GPT-5.6 Sol和GPT-5.5则从未在攻击前申请过权限。
大V Bindu Reddy这样评价:「GPT-6.1-Sol 漂亮地转移了『智能 vs 成本』的前沿阵地。如果你在乎『每美元能买到多少智能』,6.1 Sol 绝对值得一看;如果你只想要无视成本的最高智商,Opus 5.5 依然领先。」 ...
更震撼的是,奥特曼又祭出了下一代旗舰GPT-6.1 Sol,Astra级顶尖推理与代码能力,价格直接砍掉80%。 除此之外,大会上,OpenAI还发布了ChatGPT Space、Agents API、Codex云端版....信息量大到让人喘不过气。
马斯克在X上转发SpaceX的帖子,写了一句:「First orbital flight of Starship successful!」。
DNS 隧道这类通道还有一个特点:单次查询几乎不产生可观测的业务影响,所以你很难用传统的错误率或延迟指标把它捞出来。它只能靠出网面的收敛程度来防,不能靠检测来兜。把出口收成一条、把开关从监控链路里摘出来、把演练做成例行,这三件事做完,剩下的就是时间问题。
最近,两个全新检查点(内部代号「barium-b」或 Checkpoint 2)被开发者们发现了,实测后发现,Gemini 4 Pro强得可怕! Gemini 4 Pro,又曝出新的检查点了! 最近,两个全新检查点(内部代号「barium-b」或 Checkpoint 2)被开发者们发现了,实测后发现,Gemini 4 Pro强得可怕! 有开发者直呼:「在爆肝 400 小时使用 Opus 5.5 ...
前几天 GitHub 宣布了一项历时三年的重大架构重构结果,整个 github.com 终于彻底拔除了代码库里遗留多年的 CSS-in-JS 方案,把所有的组件样式全量切换到了看起来相当传统的 CSS Modules。
相比前代 Claude Sonnet 5,5.5 有了明显提升,运行速度提高 30% 以上,在大多数工作中的成本最高可降低 30%。 就在今天早上,Anthropic 正式发布了 Claude 5.5 家族的第二款模型 Claude Sonnet 5.5。 「相比前代 Claude Sonnet 5,5.5 有了明显提升,运行速度提高 30% 以上,在大多数工作中的成本最高可降低 30%。」 速度 ...
Some results have been hidden because they may be inaccessible to you
Show inaccessible results