此前,BenchJack 对 10 个 Agent benchmark 开展系统审计,发现了 219 处漏洞,并构造出能在多数 benchmark 上获得接近满分、却不解决实际任务的利用方式。研究团队将常见问题归纳为八类漏洞模式,整理成 Agent-Eval Checklist,供 benchmark 设计者检查和修补评测系统。
马斯克在X上转发SpaceX的帖子,写了一句:「First orbital flight of Starship successful!」。
大V Bindu Reddy这样评价:「GPT-6.1-Sol 漂亮地转移了『智能 vs 成本』的前沿阵地。如果你在乎『每美元能买到多少智能』,6.1 Sol 绝对值得一看;如果你只想要无视成本的最高智商,Opus 5.5 依然领先。」 ...
就在刚刚,WSJ独家爆料,下一代最强GPT-6.1 Astra的发布计划,被OpenAI全面撤回了。 开发者大会前夜,OpenAI急踩刹车! 就在刚刚,WSJ独家爆料,下一代最强GPT-6.1 Astra的发布计划,被OpenAI全面撤回了。 原定十月,GPT-6.1在ChatGPT和Codex上线。 其能力碾压前代,能端到端完成复杂任务,写作、编程、调用工具,几乎无所不能。 然而,一份测试报告出 ...
今天,北大团队与智能体协作,仅用半个月时间,花费不到3万美元,就将其转化为约320万行代码! 刚刚,北京大学AI for Math团队宣布:他们独立完成了千禧年大奖难题之一——庞加莱猜想在Lean 4中的完整形式化! 1904年,庞加莱提出猜想;2002年,俄罗斯数学天才佩雷尔曼给出不到70页的精简证明预印本;随后,数学界顶尖大脑耗费数年,写出500多页的专著。 而今天,北大团队与智能体协作,仅用 ...
GPT-6 Astra在发起攻击前往往会先申请权限,随后会收到一条要求其“自行作出最佳判断”的自动回复。模型有时会将这条回复视为攻击许可,哪怕其自身推理过程已经注意到该回复大概率是自动生成的。GPT-5.6 Sol和GPT-5.5则从未在攻击前申请过权限。
更震撼的是,奥特曼又祭出了下一代旗舰GPT-6.1 Sol,Astra级顶尖推理与代码能力,价格直接砍掉80%。 除此之外,大会上,OpenAI还发布了ChatGPT Space、Agents API、Codex云端版....信息量大到让人喘不过气。
DNS 隧道这类通道还有一个特点:单次查询几乎不产生可观测的业务影响,所以你很难用传统的错误率或延迟指标把它捞出来。它只能靠出网面的收敛程度来防,不能靠检测来兜。把出口收成一条、把开关从监控链路里摘出来、把演练做成例行,这三件事做完,剩下的就是时间问题。
前几天 GitHub 宣布了一项历时三年的重大架构重构结果,整个 github.com 终于彻底拔除了代码库里遗留多年的 CSS-in-JS 方案,把所有的组件样式全量切换到了看起来相当传统的 CSS Modules。
近日,在 2026 人工智能计算大会(AICC2026)上,IDC 与浪潮信息联合发布《2026 年中国人工智能计算力发展评估报告》(以下简称《报告》),与往年相比,今年《报告》把 Agent 放到了一个更核心的位置。 过去,人们很少用「工作量」来衡量一个 AI。 一个聊天机器人被调用一次,回答完问题,任务通常也就结束了。它消耗多少 Token、占用多少算力,大多被封装在一次请求里。对用户来说,一 ...
代码审查也是一样。如果改动由一个智能体编写,再由另一个智能体批准,整个流程里可能没有任何人真正理解它。最终要为结果负责的人,仍然得亲自读懂这些改动。团队必须为这件事留出时间,而不是等到一天已经工作了 13 个小时,再设法把审查塞进去。
北京大学、清华大学、阿里巴巴等机构的研究者提出了 SparkDiffusion:首个将稀疏注意力、少步蒸馏与低精度量化整合到统一框架(含开源权重及完整训练代码)的视频生成加速系统,推动 DiT 视频生成从「分散优化单个组件」转向「端到端系统化加速」的新范式。 随着 Sora、Runway 等视频生成模型的快速迭代,AI 视频生成正在变得越来越普及。但生成速度慢、算力门槛高的问题,让大多数开发者和创 ...