💡 今日趋势速览:OpenAI开源Codex背后的Agent Harness,官方强调harness设计直接影响模型表现;腾讯元宝App灰测专家级旗舰模型混元Hy4,多模态能力将升级;GPT Image新检查点luna-lisa-alpha曝光,图像输出更干净。厂商竞相迭代智能体框架与多模态模型,竞争加速。
🎯 今日要点
📋 今日内容汇总
🤖 AI动态
- OpenAI 开源 Codex 背后的 Agent Harness
- GPT Image 新检查点 luna-lisa-alpha 曝光
- 腾讯元宝 App 灰测新旗舰模型混元 Hy4
- OpenAI 预览 Private Safety Processing 安全服务
- 阿里推出 GUI 智能体基座模型 Qwen-UI-Agent
- Claude Code 新增 Concise 输出风格
- Unsloth Desktop 新版上线:支持自动压缩
- Hugging Face 发布 LFM2.5 系列 DSpark 草稿模型
- MiniMax 发布多模态创作 Agent MiniMax Design
- 隐形前沿模型 Ox Alpha 上线:百万 token 上下文
- Cursor 上线 /goal:给 Agent 一个长期目标
- 商汤开源 8B 统一多模态模型 SenseNova U1.5 Lite
- Slack 推出 Slack Code,频道内直接协作编程智能体
- 豆包视频通话升级,可同时处理音视频文本三路输入
🦾 机器人具身智能
📦 开源项目
📌 模型排行榜
🤖 AI动态
OpenAI开源Agent Harness,Codex App、CLI与IDE扩展背后运行该框架,官方强调harness设计直接影响模型表现,ARC-AGI-3上GPT-5.6 Sol加入retained reasoning后分数从13.3%涨至38.3%集成方式分三种:codex exec适合脚本、CI Job等非交互任务


🔗 https://x.com/linxiaobei888/status/2090240944536994014
LMArena 上出现代号 luna-lisa-alpha 的 GPT Image 新检查点,被多个追踪者独立发现,属预发布版本且不可选用,来源实验室未知。早期输出显示图像更干净,颗粒噪点基本消失,角色一致性与文本渲染提升,知识截止时间较前代 mona-lisa-1 更新。

🔗 https://x.com/Adidotdev/status/2090405864335462895
腾讯元宝App模型列表中出现混元Hy4,标注为专家级模型,排在Hy3与DeepSeek上方。腾讯上周在Q2财报确认Hy4即将上线,提升性能与多模态能力;目前尚未正式发布,或为小范围灰测。


🔗 https://x.com/MaxForAI/status/2090386754633421110
OpenAI推出Private Safety Processing服务,面向符合条件的企业与API客户,使用前沿模型时保持零数据保留:系统跨多轮对话检查潜在滥用,OpenAI员工无法查看客户的提示词或模型响应。Sam Altman在推文中表示支持商业隐私,OpenAI为前沿模型提供零数据保留服务


🔗 https://x.com/0xLogicrw/status/2090282580625314202
阿里巴巴发布Qwen-UI-Agent,能直接操作手机、电脑、网页,遇命令行任务可运行CLI。阿里做GUI Agent已两年多,2024年Mobile-Agent靠截图控制点击Qwen-UI-Agent覆盖移动端、桌面端、浏览器、DeepSearch及CLIQwen-UI-Agent在MobileWorld-Real等评测中获92.2%成绩



🔗 https://x.com/0xLogicrw/status/2090387625979031686
新版输出风格 Concise 已上线 Claude Code:先直接给出结果、保持回复简短,被追问时仍会提供完整细节。用户可以在 /config 设置菜单的 Output style 选项中开启。

🔗 https://x.com/ClaudeDevs/status/2090245922685063634
Unsloth Desktop 发布新版本:带来面向所有模型的实验性自动压缩(结合 RAG、强制首轮 RAG 与尾部保留策略)、局域网和远程访问选项卡以及更流畅的聊天体验,本版还合并了 200 多个 PR。

🔗 https://x.com/danielhanchen/status/2090499172118241668
DSpark 草稿模型通过投机解码在不改变输出质量的前提下加速推理,GPU 吞吐最高提升 3.18 倍,端侧最高 2.87 倍;草稿模型约 300M 参数,LFM2.5-2.6B 的函数调用延迟平均降低 57%,已开源并支持 llama.cpp 与 SGLang以下是官方给出的 demo


🔗 https://huggingface.co/blog/LiquidAI/lfm25-dspark
它能自主拆解任务、写脚本、做分镜,生成图片和视频后完成剪辑、配音与字幕,直接交付成片。MiniMax 把视频模型 H3 深度整合进 Agent 与 Skills,按任务判断素材取舍并整理成适合 H3 执行的输入,复杂镜头还可先用 3D 导演台编排以下是官方给出的 demo

🔗 https://mp.weixin.qq.com/s?__biz=MzE5MTA3NzcxMQ==&mid=2247489087&idx=1&sn=2691288eb8cddac6c2e86483ccff7eb5
一款未公开厂商的隐形模型 Ox Alpha 发布,定位高效编程、持续性智能体工作与真实生产环境,提供 100 万 token 上下文窗口,输入支持 Text、image 与 video 三类模态,官方邀请用户试用并反馈。

🔗 https://x.com/OpenRouter/status/2090544970923184269
Cursor刚刚推出/goal功能,给智能体设定长期目标后可持续工作直至真正完成,示例为打造超越《使命召唤》的AAA级FPS游戏。/goal还能搭配/loop进行定期检查,再结合Custom Mode制定执行手册。


🔗 https://x.com/minchoi/status/2090233324727832638
SenseNova U1.5 Lite参数量仅80亿,是轻量级原生统一多模态模型,支持视觉理解、生成与编辑。SenseNova系列在图像生成与编辑的多个基准测试中表现领先。它支持原生4K生成与复杂指令遵循,可按主体、数量、文本、布局和风格控制输出,目前代码已开源



🔗 https://x.com/SenseTime_AI/status/2090483079412580442
面向编程智能体的 Code channels 现已上线,这套功能被命名为 Slack Code,首批合作方包括 Anthropic、GitHub、Cognition 和 Vercel。用户可以在频道中直接与 Coding Agent 协作干活,这类智能体自 2024 年 Devin 起已能从 Slack 接收任务

🔗 https://x.com/Benioff/status/2090240159115853956
升级后的豆包视频通话能在连续变化的真实场景中自然连续交互,底层由火山引擎多模态传输系统提供技术支撑。看到路牌会提醒方向,也不被旁人对话带偏。用户能边看边听边说,AI同时接收音频、视频、文本三路输入,不必等它说完才开口。


🔗 https://mp.weixin.qq.com/s?__biz=MzI1MzYzMjE0MQ==&mid=2247521377&idx=1&sn=3d2f9e30616aa074c8d574c568903ba8
🦾 机器人具身智能
AGIBOT 摘下面具正式发布新一代全尺寸人形机器人 A3,官方演示强调其动作强劲、反应迅捷且精准毫厘不差,并让一位深谙如何逼近极限的大师担任陪练,以一场挑战赛展示 A3 的全身控制实力以下是官方给出的 demo

🔗 https://x.com/AGIBOTofficial/status/2090438452990857376
📦 开源项目
Anthropic已宣布8月2日之后新发布的Claude模型会在生成文本中嵌入肉眼不可见的水印标识,最初是为应对欧盟相关要求,其他AI厂商也有类似做法。如今有项目实现对这层水印的破解,在GitHub上收获超过15000个Star


🔗 https://mp.weixin.qq.com/s?__biz=MzAxOTcxNTIwNQ==&mid=2457995251&idx=1&sn=1d8e787f39931afc3cb37af299c2c20a
📌 模型排行榜
最后是今日的 AI 模型能力排行榜单,智力榜上,Claude Opus 5 (max) 以63分居首,Claude Fable 5 与 GPT-5.6 Sol、Grok 4.6 紧随其后。


🔗 https://artificialanalysis.ai/?intelligence=artificial-analysis-intelligence-index#intelligence-tabs
以上是今天的AI 风向标,欢迎在评论区提出建议,我们明天见。


被折叠的 条评论
为什么被折叠?



