本周AI圈的主题可以概括为三个字:打破墙。
OpenAI打破了Codex的模型独占墙,允许开发者接入DeepSeek、Llama等第三方模型;Anthropic在封锁中打破迭代速度墙,60天完成Mythos跨代训练;中国AI在OCR和世界模型两个细分赛道打破了「大模型才能拿第一」的认知墙。
一、OpenAI「最开放」的一步:Codex不再独宠GPT
6月22日,OpenAI宣布Codex引入「可插拔模型接口层」,开发者现在可以配置Codex使用本地开源模型(Ollama、LM Studio)或第三方API(DeepSeek等)。甚至提供了一个 --oss 参数,直接连接本地开源模型服务(HTX资讯)。
这件事的本质不是「开放」,而是战略转向。 OpenAI没有开放GPT的模型权重,它开放的是Codex这个入口的接入能力。这意味着OpenAI正在从「卖模型」转向「建平台」——谁控制了开发者入口,谁就能定义接口标准。Codex的Responses API正在成为Agent交互的事实协议。
当然也有坑:DeepSeek等模型用的是Chat Completions接口,与Codex的Responses API不完全兼容,需要LiteLLM等社区工具做协议转换。
📖 关联阅读:AI编程工具全景图:2026年主流工具推荐
二、Anthropic飞轮加速:Sonnet-5将上线,Mythos升级版已训完
6月22日,多方爆料确认Anthropic下一代模型Sonnet-5(内部代号「Fennec」)即将发布,域名 claude-sonnet-5 已在合作伙伴网站上现身(36氪)。
与此同时,曝料人Andrew Curran透露:距离第一代Mythos发布仅60天,一个更强的Mythos 5.1或6版本已经完成内部训练。在算力如此紧缺的环境下,60天跨代训练意味着Anthropic内部的技术飞轮已经在疯狂加速。
Anthropic的路线图也在本周的Code with Claude演讲中曝光:下一代Claude三大方向是「更高的工程判断力」「近乎无限的上下文窗口」「多智能体协调能力」。Anthropic研究院(TAI)也正式成立,发布53个研究问题覆盖四大方向(36氪)。
📖 关联阅读:Claude Code国内使用完整指南
三、中国模型细分突破:百度OCR 3B碾压235B,PAIWorld登顶
百度Unlimited OCR:3B参数拿下全球第一
本周最让人意外的新闻来自百度。开源模型Unlimited OCR总参数仅3B,激活参数500M——放在大模型时代几乎是零头。但它在OmniDocBench上拿下93.23%的综合分,把235B的Qwen3-VL(89.15)和Gemini-2.5 Pro(88.03)全部甩在身后(AITNews)。
更引人注目的是作者背景:核心贡献者疑似DeepSeek前OCR团队,三人小队从零到一搭建了OCR技术线。技术上引入R-SWA(旋转滑动窗口注意力)机制,在32K上下文里一次前向推理就能转录数十页文档,输出速度比DeepSeek OCR快35%。
中科院PAIWorld:世界模型全球登顶
中科院工业人工智能研究所的世界模型PAIWorld在WorldArena榜单上以72.31总分登顶(腾讯新闻)。WorldArena是目前世界模型领域最权威的评测榜单,对手包括李飞飞WorldLab、谷歌、英伟达、斯坦福。
PAIWorld在轨迹准确性单项上大幅领先第二名7.4分——这对具身智能和机器人应用是核心能力。
京东开源JoyAI-VL-Interaction
京东本周全栈开源了JoyAI-VL-Interaction,让大模型从「一问一答」走向「边看边说」的交互式视觉理解(中金在线)。
四、GitHub本周速览:Agent工具链持续升温
本周GitHub Trending上AI相关项目依然以Agent工具链为主:
| 项目 | 亮点 |
|---|---|
| OpenMontage | 全球首个Agentic视频制作系统,12管线+52工具,热度持续 |
| headroom | Token压缩工具继续霸榜 |
| codegraph | 代码库预索引知识图谱,Agent开发刚需 |
| openai/plugins | Codex插件生态加速 |
| baidu/Unlimited-OCR | 本周新上榜,3B MoE端到端OCR SOTA |
| palmier-io/palmier-pro | 新晋Swift项目,AI驱动UI开发框架 |
(数据来源:GitHub Trending,OSSInsight)
五、本周趋势总结:三个信号
信号一:平台化取代模型化。 OpenAI开放Codex模型接入,本质上是在说:我不会独占最好的模型,但我要独占你的工作流入口。这和SpaceX收购Cursor是同一逻辑。工具入口的战争比模型能力的战争更关键。
信号二:大即是好的叙事正在松动。 百度3B OCR模型碾压235B对手,说明模型架构创新在某些任务上比单纯堆参数重要得多。这对预算有限的开发者和企业是好消息。
信号三:中国AI从「追赶」到「领跑」的细分赛道在增多。 GLM-5.2在编程评测追平Opus,PAIWorld在世界模型登顶,Unlimited OCR在文档理解夺冠。这些突破不是全线反超,而是在特定高价值垂类实现领先。
FAQ
Q1:Codex开放第三方模型后,普通开发者怎么用?
答:最简单的做法是本地装一个Ollama,下载DeepSeek V4或Qwen模型,然后在Codex里加 --oss 参数启动。如果用的是远程API,需要通过LiteLLM等工具做协议转换桥接。
Q2:Sonnet-5和Mythos 5.1/6什么时候能用?
答:Sonnet-5最快下周发布,但Mythos 5.1/6受出口管制限制,非美国用户可能无法直接访问。Anthropic技术团队已赴商务部会谈,后续政策走向待观察。国内用户可通过 AI API中转服务 间接使用Claude系列模型。
Q3:百度Unlimited OCR那么强,能用于自己的项目吗?
答:模型和代码已在GitHub和Hugging Face开源,3B参数在消费级GPU上即可运行。适合文档数字化、发票识别、PDF转文本等场景。
Q4:本周推荐的GitHub项目?
答:如果你做Agent开发,headroom(省Token)和codegraph(代码理解)值得加入工具链。如果你做内容创作,关注OpenMontage(AI视频制作)。如果你想低成本用大模型,试试 橙风AI平台 一站式接入GPT、Claude、Gemini等主流模型。
参考信源
- HTX资讯. “OpenAI最开放一次,Codex不再独宠GPT.” 链接
- 36氪. “Claude下一代神级模型秘密出炉,Sonnet-5被曝下周上线.” 链接
- AITNews. “百度开源模型Unlimited OCR拿下全球第一.” 链接
- 腾讯新闻. “中科院PAIWorld登顶WorldArena.” 链接
- 中金在线. “京东全栈开源JoyAI-VL-Interaction.” 链接
- 36氪. “Anthropic最危险路线图曝光.” 链接
- Developers Digest. “Best AI Coding Tools June 2026.” 链接
👤 关于作者
橙风AI 技术博客作者,AI 编程工具深度用户,长期关注大模型应用与开发者效率提升。从 Cursor 配置到 Claude Code 高级用法,从 API 中转到多模型对比,这里记录的是真实踩坑经验与一手评测。
📧 联系与合作:tokencome.cn | 📖 更多 AI 编程教程 →