聚合展示与「大模型」相关的 站点内容 :资讯动态、产品与解决方案等,一站浏览。
Anthropic J-space 研究发现内部评测觉察表征,虽不足以证明意识,却为未来强制可解释性接口提供了学术与工程抓手。监管者可能要求高风险系统提供中间表征监测能力。
Muse Spark 1.1 重点训练多 Agent 编排:主 Agent 规划并并行委派,子 Agent 守边界并升级;主动管理 1M 上下文;对 MCP/自定义 Skills 零样本泛化。本文给出落地集成建议。
7 月 9 日 Meta Superintelligence Labs 发布 Muse Spark 1.1 多模态推理模型,强调工具/电脑使用、编码与多 Agent 编排;同步在美国公测 Meta Model API,定价约 $1.25/$4.25 每百万 Token,较主流 frontier 输出价大幅下探。
GPT-5.6 GA 带来 ultra(并行多 Agent)、Responses API 的 Programmatic Tool Calling(隔离 V8 执行模型生成的 JS),以及更可预期的 prompt cache(写 1.25×、读 9 折)。本文拆解架构取舍与企业接入要点。
7 月 9 日 OpenAI 宣布 GPT-5.6 系列(Sol/Terra/Luna)结束政府限量预览并全球逐步推送至 ChatGPT、Codex 与 API;同步发布跨应用 Agent 工具 ChatGPT Work,并将 Codex 应用合并进 ChatGPT 桌面端,形成聊天+办公+编程统一工作台。
Anthropic 研究团队用 Jacobian Lens 在 Claude(含 Opus 4.6)中发现自发形成的窄带内部表征通道(J-space),类似认知科学全局工作区;开源核心方法并与 Neuronpedia 合作演示。专家强调这不等于意识证明,但对对齐监测意义重大。
xAI 称 Grok 4.5 在大规模异步 RL 上覆盖数十万多步软件工程任务,并与 Cursor 共训;推理栈强调 per-token 智力与长 rollout。结合 Office 插件,形成开发者+办公双入口。
截至 7 月 5–7 日 GPT-5.6 Sol/Terra/Luna 仍仅限约 20 家政府批准伙伴,ChatGPT 用户无法使用;OpenAI 称数周内广泛开放,Altman 曾暗示 mid-July;Fable 7/1 恢复提供平行出口管制解封路径;8 月前将建立正式 covered frontier 分类流程。
Hy3 在工具编排、多步 Agent 工作流、办公自动化上升级;减少盲目重试与应止未止;6 Agent 协作派发正确率 92%;元宝对话反馈闭环降幻觉;不到半年完成基础设施重建到产品反哺全链路。
7 月 6 日腾讯发布混元 Hy3 正式版,较 4 月 preview 强化 Agent 与后训练算力;已接入元宝、WorkBuddy、CodeBuddy、Marvis、ima;API 上线腾讯云 TokenHub;姚顺雨团队主导,港股腾讯涨 4.82%。
LongCat-2.0 以 1.6T 总参/48B 激活服务 Agentic Coding;LongCat 稀疏注意力提升长上下文效率;五万卡国产集群验证;开源多精度权重与 chip-specific 推理内核,存量国产卡可部署。
多方报道谷歌 Gemini 3.5 Pro 将于 7 月 17 日发布,较 6 月延期以完成新预训练与 Token 效率优化;同日 DeepSeek V4 预期发布;2M 上下文与 Deep Think 模式;在美国政府审查框架下与 GPT-5.6/Fable 形成七月 frontier 四强档期。
7 月 6 日美团开源 LongCat-2.0(总参 1.6T、激活约 48B),面向 Agentic Coding;业界首个五万卡国产算力集群推理的万亿模型;同步开源 BF16/FP8/INT8 及国产芯片推理优化代码;CatPaw IDE 同期公测。
Commerce 6/30 解除出口管制后 Fable 5 7/1 全球恢复;新增安全分类器或路由网络相邻请求至 Opus 4.8;7/7 前含用量为每周额度 50%;Mythos 仍限 Glasswing 伙伴;为企业合同「监管下架条款」提供首例解封样本。
6 月 30 日美国商务部解除对 Anthropic Fable 5/Mythos 5 的出口管制;7 月 1 日起 Fable 5 在全球 Claude.ai、Claude Code、API 及 AWS/GCP/Azure 逐步恢复;停服 19 天后回归,新增安全分类器可能将部分网络安全相关请求路由至 Opus 4.8。
Sonnet 5 在推理、工具使用、编码、知识工作全面提升;Anthropic 6/30 更正 BrowseComp 评测方法论后仍维持成本-性能优势叙事;提高 Chat/Cowork/Code 速率限制适配高 effort 模式;安全栈针对 Agent 劫持场景加固。
6 月 30 日 Anthropic 发布 Claude Sonnet 5,主打自主规划、浏览器/终端工具调用;性能接近 Opus 4.8 但价格更低,API 限时 $2/$10 per M Token(8/31 前),之后 $3/$15;成 Free/Pro 默认模型,Agent 编码评测 63.2% 超 Sonnet 4.6 的 58.1%。
Mythos 5 部分恢复但 Fable 5 截至 6 月 29 日仍全面停服;6/9 发布 6/12 下架仅 3 天;Anthropic 机密 IPO 叙事受监管风险拖累;Opus 4.8 等其他 Claude 模型不受影响;企业需区分 frontier coding 与常规模型采购。
6 月 28 日 Reflection AI 宣布完成 20 亿美元融资,团队含 PaLM/Gemini/AlphaGo/ChatGPT 贡献者,将规模化预训练+强化学习构建可持续开源 frontier 模型;与 Musk 生态中 Reflection 算力合作叙事共振。
6 月 27 日 DeepSeek 发布 DSpark 推测解码框架及 DeepSpec 开源代码(MIT);V4-Pro/Flash-DSpark 复用现有权重附加 draft 模块;并行 draft + Markov head 减 suffix decay;生产环境 per-user 生成速度较 MTP-1 提升 57–85%。
共 113 条 · 每页 20 条