聚合展示与「编程工具」相关的 站点内容 :资讯动态、产品与解决方案等,一站浏览。
NVIDIA ENPIRE 将 Environment、Policy Improvement、Rollout、Evolution 四模块组成物理实验闭环;8 Agent 并行通过 Git 共享策略,Codex/Claude Code/Kimi Code 均可驱动,是 Coding Agent 走出纯软件沙箱的里程碑架构。
6 月 17–18 日,NVIDIA GEAR 与 CMU、UC Berkeley 发布 ENPIRE 框架:AI 编程 Agent 自主重置场景、迭代策略、并行评估,8 台双臂机器人 fleet 经 Git 共享实验结果,Push-T 等任务成功率达 99%,计划全面开源。
6 月 17 日 GitHub 宣布 Copilot Agent Finder GA:用自然语言搜索已索引的 AI 资源(MCP、Skills、Canvas、Agent),按需加载而非预装全部工具;实现 Google ARD 规范,支持企业私有 Registry 与托管策略。
AWS Context 的核心设计是 Agent 每次查询与工具调用都会反哺图谱关系推断,减少人工 Ontology 维护;适合 S3/Glue/Lake Formation 已有投资的企业零搬迁扩展 Agent 上下文。
截至2026年6月,OpenCode(anomalyco/opencode)GitHub Star 超17.5万,最新 v1.17.7;build/plan 双 Agent 模式、MCP 集成与 MIT 许可推动小米 MiMo Code、add-skill 等 fork/插件生态爆发,开发者工具链向开源 Agent 收敛。
eve 采用 filesystem-first 设计:Agent 即目录(agent.ts + instructions.md),持久化执行基于开放 adapter,支持运行数小时/数天/数周;集成 Sandbox、审批流与任意 MCP,解决「Demo Agent 无法上生产」痛点。
6月17日 Vercel 发布开源 Agent 框架 eve,内置持久化执行、Sandbox、人工审批与 Eval;Vercel 平台 Agent 触发部署占比已从 3% 升至 29%,npx eve@latest init 一分钟可跑通首个 Agent。
6 月 17 日 Google Cloud Next 2026 开幕,Sundar Pichai 宣布跨入 Gemini Agent 时代;披露内部 75% 新代码由 AI 生成(较半年前 50% 大幅提升),发布第八代 TPU、Workspace Intelligence 与 Gemini Enterprise Agent Platform。
Genie ZeroOps 是 Databricks 内置的后台 Agent,利用 Unity Catalog 血缘、指标/日志/事件与 Shallow Clone 沙箱,自主监控管道/作业/表/ML 模型并提议修复;解决「Coding Agent 能建不能运维」痛点。
ASR 是基于多 Agent 协作的自动化软件工程运行时,通过 Builder→Tester→Analyzer 闭环从 DESIGN.md 生成并收敛代码直至测试全过;作者以 GLM-4.7-FP8 等低成本模型验证「收敛运行时」可逼近更强模型效果。
Devstral 2 采用 Modified MIT,对年营收超 2 亿欧元企业限制商用;Devstral Small 2 为 Apache 2.0。欧洲开源模型在开放权重与商业保护之间的许可证设计,值得中国企业法务评估。
GLM-5.2 采用 IndexShare 架构,在 100 万 Token 上下文下将单位 Token FLOPs 降至约 2.9×;升级 MTP 层提升投机解码效率,解决长文本 Coding Agent 训练环境扩展与性能退化问题。
Devstral 2 为 123B 密集 Transformer,256K 上下文,针对代码 Agent 优化;Small 2 为 24B 可消费级 GPU 本地部署。本文拆解其 SWE-bench 评测含义、与 Claude Sonnet 差距及 Vibe CLI 工具链。
Mistral 发布 Devstral 2(123B)与 Devstral Small 2(24B),SWE-bench Verified 分别达 72.2% 与 68.0%,并推出 Apache 2.0 终端 Agent「Mistral Vibe CLI」,API 现阶段免费。
6月17日,智谱 AI(Z.ai)正式开源 GLM-5.2 旗舰模型,753B 总参数/40B 激活、MIT 协议、100 万 Token 无损上下文;FrontierSWE 74.4 分逼近 Opus 4.8,Code Arena 开源模型全球第二。
Salesforce 与 Lehigh 等团队发布 OpenSkill,Agent 仅凭任务提示从文档/仓库/网页构建技能与自验证信号,无需目标任务监督;在三个基准上取得最佳自动化通过率,技能可跨模型迁移。
6月16日,清华 dongshuyan 开源 COMPASS 司南——面向科研与编程的个性化 Agent 技能系统,支持需求前置对齐、任务 DAG/森林可视化、本地化可审计用户画像,npx 一键安装,适配 Codex 与 Claude Code。
美团 LongCat-Flash-Thinking-2601 采用重思考模式,可并行启动 8 个推理单元,在 τ²-Bench 88.2 分、VitaBench 29.3 分;本文解析其工具泛化与在线免费体验机制。
6月15日,美团 LongCat 团队正式发布并开源 LongCat-Flash-Thinking-2601,主打「重思考」模式,在 τ²-Bench、VitaBench 等工具调用评测中达到开源 SOTA,支持 8 路并行推理单元与在线免费体验。
Perplexity 推出 Perplexity Computer,由 Claude Opus 编排将子任务分配给最多 19 个模型(推理用 Claude、研究用 Gemini、速度用 Grok 等),可在后台自主运行数小时乃至数天,一键构建媲美 Bloomberg 的金融终端 Demo。
共 126 条 · 每页 20 条