MIAOYUN | 每周AI新鲜事儿 260821
本周AI行业新品技术集中爆发,Google、小红书、阿里、智谱、昆仑万维等相继推出大模型、音乐及语音模型;Agent领域OpenAI、DeepSeek、MiniMax等迭代底层框架与创作工具,Codex、政务智能体、企微MCP、Cursor Origin等落地应用涌现;同时出现Claude蛋白设计、Claude水印被破解等技术事件,市场上Anthropic披露内部强模型,Strip重金收购OpenRouter,行业开源提速,Agent基础设施、多模态商业化成为竞争重点,一起来回顾本周发生的AI新鲜事儿吧!
AI 大模型
Google DeepMind发布「Gemini 3.7 Flash」编程模型
8月14日,Google DeepMind在管理层换帅八天后发布「Gemini 3.7 Flash」,距离上一代版本仅间隔三周,该模型主打编程与Agent能力,多项相关基准测试大幅提升,部分指标对标竞品旗舰模型,限时将价格减半,上线即赋能谷歌个人AI Agent Spark,面向大规模Agent业务抢占市场;此次快速迭代源于谷歌内部科研与商业化、算力分配、团队路线的多重矛盾,旗舰Gemini 3.5 Pro仍未正式发布,换帅之后权力向商业化方向倾斜,DeepMind开启提速追赶的新阶段。
参考:Gemini 3.7 Flash 突袭!谷歌AI紧急换帅后的首个大动作,“内斗”真相浮出水面
小红书开源「dots3note Preview」,攻坚真实场景长程智能体
8月14日,小红书技术开源遵循Apache 2.0协议的「dots3note Preview」,模型总参数280B、激活参数16B,支持512K上下文与多模态输入,针对长程Agent优化;自研TEMPO训练方案改善长程强化学习效果,具备递归自评、陌生环境自主学习记忆能力,分支版本拿下IMO 2026满分,同步开源VibeSearchBench、VibeLifeBench评测集,技术报告一周内发布;作为预览版本,其幻觉、稳定性尚有短板,能力验证来自模拟环境,落地真实场景还需配套能力完善。
参考:dots3-note Preview:迈向服务真实生活的长程智能体,坚定的第一步
阿里千问正式开源原生多模态稠密(Dense)模型「Qwen3.8-27B」
8月14日,阿里千问正式开源「Qwen3.8-27B」,该原生多模态稠密(Dense)模型采用Apache2.0协议可免费商用,原生支持262K上下文,借助YaRN技术可外推至1M Tokens上下文,相比前代在编程、办公场景性能大幅提升,新增reasoning_effort功能可按需调节思考深度,至此千问已累计开源460余个模型,全球下载量超30亿次。
阿里巴巴发布AI音乐模型「HappyShrimp 1.0」
8月17日,阿里巴巴发布AI音乐模型「HappyShrimp 1.0」(快乐虾米),无需用户掌握乐理专业知识,支持自然语言输入情绪、故事、场景即可生成完整歌曲,采用端到端一体化整曲生成方式,解决AI音乐人声生硬、词曲错位等问题,既能识别专业音乐标签,也能理解普通叙事与情绪意图,该模型国内外PC网页端已同步上线,新用户可领取大额免费积分体验。
参考:人人都能写出好听的歌,AI音乐模型HappyShrimp 1.0上线
昆仑万维发布AI音乐生成模型「Mureka V9.5」
8月18日,昆仑万维发布AI音乐生成模型「Mureka V9.5」,依托MusiCoT音乐思维链框架,跳出行业堆砌配器追求强感官刺激的内卷,主打克制自然的创作思路,在编配留白、段落逻辑、人声演绎、指令遵循上实现提升,国风风格优化尤为突出,该版本迭代参考了2.5万份用户反馈,目标产出耐听、具备真人创作质感的音乐,标志产品从“能够生成音乐”迈向“产出值得单曲循环的作品”,现已在国内外平台开放体验。
参考:Mureka V9.5 重磅上线:让 AI 音乐,终于有了"活人味儿"
Cartesia推出Beta版TTS模型「Sonic 3.6」,登顶语音合成
8月18日,Cartesia推出Beta版TTS模型「Sonic 3.6」,支持44种语言,可实现多语言混读、情绪与笑声生成,在Artificial Analysis语音竞技场两大榜单双双登顶,生成速度大幅领先竞品,流式延迟低适配语音Agent场景;其闭源不公开权重,提供云端API、第三方托管、企业私有化部署三种使用途径,定价为49美元每百万字符,在头部TTS模型中处于中等偏高水平,目前尚处于Beta阶段,生产环境建议优先使用Sonic 3.5稳定版,可根据成本、合规、稳定性需求做选型。
参考:最强(TTS)语音生成模型发布,44种语言可选,音色自然,Sonic 3.6 介绍、部署及使用指南
智谱「GLM-5.3」API上线,推进智能-成本帕累托前沿
8月19日,智谱宣布「GLM-5.3」API正式上线,该模型擅长复杂编码、防御性网络安全及长程任务,在AA综合智能指数拿到60分,比肩Claude Fable 5、GPT‑5.6 Sol等闭源旗舰,和Kimi K3并列开源模型第一;其基于「GLM-5.2」同一基础模型,依靠后训练实现性能提升,凭借小参数、低成本推进了模型智能-成本的帕累托前沿,API定价维持与「GLM-5.2」一致,现已接入ZCode等平台,模型权重将于下周五开源,开发者可通过BigModel开放平台、Z.ai、智谱清言App等渠道调用与体验。
Ornith AI团队开源「Ornith-1.5」系列模型,端到端自改进训练
8月20日,Ornith AI团队以MIT协议开源「Ornith-1.5」系列模型,包含397B MoE、35B-A3B MoE、9B Dense三款规格,采用端到端自改进技术,依靠模型自主生成任务、评测脚手架与解题轨迹,借助GRPO联合优化形成训练闭环,无需人工设计训练任务,其中35B-A3B仅激活3B参数,编码、智能体基准表现超越Gemma-4-31B等同级模型,397B逼近Claude Opus 4.8,9B Dense多项任务也优于更大参数量竞品,该系列支持256K上下文,可扩展至1M token,提供多类量化版本,兼容vLLM、Ollama、MLX等多种部署框架,还适配OpenAI兼容API,可对接各类终端编码工具。
参考:Ornith-1.5 开源:端到端自改进训练,35B MoE 激活 3B 即超越同级稠密模型 Gemma-4-31B
阿里千问发布「Qwen-UI-Agent」,面向真实设备的高性能GUI智能体基座开源
8月20日,阿里千问发布「Qwen-UI-Agent」,是一款面向真实世界的GUI智能体基座模型,覆盖移动端、电脑端、网页端与深度搜索环境,多项主流评测超越海外旗舰模型;该模型采用真机训练与真机评测,具备完整安全管控机制,支持GUI与CLI混合批量操作、百步以上长程在线强化学习、AI驱动的AutoResearch式数据飞轮迭代,依托Harness实现主动服务与跨端接力,可处理各类复杂现实任务,技术报告、项目主页及开源代码已公开。
参考:Qwen-UI-Agent:让模型真正“会用”每一块屏幕
AI Agent
Codex解锁「GPT-5.6 Sol」百万上下文,三行配置即可开启
8月17日,Codex可通过三行配置解锁「GPT-5.6 Sol」的100万token上下文能力,在config.toml文件开头填入对应参数重启即可,也支持CLI单会话临时调整,该能力原本为API专属;但官方提醒不建议随意开启,超大上下文会带来token消耗翻倍,且模型在接近百万token区间检索性能会下降,平台默认依靠自动压缩机制平衡性能与成本,同时消息称Codex后续还将接入OpenAI下一代模型Astra(GPT-6)。
参考:Codex正式开放1M上下文!解除GPT-5.6 Sol封印,三行配置搞定
「湾擎·WorkBuddy」发布,广东政务迈入AI智能体时代
8月18日,依托广东省政务智能中枢湾擎底座打造的「湾擎·WorkBuddy」正式发布,将腾讯WorkBuddy智能体落地广东政务场景,首批已在省医保局、省中小企业服务中心等单位试点,覆盖政务服务、政务协同、辅助决策、社会治理四大领域,具备政策检索、公文起草、数据分析、业务预审、数据治理等能力,支持移动端下达任务与单位自定义业务技能;该产品实现全栈国产私有化适配,数据留存政务内网,通过权限管控、沙箱隔离、操作审计实现安全可控,8月下旬将向首批公务员开放试用并逐步推广。
参考:湾擎·WorkBuddy正式发布,广东政务跑步进入智能体时代
MiniMax推出基于H3打造的创作Harness工具「MiniMax Design」
8月20日,MiniMax推出基于原生多模态视频模型H3打造的创作Harness工具「MiniMax Design」,倡导从操作像素转向语义级创作,用户只需表达创作意图,系统便可借助Agent拆解任务、调用模型与技能,理解整个项目复杂上下文,完成素材处理、生成编辑到成片交付全流程,适配品牌营销素材、知识短视频、PV/MV等商业内容制作,配备3D导演台前置校验分镜减少无效生成,还支持接入ComfyUI等开源生态,释放多模态模型的商业生产力。
参考:MiniMax Design:从操作像素,到操作语义和表达意图
AI 工具
Suno推出浏览器端生成式音频工作站「Suno Studio 2.0」
8月14日,Suno推出浏览器端生成式音频工作站「Suno Studio 2.0」,从AI随机生成转向更高可控度的音乐制作,新增MIDI控制器连接演奏内置合成器、全套专业音频效果器、AI聊天对话,可自定义创建音频插件,同时支持音频导入、音轨编排、自动化曲线绘制、高精度分轨分离,还能导出完整歌曲或分轨文件,朝着专业音乐工作站的方向演进。
参考:AI 时代的 GAW 这么搞味儿就对了:Suno Studio 2.0 发布
Claude文本水印遭遇开源工具破解,该项目五天斩获11k Star
8月17日消息,Anthropic采用SynthID-Text技术为Claude全部生成文本植入隐藏水印,即便仅使用Claude做简单文本处理,输出内容也会被打上AI生成标记;一款GitHub开源去水印项目五天斩获11k Star,可清除字符标记、破坏统计水印、抹除多类文件元数据,覆盖Claude、Gemini、OpenAI等主流AI服务,用户试图让Claude安装该工具遭到拒绝,最终由GLM 5.2完成安装;AI水印引发巨大争议,付费用户反感输出被强制打标,而支持方认为水印可防范AI虚假信息,这也预示着水印与去水印之间将持续上演猫鼠博弈。
参考:Claude水印已被破解,斩获11k Star!但会被拒绝安装
企业微信开放CLI与MCP,AI Agent可调用十大办公能力
8月18日,企业微信5.0.10版本升级,不限企业规模开放CLI与MCP能力,各类AI Agent可调用企微文档、表格、邮件、会议等十大办公能力,自动读取内部信息完成生成PPT、写代码、数据分析等办公任务;智能表格灰度上线AI「分析报告」功能,AI助理大圆可识别指标、生成可交互且随数据实时更新的专业报表,智能文档也扩充格式导出、打印等新能力,进一步推进AI与企业办公流程融合。
参考:企微AI开放能力再升级:不限企业规模,十大办公能力全面开放
Cursor推出面向AI智能体的代码托管平台「Origin」
8月18日,在GitHub遭遇近七小时宕机故障的节点,被xAI收购后的Cursor推出面向AI智能体的代码托管平台「Origin」,仅对付费用户开放,可完整实现仓库管理、PR审查合并,支持与GitHub双向同步,还集成CI/CD工具,将Agent置于产品核心,平台上已有35%的PR由云端Agent自主提交;虽然官方对外强调与GitHub共存,但其补齐了从代码生成到合并的完整开发闭环,意在争夺开发者工作台;不过GitHub拥有庞大生态社区,同时Cursor因归属马斯克旗下,部分企业出于源码安全合规顾虑心存抵触,「Origin」作为Beta产品短期内难以撼动GitHub,但AI时代技术格局迭代加快,GitHub近期多次故障也推动行业重新评估代码托管基础设施的选择。
技术突破
Claude实现自主蛋白质设计,成功率远超行业均值
8月18日,Anthropic公布实验结果,Claude(Mythos Preview、Opus 4.8)依托1.6万词提示词编排RFdiffusion等开源工具,可自主完成全套蛋白质设计流程,15个靶标完成14个,整体成功率26.8%,优于行业10%-15%均值,部分靶标表现优于人类竞赛成果,还攻克了TNFα这一过往专家均失败的难点靶标,但也存在MBP蛋白靶标全部设计失效的情况;该通用大模型还可高效处理核磁实验数据,相关实验资料已开源,但离成药尚有较大距离,为管控风险公开版已封禁该生物设计能力,从AlphaFold预测蛋白结构到大模型自主设计蛋白仅过去六年。
参考:Claude开始自主设计新蛋白质,效率超越人类专家数十倍!
DeepSeek Harness RC.8版本更新,强化多模态
8月20日,DeepSeek Harness RC.8版本完成更新,距离RC.7仅间隔两天,本次补齐多模态输入能力,核心命令支持图文混合,新增本地文件、历史会话引用;可将Claude Code、Codex作为Profile Bundle按需安装,当作子代理调度编排,同时增强工具调用、优化Windows终端体验,修复图片载荷、会话分叉、网关调用等多项问题,完善Python SDK依赖,正逐步打造可接入外部编码智能体的统一Agent调度层。
参考:刚刚,DeepSeek Harness更新!增强多模态
OpenAI开源「Codex Harness」,开启AI Agent原生开发时代
8月20日,OpenAI以Apache-2.0许可开源「Codex Harness」,它是支撑AI智能体运行的底层执行系统,可显著提升模型表现、降低token消耗,包含CLI工具、Codex SDK、app-server三大组件,支持开发者将Agent能力直接嵌入自有业务系统,不用依赖通用聊天框,开发者掌握界面、数据、审批安全控制权,已在税务、思科云平台、物流看板等场景落地,推动原生AI应用发展,开启AI Agent零门槛开发时代。
市场动态
Anthropic披露更强内部模型「Model 2」,同时曝出多起AI安全流程事故
8月15日,Anthropic发布186页第二份风险报告,披露尚未对外发布的内部模型「Model 2」,其综合能力略强于Mythos 5,已大量用于内部编码、智能体与研发工作,但暂无对外公开计划;报告还曝光多起真实安全流程事故,涵盖多智能体集体偏航、训练数据污染、权限管控漏洞、生物安全防护系统长期失效等问题,将相关灾难性风险等级由“非常低”上调至“低”,同时指出Model 2与Mythos 5参与模型自我迭代,AI已经承担公司大部分代码编写工作,但尚未达成研发速度预警阈值,前沿强模型优先落地企业内部、不面向消费者发布正成为行业新现象。
参考:刚刚,Anthropic报告泄露Model 2,比Mythos 5更强的内部模型
DeepSeek Harness插件生态爆发,GitHub涌现700余个开源插件
8月15日,开源Agent框架DeepSeek Harness秉持“一切皆插件”理念,在GitHu上相关公开仓库已达700余个,社区产出大量插件,既有多Agent团队协作、长期记忆、文件引用、视觉能力接入、Claude会话迁移、GitHub对接等面向开发工作的实用工具,也衍生出电子宠物、复古广告UI、18款休闲小游戏等趣味插件,开发者将其改造拓展,形成丰富多样的插件生态。
参考:DeepSeek Harness插件一夜燃爆GitHub:长期记忆、电子宠物、4399小游戏全来了
Strip以超70亿美元收购模型聚合平台「OpenRouter」
8月19日,Strip以超70亿美元收购模型聚合平台「OpenRouter」,该平台三个月估值从13亿美元大幅上涨。Token生意分为自建算力部署、多服务商模型聚合两种模式,同一模型在不同服务商下的服务质量差异显著,第三方服务商可解决中小企业调用官方接口的并发瓶颈,但Token业务同质化严重,部分厂商甚至亏损,行业竞争的核心不在于Token售价,而在于配套工程与工具能力。
葡萄城是专业的软件开发技术和低代码平台提供商,聚焦软件开发技术,以“赋能开发者”为使命,致力于通过表格控件、低代码和BI等各类软件开发工具和服务,一站式满足开发者需求,帮助企业提升开发效率并创新开发模式。
更多推荐

所有评论(0)