本帖最后由 最爱Windows预览版 于 2026-8-31 00:01 编辑
最近半年,纳米AI接入了国内主流厂商的最新模型,除早些时候已官宣接入的模型(seedance 2.0系列、seedance 2.5系列、MiniMax-H3和wan-3.0)以外,其他已接入的模型信息如下:
DeepSeek系列:DeepSeek-V4-Pro和DeepSeek-V4-Flash
智谱系列:GLM-5.3、GLM-5.3-Flash、GLM-5.2和GLM-5.1,目前最新的是GLM-5.3及GLM-5.3-Flash
kimi系列:kimi-k3、kimi-K2.7-code和kimi-k2.6,目前最新的是kimi-K3
豆包系列:Doubao-Seed-2.1-Pro、Doubao-Seed-Evolving和Doubao-Seed-2.1-turbo
通义千问系列:Qwen3.8-Max、Qwen3.7-Max、Qwen3.7-Plus、Qwen3.6-Plus和Qwen3.5-Plus,目前最新的是Qwen3.8-Max
MiniMax系列:MiniMax-M3和MiniMax-M2.7,目前最新的是MiniMax-M3
各个厂商的最新大模型简要介绍:
(一)DeepSeek-V4-Pro和DeepSeek-V4-Flash
当前DeepSeek-V4-Pro和DeepSeek-V4-Flash均已升级到正式版。DeepSeek-V4-Pro的正式版是DeepSeek-V4-Pro-0813版本;DeepSeek-V4-Flash的正式版是DeepSeek-V4-Flash-0731.
1.DeepSeek-V4-Pro模型特点
Agent 能力大幅提升
正式版 DeepSeek V4 Pro 极大增强了 Agent 能力,在生产环境中的性能表现提升尤为显著。
部分评测平台上的评分:
HLE (wo / w tools): 42.7/60.0
Terminal Bench 2.1: 87.9
NL2Repo: 61.5
Cybergym: 83.3
2.DeepSeek-V4-Flash模型特点
Agent 能力大幅增强,基准测试远超 V4-Pro-Preview。
部分评测平台上的评分:
Terminal Bench 2.1: 82.7
NL2Repo: 54.2
Cybergym: 76.7
DeepSWE: 54.4
Toolathlon verified: 70.3
(二)GLM-5.3和GLM-5.3-Flash
1.GLM-5.3模型特点
与 GLM-5.2 相比,它在复杂编程和长程任务方面表现更加出色:
更强的编程能力
GLM-5.3 的编程能力大幅提升,在智谱内部 Z.ai Code Bench 上较 GLM-5.2 提升了 50%,在包括 Terminal Bench 3.0、Agents’ Last Exam (CLI) 在内的公开基准测试中达到开源模型 SOTA 水平。
2.GLM-5.3-Flash模型特点
GLM-5.3-Flash 是 GLM-5 系列首个原生多模态模型,以极致低成本架构实现超越 GLM-5.2 的更强智能:
极致高效的混合架构
总参数量 320B、激活参数量 18B,是首个采用稀疏注意力与线性注意力混合架构的开源前沿模型。相比 GLM-5.3,注意力计算量和 KV 缓存大小分别降低 3.01 倍和 4.44 倍。
原生多模态的视觉 Coding
视觉能力原生融入 Coding 循环,模型能主动观察界面、渲染结果与交互反馈并持续改进,在代码、浏览器与图形界面之间协同完成任务。
(三)kimi-K3
1.Kimi-K3模型特点
Kimi K3 是 Kimi 迄今能力最强的旗舰模型,拥有 2.8 万亿参数,基于 KDA 混合线性注意力机制(Kimi Delta Attention)和注意力残差(Attention Residuals)技术构建,原生支持视觉理解,并拥有 100 万 token 上下文窗口。它是全球首个开源的 3 万亿级别模型,面向长程编程、知识工作和推理等前沿智能场景而设计。
(四)Doubao-Seed-2.1-Pro、Doubao-Seed-Evolving和Doubao-Seed-2.1-turbo
1.Doubao-Seed-2-1-Pro和Doubao-Seed-2.1-turbo模型特点
Doubao-Seed-2.1-pro-260628 是一个深度思考模型,官方宣称是面向 Coding 与 Agent 时代打造的新一代旗舰模型,在 Coding 工程交付、Agent 长链路任务执行与多模态理解三大方向全面升级,具备更强的需求理解、长期规划与持续修复能力。适用于复杂 Coding、长链路 Agent、多步骤工程交付等高复杂度任务探索及高价值生产场景。
Doubao-seed-2.1-turbo-260628 是一个深度思考模型,官方宣称面向规模化生产场景的低成本、低时延版本,功能齐备,效果比肩 doubao-seed-2-1-pro。适用于需要稳定承接大量线上调用的 Coding、Agent 与多模态理解任务,以及成本、吞吐与批量调用优先的企业级部署场景。
2.Doubao-Seed-Evolving模型特点
Doubao-Seed-Evolving 是面向 Agent、Coding 与多模态复杂任务打造的 Seed 系列模型,具备深度搜索、视觉理解、复杂任务编排、长程规划、代码生成与工具调用能力。统一调用 Model ID doubao-seed-evolving,无需关注版本切换,模型升级自动生效,即可持续获得最新模型能力。
(五)Qwen3.8-Max
1.Qwen3.8-Max模型特点
Qwen3.8-Max——Qwen家族迄今最强大的模型,2.4万亿参数MoE旗舰,编程与办公能力全面跃升,可自主编程十数天交付完整项目。
Qwen 3.8-Max 基于 Qwen 3.5 的架构基础构建,参数规模扩展至 2.4 万亿,激活参数95B,支持100万上下文Tokens,在编程、办公、科研以及长周期任务等方面实现了全面提升。它不仅能应对更具挑战性的问题,还能更可靠地端到端完成复杂任务,输出值得信赖的成果。
(六)MiniMax-M3
1.MiniMax-M3模型特点
MiniMax M3 在编程和智能体等专业任务上达到了前沿的能力,最高支持 1M 超长上下文。它也是一个原生多模态模型,支持图片和视频的输入,并能操作电脑桌面。
在 Coding 能力方面,M3 相比 M2 显著增强,在 bugfix、前后端、性能优化等方面均接近海外闭源模型。
在 Agentic 能力方面,M3 在办公常用的搜索、Office 能力上表现突出,并在金融领域变得初步可用。
在涵盖软件工程、终端执行等多个维度的国际权威评测中,M3 均达到国际领先水平:
SWE-Bench Pro: 59.0%
Terminal Bench 2.1: 66.0%
SWE-fficiency: 34.8%
以上各个模型都可以通过“点击“大模型”功能”自选使用;也可以在创建智能体时,在“模型选择”部分自选使用。
MiniMax-M2.7、GLM-5.1、DeepSeek-v4-pro(在创建智能体时)、Qwen3.7-Max和Qwen3.6-Plus支持引用纳米AI平台上的mcp工具,如“即梦视频生成mcp工具”。
|
|
|
|
|
|
评论
直达楼层