GenStudio Embeddings API 新增支持 OpenAI 兼容参数 dimensions。bge-m3 模型不支持该参数,请求时必须将其省略。
Release notes
更新日志
2026-08-03
统一 OpenAI Chat Completions API 流式响应中的 Token 用量统计行为。兼容性提示:若需在流式响应中获取 usage,请显式设置 stream_options.include_usage=true。此前依赖部分模型默认返回 usage 的调用可能受到影响;如果所用 SDK 已自动设置该参数,则无需调整。
2026-07-22
优化推理服务列表页面的数据查询速度。
2026-07-02
上架按量计费的 Spot 资源类型,可用于创建开发机、推理服务和训练任务。Spot 资源利用平台闲置库存,在库存充足时可被获取并使用,在库存不足或运行中资源被抢占时可能被中断回收;开启自动排队后,可按单次最大排队时长和最大重新排队次数重新等待算力资源。使用 Spot 资源创建的推理服务支持在升级时修改自动排队设置。任一规则达到上限后,工作负载进入异常状态,需要人工处理。该资源类型适用于容错能力强、中断容忍度高的业务场景,需申请开通,如有需要,请咨询商务或售后。
扩展可挂载云盘的开发机类型。现在所有类型的 AIStudio 开发机均可挂载云盘。
开发机支持卸载云盘、更换挂载的云盘,并支持配置容器内访问路径。
删除开发机时,可选择是否同时删除已挂载云盘;未选择删除时,云盘会继续保留。
云盘 20GB 免费额度将下线。已享受赠送额度的存量云盘,将按以下规则计费:
- 云盘容量不超过 20GB 时,未扩容前仍按原规则享受赠送额度;如对云盘进行扩容,赠送额度将不再适用,扩容后按云盘实际容量计费。例如,云盘扩容至 30GB 后,将按 30GB 计费。
- 云盘容量超过 20GB 时,变更后将不再扣减 20GB 赠送额度,按云盘实际容量计费。例如,120GB 云盘此前按 100GB 计费,变更后将按 120GB 计费。
「资源管理」页面下新增独立的「云盘」页面,支持单独创建、查看、挂载、卸载、重新挂载、扩容和删除云盘。云盘详情页支持查看基础信息、挂载关系、监控数据和事件记录。
极值算力实例支持卸载云盘、更换挂载的云盘,并支持配置容器内访问路径;仅限极值算力改配时操作。
删除极值算力实例时,可选择是否同时删除已挂载云盘;未选择删除时,云盘会继续保留。
云盘 20GB 免费额度将下线。已享受赠送额度的存量云盘,将按以下规则计费:
- 云盘容量不超过 20GB 时,未扩容前仍按原规则享受赠送额度;如对云盘进行扩容,赠送额度将不再适用,扩容后按云盘实际容量计费。例如,云盘扩容至 30GB 后,将按 30GB 计费。
- 云盘容量超过 20GB 时,变更后将不再扣减 20GB 赠送额度,按云盘实际容量计费。例如,120GB 云盘此前按 100GB 计费,变更后将按 120GB 计费。
2026-06-16
GenStudio API 新增错误码 10024,表示当前账号消费已超过预算金额上限。遇到该错误时,请调整预算上限,或联系管理员处理预算限制。详情请参见 GenStudio LLM API 错误码、图片和视频生成 API 错误码。
以下产品支持预算管理:
- 预置服务按量在线调用
- 视频大模型调用
- 批量推理
2026-05-28
2026-05-07
2026-04-02
调整用量统计页面的数据更新时效:用量统计页面中的数据通常会在您实际发起 API 调用后约 10 分钟更新。
2026-03-30
停止提供基础版 LLM API 免费服务(网页端持续免费),请关注账户余额,及时充值。
2026-03-23
「开发机」和「推理服务」新增节点告警功能,支持在开发机详情页「开发机告警」标签页、推理服务详情页「服务告警」标签页查看当前及历史告警;用户使用时可直观区分任务代码问题与底层节点异常,更快定位硬件问题,减少故障排查时间。注意,开发机、任务、推理服务的节点告警功能需申请开通,如有需要,请咨询商务或售后。
优化「任务」的 Hang 检测和进程栈采集功能,提升任务稳定性与问题排查效率。新增 Checkpoint 阶段识别能力,减少误判;同时优化了栈帧采集方式 ,支持 C++动态库栈帧获取、兼容单卡多进程场景并优化大数据量查询稳定性,大幅提升问题定位效率。栈帧报告升级为 Markdown 表格格式并覆盖整个任务范围,更易读且信息更全面。
「云盘」计费从按天计费更改为按小时计费,系统将根据您的实际使用时长(精确到秒)进行结算,确保费用计算更精准、透明。
「推理服务」定时扩缩容支持配置最小目标实例数为 0。该配置能力(目标实例数为 0)需申请开通,如有需要,请咨询商务或售后。
2026-02-13
2026-02-02
新增「公共数据」,提供常用的开源模型和数据集,可挂载至开发机、推理服务、训练服务容器内。暂仅在部分可用区上线(广东B、宁夏B、北京D)。
「推理服务」新增历史日志回溯功能:现支持查看已终止(Terminated)Pod 实例的运行日志,方便用户针对因服务异常、系统重启或资源释放而销毁的历史实例进行深度排查与故障分析。
「推理服务」详情页可展示创建服务时设置的内网配置(包括监听端口、调用端口和监控端口)。
修复云盘扣费时未优先扣代金券的问题。
支持线上自助开具发票。2026 年 2 月(含)之后的消费账单可线上自助开具发票。注意:
- 2026 年 2 月的消费月账单在 2026 年 3 月 2 日生成。因此,最早可线上开具自助开具发票的日期为 2026 年 3 月 2 日。
- 2026 年 1 月(含)之前的消费仍需人工开具发票。
- 基于消费生成订单或账单后方,可申请开具发票,充值未消费的金额不可线上申请发票。
- 可开票总额最大不超过充值总金额。
支持对「共享高性能存储」的存储卷设置容量和 inode 限额。允许对使用一级目录(例如 /public)的存储卷添加限额配置,使用二级目录及以下路径的存储卷(例如 ID 为 vo-db2mlm7jmq55l5kh,路径为 /public/user 的存储卷)自动适用上级目录限额。
- 该功能仅支持 2026 年 2 月 2 日之后新建的租户。
- 该功能首期仅在广东 B 可用区上线(宁夏 B、广东 D 即将上线)。
新增「公共数据」,提供常用的开源模型和数据集,可挂载至极值算力实例内。暂仅在部分可用区上线(广东B、宁夏B、北京D)。
2026-01-17
2026-01-12
支持为资源池配置开发机闲时自动关机规则,仅适用于包年包月资源池、专属资源池、弹性资源池,规则对使用资源池中算力创建的所有开发机生效。
「任务」容错功能支持配置是否开机检测、自动重启,支持 Hang 检测,支持自动、手动抓取栈帧,方便用户进行性能瓶颈定位和故障诊断。
「任务」新增任务告警功能,当任务所在物理节点出现异常时,在任务列表、详情页和 Worker 列表中显示节点异常提示,并在任务详情的「任务告警」标签页记录完整的告警历史(包括告警触发时间、受影响的 Worker、告警解除时间等),帮助用户快速定位节点问题对任务的影响。
资源统计页面接入权限系统,租户超级管理员可按需配置用户可见的数据范围,避免用户任意查看租户全局资源情况。
资源统计页面增加「Agent 模式」,支持快速生成个性化的资源统计视图(仅限包年包月资源)。用户可基于平台预置图表模版修改,或创建全新自定义图表。该功能需申请开通,如有需要,请咨询商务或售后。
系统内置权限策略新增"一站式 AI 平台只读用户"。该策略仅包含一站式 AI 平台所有服务的只读操作。
在展示共享资源池节点负载时,新增占用显卡与显存占比信息,以提高共享资源节点 GPU 使用情况的透明度,便于团队协作高效利用资源。
在创建「开发机」「任务」「推理服务」时,一旦有负载规格的 GPU 数量小于 8 卡,禁止使用 RDMA。存量历史负载若不变更(如改配、升级)则不受影响。
2025-12-15
2025-12-05
「推理服务」监控功能支持采集 vLLM/SGLang 输出的 LLM 监控指标,如 QPS、TTFT、TPOT 等,并进行可视化展示。
2025-12-01
「开发机」「推理服务」支持 0 卡规格。0 卡规格指不包含 GPU 卡,仅使用 CPU、内存的算力规格。仅包年包月资源池支持 0 卡规格。
使用「任务」容错 ATLAS_ACTIVATE_ENV 环境变量添加的自定义配置(例如激活 Python 虚拟环境)对任务容错调试命令 atlctl check/atlctl burn 生效。
「任务」容错调试命令 atlctl check/atlctl burn 支持将日志重定向到文件。
「任务」「推理服务」日志展示功能支持解析颜色控制码。
下线 vLLM 0.4.0 平台预置镜像。
2025-11-21
支持 Anthropic 兼容的 Messages 接口。暂仅支持部分模型。
glm-4.6glm-4.5minimax-m2
最新支持情况请访问智算云平台 GenStudio 模型广场,以「Claude 兼容」筛选结果为准。
2025-11-17
「开发机」「任务」「推理服务」详情页新增存储监控指标,支持查看系统盘和挂载的文件存储的读写速度、IOPS 等指标。
「开发机」支持启动命令,可用于服务自启动。
「任务」支持 Ray 分布式框架。
「任务」新增环境变量 ATLAS_ACTIVATE_ENV,可为容错的 Bootcheck(启动检测)和 Troubleshoot(异常定位)阶段添加自定义配置(例如激活 Python 虚拟环境)。
更多可用区支持自助删除存储卷。
AI 容器服务集群详情页新增存储监控指标,支持查看集群挂载的文件存储的读写速度、IOPS 等指标。
更多可用区支持自助删除存储卷。
「极值算力容器实例」新增存储监控指标,支持查看系统盘和挂载的文件存储的读写速度、IOPS 等指标。
「极值算力容器实例」支持启动命令,可用于服务自启动。
更多可用区支持自助删除存储卷。
2025-10-27
2025-09-23
添加资源标签功能,支持通过 KV 键值对(例如 demo:llm)对资源进行分类和聚合管理,适用于开发机、任务、推理服务、镜像。
支持在改配时扩容云盘,支持释放云盘(删除云盘)。现在支持在改配时对云盘进行扩容,并支持单独删除云盘,无需删除关联的开发机。
支持通过 Downward API 获取 AI 容器服务集群 spec.nodeName 值(例如通过 downwardAPI volume 将节点名暴露为文件,详见限制说明),便于在 Pod 内获取节点信息。直接通过 fieldRef: spec.nodeName 仍不可用;如需节点/资源标识,也可使用平台注解 metadata.annotations['scheduling.infini-ai.com/quota-name']。