在开发机实例中运行 TensorBoard 服务
在开发机实例中,您可以自行启动 TensorBoard 服务,查看本地训练日志或共享存储中的历史日志。服务使用的参数、端口、进程和运行时间都由您控制。
这与训练任务托管的 TensorBoard 服务不同:训练任务运行时,AIStudio 根据任务配置启动和管理服务,您无需执行 tensorboard 命令。
阅读本文后,您将能够:
- 在开发机实例内安装并启动 TensorBoard 服务
- 查看本地训练产生的日志
- 查看共享存储中保留的训练任务日志
概述
开发机实例中的 TensorBoard 适合交互式开发调试,也可以在训练任务结束后读取共享存储中保留的事件文件。
如果训练任务和开发机挂载了同一个共享存储,可以在开发机中启动 TensorBoard 查看任务历史日志。
基本流程:
- 安装 TensorBoard:确保开发机实例环境中有 TensorBoard
- 确定日志路径:本地路径或共享存储路径
- 启动服务:使用合适的参数运行
tensorboard命令 - 访问看板:通过平台控制台跳转或 SSH 端口转发
前提条件
在开始之前,请确保满足以下条件:
- 开发机实例处于运行中状态
- 开发机实例环境中已安装 TensorBoard(平台预置镜像通常已包含)
- 日志文件已存在于可访问的路径
安装 TensorBoard
如果镜像中未包含 TensorBoard,请手动安装:
pip install tensorboardTensorBoard 启动参数
--host 参数
重要
必须使用 --host 0.0.0.0 绑定到所有网络接口,否则平台无法转发服务。
--logdir 参数
--logdir 参数决定了 TensorBoard 扫描哪些目录来发现实验数据(runs):
| 传入路径 | 扫描行为 | 适用场景 |
|---|---|---|
父目录(如 /mnt/shared/runs/) | 递归扫描所有子目录,发现全部 runs | 对比多个实验 |
| 具体 run 目录 | 只加载该目录的数据 | 查看单个实验 |
--port 参数
警告
平台仅转发 6006 端口。TensorBoard 默认运行在 6006 端口,如使用 --port 指定其他端口,控制台提供的 TensorBoard 入口将失效。如需使用其他端口,请通过 SSH 端口转发访问。
场景一 查看开发机实例本地日志
在开发机实例内进行交互式训练时,可以实时查看训练进度。
在训练脚本中配置日志目录:
language-pythonfrom torch.utils.tensorboard import SummaryWriter # 指定日志目录 writer = SummaryWriter("./runs/experiment_1") # 训练循环中记录指标 for epoch in range(epochs): # ... 训练代码 ... writer.add_scalar('Loss/train', loss, epoch) writer.close()启动 TensorBoard:
language-shell# 查看 ./runs 下的所有实验 tensorboard --host 0.0.0.0 --logdir ./runs在开发机实例详情页,点击 TensorBoard 按钮访问看板。
场景二 查看任务历史日志
训练任务托管的 TensorBoard 服务会在任务结束后停止。如果事件文件保存在共享存储中,您可以在开发机实例中自行启动 TensorBoard 查看这些历史日志。
注意
此场景要求开发机实例和训练任务挂载了同一个共享存储,并且事件文件对开发机实例可读。如需了解如何挂载共享存储,请参阅创建开发机实例的流程文档。
在任务详情页查看 日志存储路径。
确保开发机实例已挂载相同的共享存储。
启动 TensorBoard,并把
--logdir指向需要查看的 run 目录或父目录。language-shelltensorboard --host 0.0.0.0 \ --logdir /mnt/shared/runs/exp-001在开发机实例详情页,点击 TensorBoard 按钮访问看板。
提示
训练任务运行时,优先使用训练任务托管的 TensorBoard 服务。该服务与任务关联,无需在开发机实例中另外维护进程。
访问 TensorBoard
从平台控制台访问
在开发机实例运行中,前往详情页,找到 TensorBoard,点击跳转即可访问。
从本地设备访问
TensorBoard 是用户在开发机实例内自行运行的服务,平台会转发 6006 端口供控制台访问。如需从本地设备直接访问,可使用 SSH 端口转发:
后台运行 TensorBoard
在开发机实例中,建议使用 tmux 或 nohup 在后台运行 TensorBoard,避免关闭终端后服务停止:
# 使用 nohup 后台运行
nohup tensorboard --host 0.0.0.0 --logdir /mnt/shared/runs > /dev/null 2>&1 &
# 或使用 tmux(推荐)
tmux new -s tensorboard
tensorboard --host 0.0.0.0 --logdir /mnt/shared/runs
# 按 Ctrl+B, D 分离会话常见问题
无法打开 TensorBoard 看板
诊断步骤:
检查开发机实例状态:确认开发机实例处于「运行中」状态
检查 TensorBoard 进程:在开发机实例终端运行:
language-shellps aux | grep tensorboard如果没有输出,说明 TensorBoard 未启动。
检查 host 绑定:确认启动命令包含
--host 0.0.0.0检查端口号:确认 TensorBoard 运行在默认端口 6006
TensorBoard 只显示一个 run
原因:日志直接写入了父目录,而不是子目录。TensorBoard 将每个包含事件文件的目录识别为一个 run。
解决方案:为每个实验创建独立的子目录:
# 错误:直接写入父目录
writer = SummaryWriter("/mnt/shared/runs")
# 正确:写入子目录
writer = SummaryWriter("/mnt/shared/runs/exp1")同一个 run 中的多个事件文件没有同时更新
如果同一个 run 目录中有多个事件文件仍在同时追加,而看板没有显示这些文件的最新数据,可以尝试启用实验性参数 --reload_multifile=true:
tensorboard --host 0.0.0.0 \
--logdir /mnt/shared/runs/exp-001 \
--reload_multifile=true该参数会持续轮询同一个 run 目录中的多个活跃事件文件,可能增加内存占用和文件系统访问。它不控制父目录下的 run 发现;TensorBoard 通过 --logdir 递归发现 runs,无需为此启用 --reload_multifile。仅有多个历史事件文件时通常也不需要启用。训练程序仍应尽量让一个指定进程写入一个 run 目录。
可以使用 WandB 等其他工具吗?
平台暂未深度集成 WandB 等实验追踪工具。您可以自行安装和使用 SwanLab/WandB 等工具。