Skip to content

在开发机实例中运行 TensorBoard 服务

在开发机实例中,您可以自行启动 TensorBoard 服务,查看本地训练日志或共享存储中的历史日志。服务使用的参数、端口、进程和运行时间都由您控制。

这与训练任务托管的 TensorBoard 服务不同:训练任务运行时,AIStudio 根据任务配置启动和管理服务,您无需执行 tensorboard 命令。

阅读本文后,您将能够:

  • 在开发机实例内安装并启动 TensorBoard 服务
  • 查看本地训练产生的日志
  • 查看共享存储中保留的训练任务日志

概述

开发机实例中的 TensorBoard 适合交互式开发调试,也可以在训练任务结束后读取共享存储中保留的事件文件。

如果训练任务和开发机挂载了同一个共享存储,可以在开发机中启动 TensorBoard 查看任务历史日志。

基本流程:

  1. 安装 TensorBoard:确保开发机实例环境中有 TensorBoard
  2. 确定日志路径:本地路径或共享存储路径
  3. 启动服务:使用合适的参数运行 tensorboard 命令
  4. 访问看板:通过平台控制台跳转或 SSH 端口转发

前提条件

在开始之前,请确保满足以下条件:

  • 开发机实例处于运行中状态
  • 开发机实例环境中已安装 TensorBoard(平台预置镜像通常已包含)
  • 日志文件已存在于可访问的路径

安装 TensorBoard

如果镜像中未包含 TensorBoard,请手动安装:

language-shell
pip install tensorboard

TensorBoard 启动参数

--host 参数

重要

必须使用 --host 0.0.0.0 绑定到所有网络接口,否则平台无法转发服务。

--logdir 参数

--logdir 参数决定了 TensorBoard 扫描哪些目录来发现实验数据(runs):

传入路径扫描行为适用场景
父目录(如 /mnt/shared/runs/递归扫描所有子目录,发现全部 runs对比多个实验
具体 run 目录只加载该目录的数据查看单个实验

--port 参数

警告

平台仅转发 6006 端口。TensorBoard 默认运行在 6006 端口,如使用 --port 指定其他端口,控制台提供的 TensorBoard 入口将失效。如需使用其他端口,请通过 SSH 端口转发访问。

场景一 查看开发机实例本地日志

在开发机实例内进行交互式训练时,可以实时查看训练进度。

  1. 在训练脚本中配置日志目录:

    language-python
    from torch.utils.tensorboard import SummaryWriter
    
    # 指定日志目录
    writer = SummaryWriter("./runs/experiment_1")
    
    # 训练循环中记录指标
    for epoch in range(epochs):
        # ... 训练代码 ...
        writer.add_scalar('Loss/train', loss, epoch)
    
    writer.close()
  2. 启动 TensorBoard:

    language-shell
    # 查看 ./runs 下的所有实验
    tensorboard --host 0.0.0.0 --logdir ./runs
  3. 在开发机实例详情页,点击 TensorBoard 按钮访问看板。

场景二 查看任务历史日志

训练任务托管的 TensorBoard 服务会在任务结束后停止。如果事件文件保存在共享存储中,您可以在开发机实例中自行启动 TensorBoard 查看这些历史日志。

注意

此场景要求开发机实例和训练任务挂载了同一个共享存储,并且事件文件对开发机实例可读。如需了解如何挂载共享存储,请参阅创建开发机实例的流程文档。

  1. 在任务详情页查看 日志存储路径

  2. 确保开发机实例已挂载相同的共享存储。

  3. 启动 TensorBoard,并把 --logdir 指向需要查看的 run 目录或父目录。

    language-shell
    tensorboard --host 0.0.0.0 \
      --logdir /mnt/shared/runs/exp-001
  4. 在开发机实例详情页,点击 TensorBoard 按钮访问看板。

提示

训练任务运行时,优先使用训练任务托管的 TensorBoard 服务。该服务与任务关联,无需在开发机实例中另外维护进程。

访问 TensorBoard

从平台控制台访问

在开发机实例运行中,前往详情页,找到 TensorBoard,点击跳转即可访问。

从本地设备访问

TensorBoard 是用户在开发机实例内自行运行的服务,平台会转发 6006 端口供控制台访问。如需从本地设备直接访问,可使用 SSH 端口转发:

后台运行 TensorBoard

在开发机实例中,建议使用 tmuxnohup 在后台运行 TensorBoard,避免关闭终端后服务停止:

language-shell
# 使用 nohup 后台运行
nohup tensorboard --host 0.0.0.0 --logdir /mnt/shared/runs > /dev/null 2>&1 &

# 或使用 tmux(推荐)
tmux new -s tensorboard
tensorboard --host 0.0.0.0 --logdir /mnt/shared/runs
# 按 Ctrl+B, D 分离会话

常见问题

无法打开 TensorBoard 看板

诊断步骤:

  1. 检查开发机实例状态:确认开发机实例处于「运行中」状态

  2. 检查 TensorBoard 进程:在开发机实例终端运行:

    language-shell
    ps aux | grep tensorboard

    如果没有输出,说明 TensorBoard 未启动。

  3. 检查 host 绑定:确认启动命令包含 --host 0.0.0.0

  4. 检查端口号:确认 TensorBoard 运行在默认端口 6006

TensorBoard 只显示一个 run

原因:日志直接写入了父目录,而不是子目录。TensorBoard 将每个包含事件文件的目录识别为一个 run。

解决方案:为每个实验创建独立的子目录:

language-python
# 错误:直接写入父目录
writer = SummaryWriter("/mnt/shared/runs")

# 正确:写入子目录
writer = SummaryWriter("/mnt/shared/runs/exp1")

同一个 run 中的多个事件文件没有同时更新

如果同一个 run 目录中有多个事件文件仍在同时追加,而看板没有显示这些文件的最新数据,可以尝试启用实验性参数 --reload_multifile=true

language-shell
tensorboard --host 0.0.0.0 \
  --logdir /mnt/shared/runs/exp-001 \
  --reload_multifile=true

该参数会持续轮询同一个 run 目录中的多个活跃事件文件,可能增加内存占用和文件系统访问。它不控制父目录下的 run 发现;TensorBoard 通过 --logdir 递归发现 runs,无需为此启用 --reload_multifile。仅有多个历史事件文件时通常也不需要启用。训练程序仍应尽量让一个指定进程写入一个 run 目录。

可以使用 WandB 等其他工具吗?

平台暂未深度集成 WandB 等实验追踪工具。您可以自行安装和使用 SwanLab/WandB 等工具。

可参考以下教程:

参考资源