「AI&Tools」宿舂粮
目录
记录并整理人工智能领域相关工具的基础用法。
框架
PyTorch
TensorFlow
训练可视化与监控
Nvidia Driver
watch -n 1 nvidia-smi # 每秒刷新 Nvidia 显卡状态TensorBoard
由 Google 开发的免费开源训练过程可视化工具。其完全本地运行,读取本地存储的数据能
- 实时绘制
Loss和Accuracy折线图,直方图展示权重和梯度变化 - 展现神经网络的模型计算图和数据流向
- 即时渲染训练过程中的文本、图像、音频和 3D 点云等
启动
tensorboard --logdir=runs
# --port: 指定 Web 服务端口号(默认 6006)
# --host: 绑定指定 IP 地址,设为 0.0.0.0 可外网访问
# --bind_all: 一键开启全网段监听,便于局域网访问
# --reload_interval: 设置后台检测并同步新数据的秒数间隔(默认 5 秒)
# --samples_per_plugin: 限制前端加载的标量或图片的最大样本数,防止网页过载卡死
# --max_reload_threads: 设定多线程并行加载日志的线程数,加速超大日志读取
# --window_title: 自定义浏览器标签页显示的标题名称
# --purge_orphaned_data: 训练意外崩溃重启后,自动清理未保存的孤立数据(默认开启)
# 可搭配 SSH 端口转发实现本地安全访问服务器端口
ssh -p 22 -L 6006:localhost:6006 user@server_ip数据记录
以 PyTorch 框架为例
from torch.utils.tensorboard import SummaryWriter
# 创建一个写入器,日志存放在 'runs/experiment_1'
writer = SummaryWriter('runs/experiment_1')
for epoch in range(100):
# 模拟训练过程
train_loss = 1.0 / (epoch + 1)
# 核心:写入标量数据
writer.add_scalar('Loss/train', train_loss, epoch)
# 记得关闭写入器
writer.close()Weights & Biases (W&B)
目前业界最流行的商业化试验追踪平台。
MLflow
由 Databricks 主导的开源平台,注重机器学习全流程的规范化。