我们如何衡量
我们如何衡量
SwitchLog 是对照创作者实际发布的视频开发的,而不是对照品味小组。这一页说明方法。这里不列数字:只有在一个数值于多条录像上测量过、且报告说明了测量对象之后,才会公布。
用大白话说
四步,不需要公式。
取一对
一条你发布的视频,和它来自的原始录像。
把它们对齐
原片的每一秒得到一个标签:你保留了、你在镜头内修剪了、你删掉了、或没人说得清。
让引擎盲剪
引擎在完全看不到你剪辑的情况下,剪同一段原片。
逐秒比较
引擎保留的部分里,你也保留了多少?你保留的部分里,引擎找到了多少?你保留而它丢掉了什么?随机挑选又能得多少分?
一个整数例子
- 假设你从两小时直播中发布了 20 分钟,引擎也保留了 20 分钟。
- 引擎的 20 分钟里有 12 分钟是你也保留的。精确率:60%。
- 这 12 分钟是你 20 分钟里的 12 分钟。召回率:60%。
- 从 120 分钟里随机挑 20 分钟,与你的 20 分钟重合约 17%。这就是印在每个精确率旁边的随机基线。
- 如果引擎删掉了你保留的 3 分钟,那作为过度删除单独报告,绝不并入分数。
配对
测量的单位是配对:创作者的原始录像,和从中发布的视频。我们从配对建出一条真值轨,把原始素材的每一秒标为保留、修剪、丢弃,或在无人能作证时标为未知。
比较
引擎在没看过剪辑的情况下剪同一份素材。然后把它的选择与真值逐秒、按时间加权地比较:引擎选中的秒数里创作者也保留的比例、创作者保留的秒数里引擎找到的比例,以及两者整体的重叠。
分开报告的项目
移除单独计分;创作者保留但引擎移除的秒数以独立比率报告,绝不并入单一分数。未知的秒数从所有比率中排除。随机选择会得到的比率(概率)印在每个精确度旁边。
个人档案
档案以创作者的配对拟合,并在它没看过的折上检验。只有一组配对时报告会明说,因为一条录像只是一个样本。
它不证明什么
与剪辑的一致不等于观众满意,较短的输出也不等于较好的输出。每份报告都把这些列为限制,发布说明必须把未测量的标为未测量。