今天刷到一个B站直播,感觉好酷!
看的时候,UP主已经播了六个多小时。
画面中央是塞满代码的编辑器,Agent正修改AI视频项目;
右下角两个顶着铁锅的二次元小人,底部预告着Godot MCP、HY4、Qwen3.8和GLM5.3等后续测试。
下午两点,在线132人。
主播就做一件事:开任务、看结果、改提示词、修Bug,再塞进下一道题。
观众一起围观AI执行,一次失败可能就十几分钟,成功了也没情绪波动,只有几条弹幕迅速分析成功原因。
听说过小孩哥直播写作业,没想到测试AI也有这种模式了,模型产品,效果好坏,一目了然,还特别有现场感。
B站AI评测很火,但发展成直播共测,还挺惊喜的。
直播里,观众看到模型修改项目时,会立刻拿它和Fable、旧版HY4对比。
每条弹幕都在增加新变量:换题、重开Session、检查共享上下文、把同样要求扔给另一个模型。
一条剪辑好的测评视频,会隐藏大量等待、报错和重复劳动。
但是直播却把这些真实的、失败的部分都暴露了出来。
大模型评测里,看不见的部分,往往更有价值。
任务跑崩后,观众才能看清问题出在理解、规划、工具调用、上下文,还是自我检查。
惊艳的Demo,只能证明成功过,连续直播看模型怎么翻车,反而更有意思。
B站好像形成了一条特别的测评链路:
直播间先炸出问题,长视频复盘,评论区补充反例,公开题库供复现,反复出现的问题被做成工具。
比如UP主开发的评测工具,观众一键测试后,在评论区提交供应商得分、异常日志,要求增加更多准确性功能,UP主再根据反馈优化。
一次测评,就这样从个人体验,变成开源共创。
可能只有在AI领域,B站的创作者、观众和开发者之间能这么通畅地交换身份。
一条视频可能是实验记录、招募帖、产品发布会,或开源项目的第一个测试包。
B站自己没说过要做AI技术社区,但它有的直播、弹幕、长视频、二次元文化和开源爱好者,已经事实上把氛围搞起来了。
模型大佬,很多都是B站二次元头像,这一次,AI玩家们又一次在B站集结了!
朋友圈会发一些具体的案例和商业化日常~