在国际空间站数百位宇航员的访谈记录里面寻找一些问题的答案。

Ask an Astronator是一个可搜索的档案,记录了在国际空间站的飞行采访、新闻发布会和学生问答环节中向美国国家航空航天局宇航员提出的真实问题,涵盖了二十多年的载人航天飞行。它是由美国国家航空航天局的承包商Ben Feist和David Charney建造的,他们是国际空间站实时和阿波罗实时的创造者。

在整理国际空间站的数据时,我们意识到与国际空间站上的机组人员进行了大量的问答环节,并开始怀疑:你能问宇航员的每一个问题都已经被问过了吗?

这个档案中的每一个问题都是由一个真实的人说的:一个学生、一个记者或一个好奇的公众。每个问题都在轨道上得到了现场回答。该档案馆从美国国家航空航天局互联网档案馆的公共视频库中提取了数百小时的素材。

现代人工智能工具使将这些数千次记录的交易重新调整为新的用途成为可能。你可以用自己的话描述你好奇的事情,而不是一个接一个地浏览视频,搜索引擎会找到有史以来最接近的真实问题。然后,它会让你直接跳到录音中的那一刻。

匹配完全在您的浏览器中使用本地AI模型完成,因此任何搜索查询都不会离开您的设备。

运作原理
建立这个档案需要组装一个管道,该管道可以自动筛选数千小时的美国国家航空航天局镜头,确定真正的问题在哪里被问到和回答,并使每个交换都可以通过意义而不是关键字进行搜索。以下是每个阶段的工作原理。

1.发现视频
美国国家航空航天局的约翰逊航天中心定期将录像上传到互联网档案馆,这是一个公共的非营利性数字图书馆。自定义采集器扫描档案馆的API,为NASA JSC公共事务办公室上传的每一段视频收集元数据——标题、描述、文件名和主题标签。这产生了数千个候选录音的目录。

2.确定问答环节
这些镜头大多不是我们需要的:火箭发射、太空行走回放、机组人员抵达仪式。在下载任何内容之前,每个视频的元数据都会被馈送到本地运行的大型语言模型(gemma3:12b),该模型决定录制内容是否可能包含与宇航员的真实问答环节。首先使用关键字规则和国际空间站机组人员姓氏数据库过滤掉与国际空间站内容(阿波罗任务、阿尔忒弥斯发射、哈勃望远镜操作)相反的强烈信号视频,因此LLM只需要评估真正模糊的情况。

3.转录和说话者识别
剩下的视频由WhisperX下载和处理,WhisperX是一个基于OpenAI Whisper模型的高精度语音转文本系统,通过强制音素对齐来产生精确到几分之一秒的单词级时间戳。在转录开始之前,多点语言检测通道会对每个文件中的多个位置(而不仅仅是开头几秒钟)的音频进行采样,以可靠地检测非英语内容并跳过它。然后应用说话者日记化,用说话者ID标记每个片段,这对下一步至关重要。

4.提取问题和答案
从原始成绩单中提取问答对比听起来更难。采用两步法。在第一轮中,轻量级文本规则扫描每个转录片段中的问号和疑问词,生成候选锚点列表。在第二轮中,围绕每个候选人的一个聚焦上下文窗口(大约20秒前和90秒后)被发送到LLM,并突出显示候选人。法学硕士回答了一个狭窄的问题:这是一个针对宇航员的真实问题,并得到了不同演讲者的回应吗?如果是,它将返回问题和答案的精确开始和结束时间戳。这些独立的调用在整个记录中并行运行,以保持处理时间的合理性。

5.建立搜索索引
一旦提取了所有问答对并打上了时间戳,每个问题都会使用全MiniLM-L6-v2句子转换模型转换为语义嵌入——一个由384个数字组成的列表,对句子的含义进行编码。嵌入使用16位浮点数存储在紧凑的二进制文件中。结果是网站附带的一小部分静态文件:一个文件中包含问题文本和视频时间戳,另一个文件包含原始嵌入向量。

6.在浏览器中搜索
当您键入查询时,编译为WebAssembly的全MiniLM-L6-v2模型完全在您的浏览器选项卡中运行。它将您的查询转换为匹配的384维嵌入,并计算每个存储问题的余弦相似度。最接近的匹配项会立即返回,而不会向服务器发送任何搜索查询。

在线网址:https://askanastronaut.issinrealtime.org/

声明:本站所有文章,如无特殊说明或标注,均为本站原创发布。任何个人或组织,在未征得本站同意时,禁止复制、盗用、采集、发布本站内容到任何网站、书籍等各类媒体平台。如若本站内容侵犯了原著者的合法权益,可联系客服QQ3387285338进行处理。