darkline 的信息收集分两层:
目标是扩大信息覆盖,尽量收集可能形成拓扑结构的叶子。
适合交给爬虫、数据清洗或自动化流程。
广撒网只做:
收集
去重
抽字段
保留原始来源
初步归类
不做:
判断暗线成立
判断输出层结果
生成最终结论
目标是围绕一条高价值暗线补关键节点。
适合由分析者或专门 AI 点对点执行。
追踪层只追关键证据,不追无关新闻数量。
信息不是越多越好。优先级如下:
| 优先级 | 类型 | 用途 |
|---|---|---|
| P0 | 官方文件、直接公告、原始会议、权威披露 | 验证关键节点 |
| P1 | 权威媒体、主体官网、公开访谈、正式报告 | 强侧证 |
| P2 | 行业文章、二级转载、数据整理 | 背景补充 |
| P3 | 传言、自媒体、模糊说法 | 只进 review |
每条信息至少保留:
source_id
source_title
source_url_or_path
source_type
publish_time
available_time
actor_list
target_object_list
event_type
event_level_guess
raw_excerpt
source_hash
进入专线追踪后,必须补:
darkline_hypothesis_id
expected_line_id
event_node_id
evidence_id
why_question
why_hypothesis
evidence_to_check
current_answer
unresolved_gap
alternative_explanation
confidence_change
重复转载不能重复增信。
去重时至少看:
同一标题或高度相似标题
同一来源原文
同一主体
同一事件时间
同一核心事实
同一引用链
同源转载保留来源,但只算一个事实节点。
必须区分:
event_date:事件发生时间
publish_time:来源发布时间
available_time:分析者能看到的时间
observed_time:系统或模型观察到的时间
inferred_start_window:反推的暗线开始窗口
不能把反推开始时间当作当时可见信息。
每次收集结束检查:
原始来源是否保留
available_time 是否存在
是否做了同源去重
是否能挂到 hypothesis / expected_line / event_node
是否记录了替代解释
是否记录了缺口
是否可以被另一个人复查