edit | blame | history | raw

信息收集方法论

1. 两层信息收集

darkline 的信息收集分两层:

广撒网层

目标是扩大信息覆盖,尽量收集可能形成拓扑结构的叶子。

适合交给爬虫、数据清洗或自动化流程。

广撒网只做:

收集
去重
抽字段
保留原始来源
初步归类

不做:

判断暗线成立
判断输出层结果
生成最终结论

暗线追踪层

目标是围绕一条高价值暗线补关键节点。

适合由分析者或专门 AI 点对点执行。

追踪层只追关键证据,不追无关新闻数量。

2. 关键节点优先

信息不是越多越好。优先级如下:

优先级 类型 用途
P0 官方文件、直接公告、原始会议、权威披露 验证关键节点
P1 权威媒体、主体官网、公开访谈、正式报告 强侧证
P2 行业文章、二级转载、数据整理 背景补充
P3 传言、自媒体、模糊说法 只进 review

3. 广撒网最低字段

每条信息至少保留:

source_id
source_title
source_url_or_path
source_type
publish_time
available_time
actor_list
target_object_list
event_type
event_level_guess
raw_excerpt
source_hash

4. 专线追踪最低字段

进入专线追踪后,必须补:

darkline_hypothesis_id
expected_line_id
event_node_id
evidence_id
why_question
why_hypothesis
evidence_to_check
current_answer
unresolved_gap
alternative_explanation
confidence_change

5. 去重规则

重复转载不能重复增信。

去重时至少看:

同一标题或高度相似标题
同一来源原文
同一主体
同一事件时间
同一核心事实
同一引用链

同源转载保留来源,但只算一个事实节点。

6. 时间锚规则

必须区分:

event_date:事件发生时间
publish_time:来源发布时间
available_time:分析者能看到的时间
observed_time:系统或模型观察到的时间
inferred_start_window:反推的暗线开始窗口

不能把反推开始时间当作当时可见信息。

7. 收集完成检查

每次收集结束检查:

原始来源是否保留
available_time 是否存在
是否做了同源去重
是否能挂到 hypothesis / expected_line / event_node
是否记录了替代解释
是否记录了缺口
是否可以被另一个人复查