# 信息收集方法论 ## 1. 两层信息收集 darkline 的信息收集分两层: ### 广撒网层 目标是扩大信息覆盖,尽量收集可能形成拓扑结构的叶子。 适合交给爬虫、数据清洗或自动化流程。 广撒网只做: ```text 收集 去重 抽字段 保留原始来源 初步归类 ``` 不做: ```text 判断暗线成立 判断输出层结果 生成最终结论 ``` ### 暗线追踪层 目标是围绕一条高价值暗线补关键节点。 适合由分析者或专门 AI 点对点执行。 追踪层只追关键证据,不追无关新闻数量。 ## 2. 关键节点优先 信息不是越多越好。优先级如下: | 优先级 | 类型 | 用途 | | --- | --- | --- | | P0 | 官方文件、直接公告、原始会议、权威披露 | 验证关键节点 | | P1 | 权威媒体、主体官网、公开访谈、正式报告 | 强侧证 | | P2 | 行业文章、二级转载、数据整理 | 背景补充 | | P3 | 传言、自媒体、模糊说法 | 只进 review | ## 3. 广撒网最低字段 每条信息至少保留: ```text source_id source_title source_url_or_path source_type publish_time available_time actor_list target_object_list event_type event_level_guess raw_excerpt source_hash ``` ## 4. 专线追踪最低字段 进入专线追踪后,必须补: ```text darkline_hypothesis_id expected_line_id event_node_id evidence_id why_question why_hypothesis evidence_to_check current_answer unresolved_gap alternative_explanation confidence_change ``` ## 5. 去重规则 重复转载不能重复增信。 去重时至少看: ```text 同一标题或高度相似标题 同一来源原文 同一主体 同一事件时间 同一核心事实 同一引用链 ``` 同源转载保留来源,但只算一个事实节点。 ## 6. 时间锚规则 必须区分: ```text event_date:事件发生时间 publish_time:来源发布时间 available_time:分析者能看到的时间 observed_time:系统或模型观察到的时间 inferred_start_window:反推的暗线开始窗口 ``` 不能把反推开始时间当作当时可见信息。 ## 7. 收集完成检查 每次收集结束检查: ```text 原始来源是否保留 available_time 是否存在 是否做了同源去重 是否能挂到 hypothesis / expected_line / event_node 是否记录了替代解释 是否记录了缺口 是否可以被另一个人复查 ```