Original Note

面向中文临床诊断标准化的语义边界评测与等价性判别方法研究 - Read

面向中文临床诊断标准化的语义边界评测与等价性判别方法研究

最后更新:2026-06-26

0. 版本说明

本文档是 面向中文临床术语标准化研究计划_v2.3.md 的 v2.4 版本。

v2.3 已经完成了关键转向:从“中文版本 CoRTEx”或“训练医学 embedding”转向 benchmark + method + generalization。v2.4 不再继续扩大方法模块,而是进一步收紧论文逻辑:本课题的核心不是提出一个全新的 biomedical entity linking 模型,而是研究 strong baseline 下中文临床诊断标准化的剩余语义边界错误,并检验能否用等价性判别导向的训练和重排减少这类错误。

v2.4 的主要变化:

  • 将论文贡献优先级明确为:boundary-focused evaluation > locked boundary set > equivalence-oriented method > generalization analysis
  • 将方法主线从“加 definitions / semantic types / hard negatives”改写为 从 relevance ranking 到 equivalence discrimination 的问题重构
  • 加入更硬的 go/no-go 决策门槛,避免在证据不足时继续包装为高 novelty 方法论文。
  • 将预期论文层级写成条件结果,而不是默认目标。
  • 将降级路线提前内置到研究计划中:如果方法不强但 benchmark 扎实,转为 benchmark/error analysis paper;如果 boundary errors 不成立,转向候选库覆盖率、拒识或资源工作。

一句话定位:

Strong retrieval and reranking models may rank medically related Chinese diagnosis candidates highly, but clinical normalization requires equivalence rather than topical relevance. This project builds a boundary-focused evaluation protocol and locked Chinese clinical boundary set, then tests whether equivalence-oriented boundary-aware retrievers or rerankers can reduce semantically related but non-equivalent errors under strong baselines and cross-source evaluation.

中文表述:

本课题研究强通用检索-重排模型在中文临床诊断标准化中将“医学相关性”误判为“标准化等价性”的问题,构建面向语义边界错误的评测协议和 locked boundary test set,并检验 definitions、semantic types 和 boundary-aware hard negatives 是否能通过等价性判别导向的 retriever/reranker 改善 boundary-specific normalization accuracy。

1. 核心判断

1.1 当前课题不是“新模型”优先

本课题不应以“提出一种新的 biomedical entity linking 模型”作为主叙事。原因是:

  • retriever + reranker 已经是成熟范式。
  • hard negatives 已经是表示学习和实体链接中的常见训练信号。
  • definition-enhanced representation 已有 BioLORD 等近邻工作。
  • LLM 生成解释、别名、合成样本和候选排序已有 CoRTEx、SynCABEL、BioELX、BeLink 等近邻工作。
  • Qwen Embedding / Qwen Reranker 等强通用模型已经把普通 retrieval baseline 拉得很高,弱 baseline 上的提升不能说明科研贡献。

因此,方法模块本身不是论文最强卖点。真正可能成立的贡献是:

在中文临床诊断标准化中,系统证明 strong baseline 的 overall metric 掩盖了“医学相关但不等价”的 semantic boundary failure,并通过可复核的 locked boundary benchmark 与 targeted equivalence discrimination 方法验证这种 failure 是否可被减少。

1.2 论文主线应当是 evaluation-first

v2.4 建议将论文写成:

  1. Strong-baseline-centered evaluation 先证明 BM25、BGE-M3、Qwen Embedding、Qwen Reranker 等强 baseline 下仍有稳定的 boundary failure。

  2. Boundary-focused benchmark 构建 semantic boundary taxonomy、annotation guideline、development boundary set 和 locked boundary test set。

  3. Equivalence-oriented method 将 normalization 从“相关候选排序”转为“mention-candidate 等价性判别”,再使用 definitions、semantic types 和 hard negatives 作为辅助信号。

  4. Generalization and failure analysis 检查 public benchmark 与 in-house clinical mentions 是否趋势一致,分析方法在哪些 boundary type 上有效或无效。

这一路线比“提出一个边界感知重排器”更稳,因为它把 novelty 放在问题切分、评测协议和强 baseline 后的可证伪结论上。

2. 目标论文定位

2.1 最合理论文形态

最合理的论文形态不是纯 method paper,而是:

boundary-focused evaluation and targeted method paper for Chinese clinical diagnosis normalization under strong retriever-reranker baselines.

中文可以理解为:

强 baseline 条件下中文临床诊断标准化语义边界错误的评测与针对性等价性判别方法。

论文可以包含方法,但方法必须服务于以下中心假设:

当前模型容易学习医学相关性,而标准化任务真正需要的是等价性。boundary-aware hard negatives、semantic types 和 definitions 的价值,不是泛泛增强语义表示,而是帮助模型区分 related-but-not-equivalent candidates。

2.2 预期贡献排序

如果实验成立,贡献建议按以下顺序写:

  1. Boundary-centered analysis under strong baselines 在中文临床诊断标准化中系统比较 BM25、BGE-M3、Qwen Embedding、Qwen Reranker 等强 baseline,分析 remaining errors 是否集中在 semantic boundary cases。

  2. Boundary-focused evaluation protocol and locked test set 提出 semantic boundary taxonomy、标注规则、排除规则、locked test set 和 boundary-specific metrics,用于评估“医学相关但不等价”的混淆。

  3. Equivalence-oriented boundary-aware reranking/training 将 mention-candidate 匹配建模为等价性判别,使用 definitions、semantic types 和 boundary-aware hard negatives 改善 reranker 或 retriever 的边界判别能力。

  4. Generalization and negative-result reporting 在 public benchmark 与组内真实诊断 mention 上报告 overall 与 boundary subset 指标,并诚实报告增强无效、过度区分或牺牲 overall performance 的情况。

2.3 不应声称的贡献

不应声称:

  • 首次使用 LLM 生成医学术语解释。
  • 首次使用 hard negatives。
  • 首次使用 reranker 或 generative reranker 做 biomedical entity linking。
  • 提出全新 entity linking 范式。
  • 解决完整中文临床术语标准化问题。
  • CHIP-CDN 可以代表全部中文临床标准化场景。
  • LLM 增强对所有术语类型都有稳定收益。
  • 只要方法在 development boundary set 上有效,就能说明具备泛化能力。

2.4 论文层级的条件判断

条件 可能论文形态 现实层级
locked boundary set 规模足够,标注一致性合格,方法在 strong baseline 上有稳定 boundary-specific 增益,并有跨数据源验证 evaluation + method + generalization paper ACL/EMNLP/NAACL FindingsCOLING mainAACL main
boundary benchmark 扎实,方法增益有限但错误分析深入 benchmark / error analysis paper COLINGAACL、biomedical NLP workshop
数据可公开性弱,但组内临床场景价值高,系统评估完整 applied clinical NLP / system paper BIBMAMIA short paper、医疗 NLP workshop
boundary errors 不稳定,主要问题是候选库缺失或 gold mapping 冲突 resource / data curation paper 应降级,不宜包装为方法论文

当前计划的自然上限不是 ACL/EMNLP main conference。若要接近主会,需要额外形成更强的通用方法抽象、较大规模公开 benchmark,或跨语言/跨知识库的广泛验证。现阶段更现实的高目标是 Findings、COLING 或 AACL。

3. Research Questions and Falsifiable Hypotheses

3.1 Research Questions

RQ1:强 baseline 后,中文临床诊断标准化是否仍存在稳定的 semantic boundary failure?

  • BM25、BGE-M3、Qwen Embedding、Qwen Embedding + Qwen Reranker 的 overall 表现如何?
  • 剩余错误中,多少属于“医学相关但不等价”的 boundary cases?
  • 这些错误是否足够稳定、可人工确认、可复核?
  • 剩余错误是否主要来自模型判别不足,而不是候选库缺失、gold 标注不稳或标准体系冲突?

RQ2:boundary-focused evaluation 是否揭示了 overall metrics 掩盖的问题?

  • Boundary Accuracy、Boundary MRR、confusion reduction rate 是否比 overall Accuracy/MRR 更敏感?
  • 不同 boundary type 的错误分布是否稳定?
  • development boundary set 与 locked boundary test set 是否能区分真实泛化和开发集过拟合?

RQ3:等价性判别导向的方法是否优于普通相关性排序?

  • 将 mention-candidate 匹配显式建模为 equivalence discrimination 是否改善 boundary subset?
  • definitions 是否主要帮助标准名不自解释、长尾表达和临床缩略表达?
  • semantic types 是否主要减少症状、疾病、检查异常、并发症、术后状态等类型混淆?
  • boundary-aware hard negatives 是否主要减少近义非同义、同部位不同疾病、修饰程度不同和上下位粒度混淆?

RQ4:方法增益是否具备跨数据源泛化?

  • 在 CHIP-CDN / CBLUE 与组内真实诊断 mention 上,boundary subset 的趋势是否一致?
  • 如果趋势不一致,差异来自数据分布、候选库、标注体系,还是模型能力?
  • 方法是否引入新的错误,例如过度区分真实同义词、过度依赖 semantic type、牺牲 top-k recall?

3.2 Falsifiable Hypotheses

H1:overall metric 高估系统能力。
即使 Qwen Embedding + Qwen Reranker 的 overall 指标较高,locked boundary test set 上仍会出现明显错误空间。

若 H1 不成立:课题不应继续包装为 semantic boundary 方法论文,应转向候选库覆盖率、拒识或系统评估。

H2:boundary-aware 方法的主要收益应出现在 boundary subset。
如果方法有效,它不一定显著提升 overall metric,但应在 locked boundary test set 上减少相关但不等价的混淆。

若 H2 不成立:方法贡献不足,最多作为错误分析中的负结果或小规模 ablation。

H3:hard negatives 比 ordinary synthetic positives 更接近核心机制。
普通 synthetic positives 更可能提升召回;boundary-aware hard negatives 更可能提升等价性判别。

若 H3 不成立:需要重新评估 boundary-aware training 是否真的解决了核心问题。

H4:locked boundary test set 是主结论的必要条件。
如果增强只在 development boundary set 上有效,不能支撑较高层级投稿。

若 H4 不成立:论文只能降级为 pilot study,不能声称 boundary generalization。

4. Task and Data Setting

4.1 任务边界

第一版任务限定为 术语级中文临床诊断标准化

输入:

  • 中文临床诊断短语。
  • 病历最终诊断中的原始 mention。
  • 组内诊断词表中的非标准表达。

输出:

  • top-k 标准候选。
  • 最终标准概念 ID 或标准名。
  • 可选:none of the above 或候选库外拒识标签。

第一版不做:

  • 完整 NER + entity linking。
  • 全类型临床术语统一标准化。
  • 文档级一致性建模。
  • 大规模术语聚类。
  • 从头训练中文医学大模型。
  • 将上下位关系作为独立建模主任务。

上下位或粒度不一致可以作为重要 boundary type 观察,但第一版不以 hierarchy reasoning 作为主要方法创新。

4.2 数据来源

公开数据:CHIP-CDN / CBLUE

  • 作为公开 benchmark 和可复现实验起点。
  • 用于诊断短语到标准诊断术语的标准化评估。
  • 不应单独包装为完整中文临床术语标准化。

组内真实诊断数据

只有满足以下条件时,才可作为主实验数据:

  • 有 stable gold mapping 或 concept ID。
  • 有标准名、候选库和原始 mention。
  • 允许本地模型推理。
  • 若使用外部 LLM API,已经确认数据合规。
  • 可以进行人工抽样审核或医学专家复核。

如果组内数据只有零散术语、没有 stable mapping,则只能用于候选库建设、错误分析或资源工作,不能支撑 normalization method paper。

4.3 数据划分原则

至少需要四类数据划分:

  • standard train/dev/test split:用于 overall normalization evaluation。
  • development boundary set:用于 taxonomy 修订、方法开发、prompt 调整和 hard negative 设计。
  • locked boundary test set:用于最终 boundary-specific 结论,不能用于训练、prompt 调整、阈值选择或方法选择。
  • cross-source test set:来自另一数据源、另一时间段或组内真实 mention,用于 generalization。

关键要求:

  • locked set 必须在主要方法设计冻结后构造或冻结。
  • 任何测试集 mention 不能反向用于生成 training positives、definitions 或 hard negatives。
  • LLM 生成内容必须记录模型、prompt、采样参数、过滤规则和人工审核比例。
  • 组内临床数据不得在未确认合规前上传到外部 LLM 服务。

5. Boundary Benchmark Design

5.1 Semantic Boundary Taxonomy

类型 定义 例子 论文用途
近义非同义 两个术语医学相关,但不能互相替代 肺部占位 vs 肺癌 核心分析与优化
同部位不同疾病 共享身体部位,但疾病不同 胃炎 vs 胃溃疡 核心分析与优化
修饰或程度不同 主体相同,但程度、阶段、急慢性或病理类型不同 轻度贫血 vs 重度贫血 核心分析与优化
语义类型冲突 mention 与候选属于不同临床类型 胸痛 vs 心绞痛 核心分析与优化
上下位/粒度不一致 一个概念是另一个概念的上位、下位或不同粒度表达 肺炎 vs 细菌性肺炎 统计和案例分析
候选库外相似项 top-k 中没有正确候选,但存在表面相似候选 内部习惯写法被强制映射 拒识分析

第一版以诊断术语为主,因此 semantic type 应优先使用临床诊断内部的实用类型,例如疾病、症状、体征、检查异常、病理状态、并发症、术后状态、既往史状态等,而不是泛化到所有医学实体类型。

5.2 Boundary Sample 字段

投稿版 boundary sample 至少包含:

sample_id
mention
gold_standard_name
gold_concept_id_or_stable_mapping
confusing_candidate_name
confusing_candidate_id
boundary_type
source_dataset
is_gold_in_top10
baseline_rank
baseline_score
error_stage
annotation_note
review_status

建议补充:

semantic_type_gold
semantic_type_candidate
relation_type
annotator_id
reviewer_id
created_from_baseline
locked_split

error_stage 建议至少区分:

  • retrieval_failure:正确候选未进入 top-k。
  • ranking_failure:正确候选进入 top-k,但错误候选排名更高。
  • decision_failure:排序可接受,但最终标准化决策错误。
  • data_or_annotation_issue:候选库、gold mapping 或标准体系问题。

5.3 标注规则

  • Inclusion rule:只有当 confusing candidate 与 mention 医学相关但不能等价映射时,才标为 boundary case。
  • Exclusion rule:候选库缺失、gold 标注错误、标准体系冲突、明显拼写噪声等问题单独记录,不直接归入模型 boundary error。
  • Primary label rule:主分析只使用一个 primary boundary type,允许在 note 中记录次要标签。
  • Priority rule:若样本命中多类,优先级为 语义类型冲突 > 修饰或程度不同 > 同部位不同疾病 > 近义非同义 > 上下位/粒度不一致
  • Consistency rule:投稿版必须报告双人标注一致性或医学专家复核流程;若一致性不足,应将 taxonomy 稳定性作为主要风险。
  • Leakage rule:locked boundary test set 不能参与 prompt 调整、hard negative mining、阈值选择或错误驱动方法设计。

5.4 目标规模与最低门槛

最低可行规模:

  • pilot boundary set:200-400 条人工确认 boundary cases。
  • locked boundary test set:至少 200 条。
  • 每个核心 boundary type 至少有可解释案例;样本不足者不做强统计。

投稿目标规模:

  • 总 boundary cases:800-1500 条。
  • locked boundary test set:不少于 300-500 条。
  • 每类核心 boundary type 尽量保证可报告样本数。
  • 标注一致性或专家复核流程清楚。

如果无法达到最低规模,论文定位应降级为 pilot error analysis,而不是 method paper。

6. Equivalence-Oriented Boundary-Aware Method

6.1 方法核心:从相关性排序到等价性判别

普通 retriever/reranker 擅长把医学相关候选排在前面,但 clinical normalization 要求判断:

mention 与 candidate 是否可以映射到同一个标准概念。

因此,本课题的方法不应写成简单的 + definition+ semantic type+ hard negatives,而应写成:

equivalence-oriented boundary-aware ranking: learn to distinguish equivalent clinical diagnosis mappings from semantically related but non-equivalent candidates.

对应中文表述:

等价性判别导向的边界感知排序:模型不仅要识别候选是否医学相关,还要判断 mention 与候选是否能作为同一标准概念使用。

6.2 方法框架

  1. Candidate generation 使用 BM25、BGE-M3、Qwen Embedding、SapBERT-style retriever 生成 top-k 标准候选。

  2. Strong system baseline 使用 Qwen Embedding + Qwen Reranker 作为必须超过或解释的强系统 baseline。

  3. Candidate enrichment 为候选标准诊断概念补充短定义、标准名说明、semantic type 和必要别名。该步骤的目标不是生成更多文本,而是补足标准名无法表达的边界信息。

  4. Boundary-aware negative construction 从高分错误候选、同部位不同疾病、近义非同义、修饰程度不同和类型冲突中构造 hard negatives。

  5. Equivalence discrimination 在 retriever fine-tuning、cross-encoder reranking 或 auxiliary classifier 中显式判断 mention-candidate 是否等价。

  6. Decision calibration 在数据允许时加入 none of the above,检查系统是否能拒绝候选库外或不稳定 mapping,而不是强制映射。

6.3 样本格式

训练或重排样本可组织为:

mention
candidate_standard_name
candidate_definition
candidate_semantic_type
candidate_aliases_optional
equivalence_label
boundary_type_if_negative
source_dataset

其中:

  • equivalence_label = 1 表示 mention 与 candidate 可映射到同一标准概念。
  • equivalence_label = 0 表示医学相关但不等价,或候选库外拒识样本。
  • candidate_definitionsemantic_type 不能从测试 gold 反向构造。
  • generated definitions 必须抽样人工检查,并记录错误率。

6.4 方法强度分层

Minimal method

  • 不训练新模型。
  • 在 Qwen Reranker 输入中加入 candidate definition 和 semantic type。
  • 观察 boundary subset 是否改善。

Medium method

  • 使用 boundary-aware hard negatives 微调 retriever 或 reranker。
  • 加入 pairwise 或 binary equivalence discrimination objective。
  • 做 locked test set 消融。

Strong method

  • 同时训练 retriever 和 reranker。
  • 加入 cross-source validation。
  • 加入 none-of-the-above 或 calibration 分析。
  • 对错误类型做显著性检验和置信区间。

当前计划应优先完成 minimal 和 medium method。strong method 是投稿增强项,不应作为早期可行性判断前提。

6.5 消融顺序

核心消融顺序:

  1. BM25
  2. BGE-M3
  3. Qwen Embedding
  4. Qwen Embedding + Qwen Reranker
  5. + candidate definition
  6. + semantic type
  7. + boundary-aware hard negatives
  8. + equivalence discrimination objective
  9. + full boundary-aware system

每一步必须回答:

  • overall metric 是否变化。
  • boundary subset 是否变化。
  • 哪类 boundary error 改善。
  • 是否牺牲 top-k recall。
  • 是否引入过度区分、过度拒识或类型依赖。
  • 改善是否出现在 locked boundary test set。
  • 改善是否能在 cross-source test set 上复现。

7. Evaluation Protocol

7.1 Overall Metrics

总体标准化指标:

  • Recall@1。
  • Recall@5。
  • Recall@10。
  • MRR。
  • Accuracy。

这些指标用于确认系统基础能力,但不能单独证明 boundary-aware method 有效。

7.2 Boundary Metrics

Boundary-specific 指标:

  • Boundary Accuracy。
  • Boundary MRR。
  • confusion reduction rate。
  • hard negative discrimination accuracy。
  • semantic-type conflict accuracy。
  • none-of-the-above rejection accuracy。

建议报告:

  • overall vs boundary subset。
  • development boundary set vs locked boundary test set。
  • public benchmark vs in-house clinical mentions。
  • 每类 boundary type 的样本数和指标。
  • retrieval failure、ranking failure、decision failure、data issue 的比例。

7.3 统计与可信度

投稿版实验至少需要:

  • 对主要指标报告 bootstrap confidence interval 或显著性检验。
  • 对 boundary set 报告标注一致性或专家复核流程。
  • 对小样本 boundary type 只做案例分析,不做过度统计解释。
  • 报告 negative results。
  • 报告增强是否损害 overall performance。
  • 避免只展示成功案例。

7.4 成功标准

较强投稿版本应满足多数条件:

  • 强 baseline 的 overall 指标较高,但 locked boundary subset 仍有明显错误空间。
  • locked boundary test set 上至少一种 equivalence-oriented 方法稳定优于 Qwen Embedding + Qwen Reranker。
  • 增益能对应到具体 boundary type,而不只是 overall metric 的小波动。
  • public benchmark 与 in-house 数据趋势基本一致,或差异可解释。
  • 方法没有明显牺牲 top-k recall 或 overall accuracy。
  • 标注一致性或专家复核足以支撑 taxonomy 结论。

如果只在 development boundary set 上有效,不能作为主结论。

8. Go / No-Go Pilot

8.1 0-8 周必须回答的问题

前 0-8 周应作为硬性可行性验证,而不是普通准备阶段。

必须回答:

  1. 是否有可用的诊断标准化数据和稳定候选库。
  2. Qwen Embedding + Qwen Reranker 后是否仍存在足够多 boundary errors。
  3. 这些 boundary errors 是否能被人工稳定标注。
  4. 是否能构造不参与开发的 locked boundary test set。
  5. minimal method 是否在 boundary subset 上显示任何有效信号。

8.2 Go 条件

满足多数条件才继续按 v2.4 投稿路线推进:

  • 强 baseline 后,人工审核错误中有明显比例属于 boundary cases。
  • 能在 0-8 周内确认 200-400 条 pilot boundary cases。
  • 至少能预留 200 条 locked boundary test cases。
  • 标注一致性或专家复核结果可接受。
  • minimal 或 medium method 在 development boundary set 上有方向性改善。
  • 数据合规和候选库稳定性没有硬障碍。

8.3 No-Go 条件

出现以下情况,应停止包装为 semantic boundary method paper:

  • Qwen Reranker 已解决绝大多数 boundary errors。
  • 剩余错误主要是候选库缺失、gold mapping 冲突或标准体系不一致。
  • boundary taxonomy 主观性太强,标注一致性低。
  • locked boundary set 无法独立构造。
  • 方法只在开发集有效,locked set 无改善。
  • 增强显著损害 overall performance 或 top-k recall。

8.4 转向条件

发现 应转向
boundary errors 不足 候选库覆盖率、召回增强、拒识
标注不稳定 taxonomy pilot、annotation guideline、error analysis
方法无效但 benchmark 扎实 benchmark/error analysis paper
组内数据 mapping 不稳定 术语库清洗、资源建设、候选库构建
public 与 in-house 差异很大 cross-source robustness / dataset shift analysis

9. Risk Analysis

9.1 数据风险

  • 组内数据没有 stable gold mapping 或 concept ID。
  • CHIP-CDN 的任务形式不足以支撑更广义的中文临床诊断标准化结论。
  • 真实 clinical mentions 不能公开,导致可复现性弱。
  • 外部 LLM API 使用受限,影响解释和合成样本生成。

控制策略:

  • 公开 benchmark 作为最小复现基础。
  • 组内数据作为泛化验证或案例分析,不强行作为唯一主数据。
  • 对所有不能公开的数据报告字段、规模、标注流程和脱敏策略。
  • 优先本地模型处理组内临床数据。

9.2 问题风险

  • strong baseline 后 boundary errors 不够多。
  • boundary taxonomy 不稳定。
  • 错误主要来自标准体系或候选库,而非模型可学习边界。

控制策略:

  • 先做 go/no-go pilot。
  • 将 data issue 与 model boundary error 严格分开。
  • 不把所有错误都塞进 semantic boundary。

9.3 方法风险

  • definitions、semantic types、hard negatives 只在 development set 有效。
  • 方法提升 boundary accuracy 但损害 overall accuracy。
  • 方法与 CoRTEx、BioLORD、SynCABEL、BioELX、BeLink 区分不清。

控制策略:

  • 方法叙事改为 equivalence discrimination,而不是模块堆叠。
  • locked test set 和 cross-source test set 作为主结论依据。
  • 报告 negative results 和失败案例。

10. 12-15 Month Roadmap

0-2 个月:Go / No-Go Pilot

任务:

  • 获取 CHIP-CDN / CBLUE 中诊断标准化相关数据。
  • 确认组内真实诊断数据是否有 stable gold mapping。
  • 构建候选库初版。
  • 跑 BM25、BGE-M3、Qwen Embedding、Qwen Embedding + Qwen Reranker。
  • 人工审核 100-200 个 strong baseline 错误。
  • 判断 boundary errors 是否足够多且可稳定标注。

产出:

  • 数据可用性报告。
  • strong baseline 表。
  • 初始 boundary error 样本池。
  • go/no-go 决策。

2-5 个月:Boundary Benchmark

任务:

  • 制定 boundary annotation guideline。
  • 构建 development boundary set。
  • 在方法设计冻结后构建 locked boundary test set。
  • 加入组内真实 mention 或另一来源作为 cross-source evaluation。
  • 完成双人标注或专家复核。

产出:

  • semantic boundary taxonomy。
  • annotation guideline。
  • development boundary set。
  • locked boundary test set。
  • 标注一致性或复核报告。

5-8 个月:Equivalence-Oriented Method

任务:

  • 构建 candidate definitions、semantic types 和 alias 信息。
  • 构造 boundary-aware hard negatives。
  • 设计 minimal method 和 medium method。
  • 微调 retriever 或 reranker。
  • 加入 equivalence discrimination objective。

产出:

  • boundary-aware retriever/reranker 初版。
  • development set ablation。
  • 生成数据质量抽样报告。

8-11 个月:Locked Evaluation and Generalization

任务:

  • 在 locked boundary test set 上复验所有主结果。
  • 比较 public benchmark 与 in-house clinical mentions。
  • 报告 bootstrap confidence interval 或显著性检验。
  • 分析不同 boundary type 的成功与失败。
  • 检查 overall performance、top-k recall 和拒识表现。

产出:

  • 主实验表。
  • boundary-specific result table。
  • failure analysis。
  • cross-source generalization analysis。

11-15 个月:论文写作与投稿

任务:

  • 完成 paper draft。
  • 强化 related work 中与 CoRTEx、BioLORD、SynCABEL、BioELX、BeLink 的区别。
  • 准备匿名化材料、代码、可公开标注指南或数据子集。
  • 根据初稿反馈补充必要实验。
  • 选择投稿目标。

产出:

  • 投稿论文。
  • 实验配置。
  • 可公开资源。
  • 降级投稿备选方案。

11. References

以下文献用于支撑课题定位、baseline 和近邻工作分析。具体结论需以原文为准,不应过度外推。

12. 当前结论

v2.4 的判断比 v2.3 更收紧:

这个课题可以继续,但不能主要押注“方法模块新”。更稳妥、也更真实的主线是:在 strong baseline 下识别中文临床诊断标准化中的 semantic boundary failure,构建 locked boundary evaluation,并检验 equivalence-oriented boundary-aware ranking 是否能减少相关但不等价概念的错误匹配。

第一阶段成败不取决于方法看起来是否复杂,而取决于四件事:

  1. 是否存在足够多、可复核的 boundary errors。
  2. 是否能构建独立 locked boundary test set。
  3. 是否能证明方法在 strong baseline 之上改善 boundary subset。
  4. 是否能在 public benchmark 和组内真实数据之间获得可解释的泛化结论。

如果四点成立,课题可以向 ACL/EMNLP/NAACL FindingsCOLING mainAACL main 努力。
如果方法增益弱但 benchmark 扎实,应降级为 boundary-focused benchmark/error analysis paper。
如果 boundary errors 本身不成立,应及时转向候选库覆盖率、拒识、术语资源构建或数据质量分析。

最重要的原则是:

不要把医学相关性误当成标准化等价性,也不要把开发集错误修补误当成论文级泛化。