本提交包含基础任务与 OpenTrack 前两项内容:
- 基础任务:多查询 BM25 检索、上下文压缩、证据驱动最终回答。
- OpenTrack 工具设计:
decompose_question、verify_claim、salvage_answer。 - OpenTrack Agent 架构:Planner / Searcher / Verifier 三阶段模块化流程。
本提交不包含模型训练相关内容,因此没有提交 sft/、checkpoints/ 或 Adapter 权重。
| Setting | Correct / 50 | Accuracy | Avg tool calls | Avg retrieved docs |
|---|---|---|---|---|
| Basic DeepResearch | 7 | 14.00% | 18.48 | 98.84 |
| OpenTrack DeepResearch | 6 | 12.00% | 18.30 | 97.40 |
基础版准确率超过 12%,可证明基础任务完成。OpenTrack 当前实测准确率为 12%,低于基础版;因此 OpenTrack 部分主要用于展示工具设计与 Agent 架构设计,消融说明见 opentrack/ablation_summary.md。
231300028-滕函-acc=14_0-opentrack/
├── README.md
├── 231300028-滕函-acc=14_0-opentrack.pdf
├── core/
│ ├── deepresearch.ipynb
│ └── agent/
├── eval/
│ ├── 231300028-滕函-submission-acc=14_0.jsonl
│ └── eval.txt
└── opentrack/
├── README.md
├── run.py
├── opentrack_run_eval.ipynb
├── agent/
├── eval/
│ ├── 231300028-滕函-opentrack-submission-acc=12_0.jsonl
│ └── eval.txt
├── ablation_summary.md
└── requirements.txt
先在项目根目录构建 BM25 索引:
python -m agent.build_bm25_index \
--corpus-path ./browsecomp-plus-corpus \
--index-path ./indexes/browsecomp_plus_bm25.sqlite \
--overwrite启动 Qwen3-8B vLLM 服务:
vllm serve ./Qwen3-8B \
--served-model-name qwen_auto \
--enable-auto-tool-choice \
--tool-call-parser hermes \
--trust-remote-code \
--host 0.0.0.0 \
--port 8000打开并依次运行:
core/deepresearch.ipynb
已有基础版提交与评测结果位于:
eval/231300028-滕函-submission-acc=14_0.jsonl
eval/eval.txt
可以打开并运行:
opentrack/opentrack_run_eval.ipynb
也可以直接运行 OpenTrack 推理入口:
python opentrack/run.py \
--dataset browsecomp_plus_hard50.jsonl \
--output opentrack/eval/231300028-滕函-opentrack-submission-acc=12_0.jsonl再评测:
python -m agent.eval \
--submission opentrack/eval/231300028-滕函-opentrack-submission-acc=12_0.jsonl \
--dataset browsecomp_plus_hard50.jsonl \
--model qwen_auto \
--base-url http://127.0.0.1:8000/v1 \
--output opentrack/eval/eval_results.jsonl \
--max-workers 2