From 48875e6c21d6e3445add5a511e44fec85c18e43e Mon Sep 17 00:00:00 2001 From: fxy Date: Tue, 16 Jun 2026 21:15:02 +0800 Subject: [PATCH] =?UTF-8?q?hotfix=20batch:=20ctime/=E6=9D=A5=E6=BA=90?= =?UTF-8?q?=E6=81=A2=E5=A4=8D/=E9=98=85=E8=AF=BB=E6=97=B6=E9=95=BF/selecto?= =?UTF-8?q?r=E6=9D=83=E9=87=8D=20+=20daily=20log=E5=AE=8C=E6=95=B4?= =?UTF-8?q?=E7=89=88?= MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit --- CHANGELOG.md | 34 ++++++++++++++++++++++++++++ daily/2026-06-16.md | 54 ++++++++++++++++++++++++++++----------------- 2 files changed, 68 insertions(+), 20 deletions(-) diff --git a/CHANGELOG.md b/CHANGELOG.md index 3ad96d2..5f229a4 100644 --- a/CHANGELOG.md +++ b/CHANGELOG.md @@ -165,3 +165,37 @@ NYT, CNN, Al Jazeera, TechCrunch, BBC, The Guardian, CNBC, Bloomberg 每轮 ~300条 **中英文源合并后每轮:~500条 → RAW存档 → 精选80条** + +### Hotfix Batch 2026-06-16-2 — 修复三项数据问题 + +#### ① 新浪头条published为空修复 +- **问题**:新浪API返回的`ctime`是字符串`"1781604459"`而非数字,代码中`isinstance(ctime, (int, float))`判定False, + `published`字段全为空 → selector无时效加分 → 10条新浪头条全部落选,中国热点只有新华网 +- **修复**:`local_fetch_cn.py` → `int(ctime)`转换字符串时间戳 +- **效果**:新浪-头条10条全部入选精选池,中国热点恢复正常 + +#### ② 新闻来源被AI改写修复 +- **问题**:summarize_news.py调用DeepSeek后,AI把`新浪-头条`改写为`新浪财经` +- **修复**:新增`build_source_lookup()` + `restore_source()`,AI输出后按标题匹配恢复原始来源名 +- **效果**:中国热点中新浪头条正确显示为"新浪-头条",而非"新浪财经" + +#### ③ 微信读书阅读时长单位错误修复 +- **问题**:WeRead API返回的`readingTime`单位是秒,代码当作分钟处理,15分钟读书记录显示为"15小时" +- **修复**:`sync.py` → `read_seconds // 60`转分钟 +- **效果**:GitHub入门与实践:30小时24分钟→30分钟;Python编程:471小时→7小时51分钟 + +#### ④ 时间显示格式修复 +- **问题**:今日新闻在摘要中只显示`HH:MM`无日期前缀 +- **修复**:`summarize_news.py` → 始终输出`MM-DD HH:MM`格式 +- **效果**:所有条目统一显示`06-16 10:07`,跨日可辨 + +#### ⑤ selector权重优化 +- **问题**:selector.py缺少新增非RSS源(新浪、观察者网、人民网)的权重,主题上限固定3条导致国内热点被筛 +- **修复**:新增SOURCE_WEIGHTS条目(新浪-头条1.3最高),主题上限改为差异化配置,中国热点主题放宽至2x +- **效果**:中文精选从单一新华网变为新浪+新华网+观察者网混合 + +**涉及文件:** +- local_fetch_cn.py — ctime类型修复 +- selector.py — 新源权重 + 主题差异化上限 +- summarize_news.py — 来源恢复逻辑 + 时间格式修复 +- sync.py — 阅读时长秒→分钟 diff --git a/daily/2026-06-16.md b/daily/2026-06-16.md index 04fa983..89c7ad2 100644 --- a/daily/2026-06-16.md +++ b/daily/2026-06-16.md @@ -1,29 +1,43 @@ -# 运维日志 2026-06-16 +# 运维日志 2026-06-16(完整版) -## 今日核心变更 +## 一、新闻体系全面改造 -### 1. 新闻扩源 + RAW分层(v0.4) -- 东京新增5源:BBC, Guardian, CNBC, FT中文, Bloomberg -- 本地清理失效源,保留新华网+微博 -- 全量->RAW ndjson存档,精选80条->AI摘要 -- 成果:424条/轮 → RAW全存 + 80条精选 -- token月费不变(~¥20) +### 中文新闻源 v3.0(17:30) +本地 local_fetch_cn.py 全面重写: +- 移除所有国产RSS(全线死亡) +- 新增5路非RSS抓取:新浪API(40条)、新华网频道页(61条)、人民网栏目页(31条)、观察者网(50条)、微博(30条) +- 中文源合计 ~207条/轮 +- 全部自带日期标记(URL提取/Api时间戳) -### 2. 行情数据采集(新线) -- fetch_market_daily.py 上线 -- 31品种日线:指数10+汇率6+数字货币12+宏观3 -- 0 token消耗,~200KB/年 +### Hotfix Batch(18:00~21:00) +- ctime字符串→int(新浪发布时间修复) +- 来源AI改写修复(build_source_lookup + restore_source) +- 阅读时长秒→分钟(sync.py read_seconds // 60) +- 时间格式统一 MM-DD HH:MM +- selector权重优化:新浪头条1.3,主题上限差异化 + +### 国际源(东京12源) +NYT/CNN/BBC/Guardian/CNBC/Bloomberg/Al Jazeera/TechCrunch + 36氪/FT中文 +每轮 ~296条 + +### 分层方案 +501条/轮 → RAW全部存档 → selector精选80条 → AI摘要 + +## 二、行情采集系统上线 +- fetch_market_daily.py — 31品种每日OHLCV +- 指数10 + 汇率6 + 数字货币12 + 宏观3 +- 0 token消耗,年增量<200KB - crontab 50 23 * * * -### 3. 今日卡片产出 -- 00: 正反馈飞轮_智能体协作模式 -- 01: 项益鸣课程总结 -- 02: 个人数字体系全景 -- 03: 素材积累与AI能力的辩证关系 -- 04: 行情数据采集方案_双轨归档 +## 三、今日卡片产出(5篇) +1. 00_正反馈飞轮_智能体协作模式 +2. 01_项益鸣课程总结 +3. 02_个人数字体系全景 +4. 03_素材积累与AI能力的辩证关系 +5. 04_行情数据采集方案_双轨归档 -### 涉及仓库 +## 四、涉及仓库 - server-ops: CHANGELOG + daily log -- daily-brief: fetch_market_daily.py, archive_daily_brief.py, raw/ (首次存档), market_data/ (首次31个CSV) +- daily-brief: fetch_market_daily.py + archive_daily_brief.py + raw/ + market_data/ - inspiration-collector: 5篇卡片 - Claw工作空间: 完整工作日志