代表性分子:植物免疫信号分子与植物来源黄酮,仅作结构展示
方向 1 · 作物
作物保护与绿色农用化学品
面向病虫草害防治的活性小分子发现,兼顾活性、选择性与环境行为。
卡在哪、能做到哪一步、需要什么数据
能做的事
- 靶标筛选与结合模式分析
- 先导化合物生成与结构优化
- 构效关系建模与活性预测
- 成药性与环境行为初筛
这个行业真正卡住的问题
- 抗性上升快,已有品种的有效期在缩短,需要持续补充新骨架
- 选择性要求比医药场景更苛刻——对靶标有效、对非靶标生物和作物本身要安全
- 环境行为(降解、残留、迁移)在早期就要参与排序,不能留到最后再筛
能做到什么程度
能做到把候选空间收敛成一份带排序理由的短名单,并给出结构改造方向;做不到替代田间试验——活性的最终判定只能来自实验。
需要什么数据
靶标结构或序列;已有活性数据(有构效系列最好);可接受的合成路线复杂度与环境行为约束。
关于那个误解
「先用模型筛出一批,再让实验组挨个试」——真正省钱的用法反过来:把实验组已有的失败数据也交给模型,让它先学会你这个体系里什么样的分子不行。负样本往往比正样本更值钱。
补充
这是团队投入时间最长的方向,方法与数据的积累也最厚。
代表性分子:动物与人用的经典抗菌药,仅作结构展示
方向 2 · 动保
动物保健与动物用药物
面向畜禽与水产的抗感染、抗寄生虫与功能性分子设计。
卡在哪、能做到哪一步、需要什么数据
能做的事
- 靶标结构预测与口袋评估
- 候选分子生成与排序
- 已有化合物库的重定位筛选
- 与实验方合作的迭代闭环
这个行业真正卡住的问题
- 公开靶标与活性数据比人用药稀疏得多,很多靶标连结构都没有
- 成本敏感——分子再好,合成路线太贵就用不上
- 休药期与残留限量是硬约束,在设计阶段就得算进去
能做到什么程度
能做到从序列出发预测结构、评估口袋、生成并排序候选;在数据稀疏时能先做数据整理与靶标确认,把「能不能做」这个问题先答了。做不到在无靶标、无活性数据、无表型数据的情况下凭空给出候选。
需要什么数据
目标病原或宿主靶标的序列;任何已有的活性或表型数据;成本与休药期方面的约束条件。
关于那个误解
方法可以从人用药搬过来,数据搬不了——这个方向的公开数据量小一个量级,直接套用会得到一个在训练集上很漂亮、换个体系就失效的模型。所以通常先做一轮数据可行性判断,再决定用哪一档方法。
补充
该方向的公开数据与已知靶标相对稀疏,通常需要先做数据整理与靶标确认。
方向 3 · 天然
天然产物与中药现代化
从复杂体系里把「哪一个成分、作用在哪」变成可验证的假设。
代表性分子:三个天然产物来源的分子,仅作结构展示
卡在哪、能做到哪一步、需要什么数据
能做的事
- 成分—靶标关联预测
- 活性成分优先级排序
- 复方与多组分作用网络分析
- 结构衍生化建议
这个行业真正卡住的问题
- 成分数以百计,逐个做实验做不完,需要一个可辩护的优先级
- 「多成分多靶点」这句话很容易变成什么都没说,需要落到具体的可验证假设
- 申报与发表都要求证据链闭合,光有网络图不够
能做到什么程度
能做到把一个复方或提取物收敛成「哪几个成分、可能作用在哪几个靶标、下一步该测什么」的假设清单,并给出每条假设的置信依据。做不到替代药效学验证,也不承接功效宣称相关的合规事务。
需要什么数据
成分清单或指纹图谱;已有的药效或表型观察;希望解释的具体功效或适应症范围。
关于那个误解
网络药理学的那张图不是结论,是假设生成器——它的价值取决于后面有没有人真的按它去做实验。所以交付的不是图,是一份按可验证性排过序的假设清单,每条都写清楚「怎么证伪」。
补充
这条线的价值往往不在发现新分子,而在把既有经验转成可发表、可申报的证据链。
方向 4 · 医药
生物医药与创新药物
面向明确靶标的小分子发现,以及蛋白结构与相互作用的计算支持。
卡在哪、能做到哪一步、需要什么数据
能做的事
- 蛋白结构预测与建模
- 虚拟筛选与分子生成
- 结合自由能与选择性评估
- 合成路线可及性分析
这个行业真正卡住的问题
- 同靶标竞争激烈,差异化要在专利空间里找,不只是活性高低
- 选择性与脱靶风险要在早期评估,晚了代价成倍上升
- 计算结论要经得起内部与外部的双重追问,一个总分说服不了人
能做到什么程度
能做到发现阶段的计算工作:结构建模、虚拟筛选、分子生成、结合模式与选择性评估、合成可及性分析。不承接临床、注册申报与合规咨询——那是另一套专业,我们不做。
需要什么数据
靶标结构或序列;已知活性与选择性数据;专利与化学空间方面的规避要求(有则一并给)。
关于那个误解
「算得越准越好」在粗筛阶段是错的:一个便宜但排序稳定的方法,比一个昂贵但只能算十个分子的方法有用得多。方法选型的第一问不是精度,是「这一步要在多大的集合上做决定」。
补充
不承接临床与注册相关事务,只做发现阶段的计算工作。
方向 5 · 政务
政务与科研数据工程
把分散的数据变成能授权、能留痕、能被验收的系统。
卡在哪、能做到哪一步、需要什么数据
能做的事
- 数据目录与权限矩阵设计
- 授权运营与审批流实现
- 运行看板与审计留痕
- 验收材料与操作手册
这个行业真正卡住的问题
- 数据散在多个部门与系统里,权属与更新责任说不清
- 「能不能给」这个问题没有可执行的判据,于是要么全不给要么一给到底
- 验收时被问到流程与留痕,答不上来「谁批的、什么时候批的」
能做到什么程度
能做到数据目录、权限矩阵、审批流、审计留痕与运行看板的完整实现,并按验收口径组织支撑材料。做不到替你方做数据权属的法律认定——那需要主管部门与法务给口径,我们据此实现。
需要什么数据
数据来源清单与更新方式;需要区分的角色与审批环节;主管部门的验收口径(有文件最好)。
关于那个误解
这类项目不是前端项目。真正的工作量在「谁能看什么、谁批准、出了事查得到谁」这套账上——它决定了系统能不能过验收,而它必须在写代码之前就确认成一张表。
补充
这条线的交付重点是流程与留痕,不是算法。
每个方向能接几条服务线
主力方向与可承接合计;空白格不勉强承接。
三档的口径
本表是各条服务线在各行业方向上的适用性自述,不是案例数量,也不是成功率。「主力方向」指方法与数据积累最厚、可直接给出交付物与周期;「可承接」指方法通用但需先做一轮数据与可行性确认;空白格表示这条服务线在该行业没有对应的交付形态,不勉强承接。
不在这 5 个方向里
这些方向是投入最多的地方,不是能力的边界。
反过来的情况
上面5个方向只是目前投入最多的地方,不是能力的边界。
如果一个方向连「候选空间是什么、判据是什么」都还说不清楚,那多半不是缺算法,是缺一轮问题定义。这种情况第一步应该是坐下来聊,不是先立一个项目。